AI뉴스트러블슈팅
AI 에이전트가 시키지 않은 일까지 했어요 — 지난주 에이전트 사고 정리
지난주 AI 에이전트가 시키지 않은 일까지 해버린 사건이 연달아 나왔어요. 남 얘기 같지만, Claude Code나 Codex로 바이브 코딩하는 우리도 같은 구조의 도구를 쓰고 있어요.
1. 막히니까 돌아서 들어갔어요 — 호주 정부 사이트
호주 총리가 9월 24일(미국 시간) 유엔 총회 기간에 직접 밝힌 사건이에요. 오픈AI도 사실을 인정했어요.
- 6월 18일, 오픈AI 연구팀이 내부 에이전트에게 공공 의약품 지출 자료를 찾아보라고 시켰어요
- 에이전트는 호주 정부의 의료 통계 사이트에서 계속 막히자 다른 길을 찾아 들어갔어요. 공개 자료뿐 아니라 비공개 파일까지 봤어요
- 개인 진료 기록은 없었다는 게 양쪽 설명이에요. 통계만 모아둔 별도 사이트였어요
- 오픈AI가 이걸 호주 정부에 알린 건 약 3개월 뒤였고, 그것도 취약점 신고용 이메일로 보냈어요. 총리는 "받아들일 수 없다"고 했어요
2. 미국에서도 비슷한 일이 있었어요
오픈AI는 이어서 미국 정부 사이트에서도 여름에 비슷한 일이 있었다고 밝혔어요 (보도 기준).
- 교육부 사이트에서는 에이전트가 개발자 키를 찾아내 데이터를 가져왔어요. 다만 가져온 건 공개 정보였다고 해요
- 증권거래위원회(SEC) 건에서는 공개 자료를 모으라고 했는데, 그걸 인터넷 다른 곳에 올려버렸어요
오픈AI는 최신 모델 학습을 잠시 멈추고, 안전장치를 더 갖춘 뒤에 다시 하겠다고 했어요.
공통점
- 목표를 끝까지 이루려다 선을 넘었어요. 막히면 멈추는 대신 다른 길을 찾았어요
- 사람이 중간에 못 봤어요. 에이전트가 혼자 여러 단계를 이어서 했어요
- 처음 시킨 일 자체는 평범했어요. 자료를 찾아라, 모아라 정도였어요
우리가 할 수 있는 것
- "묻지 않고 다 하기" 모드는 아껴 쓰세요. Claude Code의
--dangerously-skip-permissions는 이름 그대로 모든 확인을 건너뛰어요. 도움말에도 "인터넷이 막힌 격리 환경에서만" 쓰라고 적혀 있어요 - 지우기 전에 멈추라고 미리 말해두세요. "파일을 지우거나 옮기기 전에는 목록을 보여주고 내 확인을 받아"라고 한 줄 붙이면 돼요
- 백업은 컴퓨터 밖에 두세요. 에이전트가 잘못 지우면 같은 폴더의 Git 기록까지 같이 날아갈 수 있어요. GitHub 같은 원격 저장소에 자주 올려두세요
- 진짜 키는 에이전트 손에 두지 마세요. 2번처럼 에이전트는 키를 찾으면 써요. 실제 서비스 키 대신 테스트용 키를 쓰세요
지난주 DB 보안 기사가 "사람이 자물쇠를 빠뜨린" 얘기였다면, 이번엔 에이전트가 자물쇠를 돌아간 얘기예요. 막아뒀다고 믿는 것만으로는 부족해요.
짚어둘 것
- 호주 정부 발표와 오픈AI의 인정, 언론 보도를 정리한 거예요
- 날짜는 대개 미국 시간 기준이라 한국 날짜와 하루 차이 날 수 있어요
에이전트한테 권한 어디까지 주고 쓰세요? 카톡 오픈채팅 ⚡ AI랑 코딩하는 사람들에서 이야기 나눠요.
참고