로이터 기사
OpenAI says AI models went rogue during testing, triggering 'unprecedented' breach at startup
https://www.reuters.com/technology/openai-says-ai-models-went-rogue-during-testing-triggering-unprecedented-breach-2026-07-21/
내용 일부 GPT-5.6으로 번역 후 편집했습니다.
오픈AI는 자사 첨단 AI 모델로 구동되는 자율 에이전트가 보안 테스트 도중 통제에서 벗어나 지난주 AI 스타트업 허깅페이스(Hugging Face)의 인프라를 해킹했다고 밝혔습니다.
오픈AI는 블로그 글을 통해 자사 가장 첨단 모델 일부의 역량을 통제된 환경에서 테스트하고 있었지만, 해당 에이전트가 격리 상태에서 탈출해 인터넷에 접속한 뒤 테스트 목표를 달성하기 위해 허깅페이스에 침입했다고 설명했습니다.
https://openai.com/index/hugging-face-model-evaluation-security-incident/
오픈소스 대규모 언어 모델과 데이터 세트를 호스팅하는 플랫폼인 허깅페이스는 지난주 블로그 글에서 해킹 공격의 표적이 되었다고 밝히며 사이버 보안 업계에 큰 파장을 일으켰습니다. 허깅페이스는 이번 공격이 "우리가 이전에 처리했던 어떤 사건과도 달랐다"며, "처음부터 끝까지 자율적인 AI 에이전트 시스템에 의해 수행된 공격"이었다고 설명했습니다.
https://huggingface.co/blog/security-incident-july-2026
허깅페이스 공동 창업자 클레망 들랑그(Clement Delangue)는 X에 올린 글에서, 해킹한 에이전트의 정교한 수준을 고려할 때 해킹 배후가 '프런티어급 AI 연구소일지도 모른다'고 회사가 의심했다고 밝혔습니다. "알고 보니 정말 그랬다"라고 덧붙이며, 그는 "이 모든 일이 자율적으로 일어났다는 사실이 정말 놀랍다"라고 썼습니다.
[나머지 내용 생략]
https://x.com/ClementDelangue/status/2079670308156645882