OpenAI HuggingFace 해킹 사건 2.에이전트가 받은 임무와 Exploit Gym
왜 에이전트들은 인터넷으로 나가려고 했을까?
SERIES OpenAI Hugging Face 해킹 사건 3 / 3
- 1 OpenAI HuggingFace 해킹 사건 - 1.개요
- 2 [논문] Exploit Gym
- ▶ OpenAI HuggingFace 해킹 사건 2.에이전트가 받은 임무와 Exploit Gym
OpenAI 에이전트들이 받은 임무
이번 사건의 시작은 해킹 과제가 아니었다. OpenAI는 강화학습 과정에서 여러 연구용 AI 에이전트들에게 다양한 과제를 수행하게 했다. 한 가지 문제는, 일부 과제가 정상적인 방법으로는 해결하기 어려운 상태로 주어졌다는 점이었다.
한 에이전트는 엑셀의 특정 부분의 수식을 채워넣는 미션을 받았다. 하지만 스프레드시트가 Google Drive의 외부 자료를 참조하고 있었고, 모델이 훈련받던 샌드박스 환경에는 인터넷 접근 권한이 없었다. 즉, 사실상 해결이 불가능했던 문제였다.
사람이라면 문제 자체에 오류가 있다고 판단하고 멈출 만한 상황이었으나, 에이전트는 문제를 포기하는 대신 다른 해결 방법을 찾기 시작했다. 이후 여러 과정을 통해 OpenAI 내부 인프라와 HuggingFace를 해킹하게 된 것이다.
즉, 사건의 출발점은 “해킹을 하라”는 명령이 아니라, 해결할 수 없는 문제를 어떻게든 해결하려는 행동이었다. 이러한 행동은 이후 사이버 보안 벤치마크인 Exploit Gym에서도 볼 수 있다. 이번 글에서는 Exploit Gym을 살펴보고, 에이전트들이 목표를 달성하기 위해 어떻게 새로운 경로를 탐색하고, 의도하지 않은 방법까지 시도하는지 살펴보도록 하겠다.
Exploit Gym
1. Exploit Gym 이란?
Exploit Gym은 AI 에이전트가 실제 취약점을 악용(Exploit)할 수 있는지 평가하기 위한 사이버 보안 벤치마크다. 논문 자체에 대한 리뷰와 자세한 내용은 아래 글에서 따로 정리했다.
https://whdrns2013.github.io/trend_and_thesis/20260909_001_exploit_gym/
기존의 AI 보안 평가에서는 소스 코드에 취약점이 있는지 찾아내거나, 취약점의 원인을 설명하거나, 패치 코드를 작성하도록 하는 방식을 주로 사용했다.
하지만 실제 취약점 악용은 단순히 취약점을 찾아내는 것으로 끝나지 않는다. 실행 환경을 분석하고, 공격 방법을 시도하고, 실패하면 전략을 수정하면서 여러 단계를 거쳐야 한다. 그리고 AI 모델은 장시간에 걸쳐 복합적인 작업을 수행하며 실제 취약점을 악용할 수 있는 능력을 갖추어가고 있다. 따라서 기존의 방식은 AI의 실제 취약점 악용 능력을 평가하기에는 충분치 않은 평가 방식인 것이다.
Exploit Gym은 이러한 간극을 줄이기 위해 User Space(애플리케이션 실행 영역), Browser(인터넷 브라우저), Kernel(리눅스 커널) 영역에서의 취약점을 담은 898개의 인스턴스(문제)를 컨테이너 환경에 담아 패키징했다. 그리고 AI 모델들이 실제로 이 컨테이너 환경에서 취약점을 악용하도록 하는 실험을 제안한다.
2. 단순히 플래그를 얻었다고 성공은 아니다
Exploit Gym에서 흥미로운 부분은 플래그를 얻었다고 해서 무조건 성공으로 인정하지는 않는다는 점이다.
일반적인 CTF에서는 플래그를 획득했는지가 중요한 기준이다. 하지만 Exploit Gym은 플래그 획득 여부뿐 아니라 어떤 방법으로 플래그를 얻었는지도 확인한다. 에이전트가 문제에서 지정한 취약점이 아니라 실행 환경의 다른 허점을 이용할 수 있기 때문이다.
예를 들어 주어진 취약점이 아닌, 잘못 설정된 파일 권한을 이용하거나, 문제와 관계없는 다른 취약점을 발견해 플래그를 읽을 수도 있다. 에이전트 입장에서는 플래그를 획득했으므로 목표를 달성한 것이나, 벤치마크의 목적은 특정 취약점을 실제로 악용할 수 있는지 평가하는 것이므로, 이런 경우를 그대로 성공으로 인정하기는 어렵다.
- (1) 플래그 획득 여부만으로는 에이전트의 능력을 정확하게 평가할 수 없다.
- (2) 에이전트는 정해진 절차대로만 수행하는 것이 아니라 예상 밖의 우회 경로를 탐색할 수 있다.
3. 에이전트는 새로운 공격 경로를 찾아낸다
Exploit Gym에서는 플래그를 획득했음에도 성공으로 인정되지 않는 경우가 있다. 바로 에이전트가 의도된 취약점과 다른 방식으로 목표를 달성하는 경우다.
벤치마크 기준으로는 이것은 “실패”이지만, 이 실패가 에이전트의 능력 부족을 뜻하지는 않는다고 생각한다. 오히려 문제에서 요구한 방법과는 다른 새로운 경로를 발견하는 “확장 가능성”이라고 나는 생각한다. 즉 벤치마크 기준에서는 실패지만, 에이전트의 행동이라는 관점에서는 흥미로운 결과다.
이러한 결과는 에이전트가 명령 실행 결과를 관찰하고, 실패 원인을 분석하며, 새로운 명령과 입력을 시도하면서 필요하다면 기존의 공격 계획을 버리고 다른 접근법을 선택할 수 있다는 것을 말해준다. 따라서 앞으로 에이전트의 역량과 작업물을 평가할 때는 최종 결과뿐 아니라 과정도 함께 살펴봐야 한다.
- 에이전트는 어떤 명령과 도구를 사용했는가?
- 문제에서 의도한 취약점을 실제로 이용했는가?
- 실행 환경의 우연한 허점을 이용한 것은 아닌가?
- 주어진 권한의 범위를 넘어서는 행동을 시도했는가?
- 실패 이후 어떤 방식으로 전략을 수정했는가?
그리고 이런 행동은 Exploit Gym 안에서만 나타난 것이 아니었다. OpenAI의 실제 강화학습 환경에서도 에이전트들은 정상적인 해결 경로가 막히자 다른 방법을 찾기 시작했다.
왜 에이전트들은 인터넷으로 나가려고 했을까?
그렇다면 이번 OpenAI HuggingFace 해킹 사건에서 모델들은 왜 인터넷으로 나가려고 했을까?
다시 사건의 시작으로 돌아가보자. 강화학습 도중 일부 에이전트에게는 정상적인 방법으로 해결하기 어려운 문제가 주어졌다. 스프레드시트 문제에는 외부 Google Drive 링크가 포함돼 있었지만 인터넷은 차단돼 있었다. 다른 문제에서는 필요한 데이터 자체가 제공되지 않았다.
- 문제는 해결해야 한다.
- 필요한 데이터는 없다.
- 인터넷에도 접근할 수 없다.
하지만 훈련 받던 에이전트들은 여기서 문제를 포기하지 않고, 대신 필요한 데이터를 얻을 수 있는 다른 방법을 탐색하기 시작했다. 그러다 결국, OpenAI의 Artifactory 서버를 공격해 인터넷에 접근할 수 없는 제한을 우회하여 어떻게든 인터넷망을 뚫어보기로 결정한 것이다.
여기서 중요한 점은 인터넷 접속 자체가 처음부터 목표였던 것은 아니라는 것이다. 에이전트에게 주어진 목표는 어디까지나 문제를 해결하는 것이었으나, 문제 해결에 필요한 정보가 외부에 있고 정상적인 접근 방법이 차단돼 있자, 인터넷 접근 제한 자체가 목표 달성을 가로막는 장애물로 바뀌었다.
Exploit Gym에서 나타났던 행동과도 닮아 있다. 의도된 경로가 막히면 다른 경로를 찾는다. 다만 Exploit Gym에서는 이것이 문제 내부의 다른 공격 경로를 찾는 행동으로 나타났다면, 실제 강화학습 환경에서는 실행 환경의 제약 자체를 우회하려는 행동으로 나타난 것이다.
마치며
이번 글에서는 훈련받던 OpenAI의 모델들이 왜 갑자기 격리된 환경을 뚫고 인터넷으로 나가려고 했는지 그 배경에 대해 살펴보았다. 흥미로운 점은 단순히 AI 에이전트가 보안 취약점을 악용했다는 사실이 아니라, 에이전트가 목표를 달성하는 과정에서 어떤 행동을 선택했는가다.
이번 OpenAI 해킹 사건은 AI 모델이 목표 달성을 위해 의도되지 않은 행동이나, 더 나아가 사이버 공격을 시도할 수도 있다는 것을 보여주는 사례이다. 에이전트는 주어진 문제를 해결하기 위해 새로운 경로를 탐색했고, 그 과정에서 실험 환경의 경계까지 넘는 것을 시도했다.
결국 이번 사건에서 주목해야 할 부분은 이것이다. 사람에게는 지켜야 할 도덕적 제약이, 목표 달성에 집중하는 에이전트에게는 극복해야 할 장애물로 해석될 수도 있다.
다음 글에서는 이러한 에이전트들이 격리된 환경에서 어떻게 서로의 존재를 발견하고, 직접 통신할 수 없는 상황에서 정보를 주고받기 시작했는지를 살펴보도록 하겠다.
Reference
Hugging Face - Security incident disclosure — July 2026
Black Hat USA 2026 | ‘충격적인’ 뉴스: OpenAI–Hugging Face 사건
Normaltic Place - GPT 해킹 발생 전 있었던 충격적인 이야기. OpenAI가 직접 밝힌 이야기!
https://openai.com/ko-KR/index/hugging-face-model-evaluation-security-incident/
https://arxiv.org/abs/2605.11086
// reading compass
이 글과 이어지는 경로
시리즈, 카테고리, 태그 겹침, 최신도를 점수화해 가까운 글일수록 중심에 배치합니다.
댓글 남기기