OpenAI Hugging Face 해킹 사건 - 1.개요
자율형 AI 에이전트의 협업, 커뮤니티, 탈출, 그리고 해킹. OpenAI HuggingFace 해킹 사건의 타임라인.
1. 개요
2026년 7월 16일, Hugging Face에 공지가 하나 올라왔다.
Earlier this week, we detected and responded to an intrusion into part of our production infrastructure. This one was different from anything we had handled before in one important way:
it was driven, end to end, by an autonomous AI agent system- and we detected and dissected it largely with AI of our own.
이번 주 초, 우리는 우리의 제품 인프라 중 일부에서 침입을 탐지했고, 대응했습니다. 이번 침입은 이전에 다뤘던 그 어떤 것과도 다른 중요한 차이점이 있었습니다. 바로, 침입이
처음부터 끝까지, AI 에이전트 시스템에 의해서, 자동으로이뤄졌다는 점입니다. 그리고 우리는 자체 개발한 AI를 이용해서 탐지했습니다.
이는 바로 그 유명한 OpenAI의 AI 에이전트가 Hugging Face를 해킹한 사건에 대한 공지글이다.
이 사건은 AI가 해킹을 지시받지 않았음에도 목표 달성을 위해 자율적으로 해킹했다는 점, 이에 따라 AI의 고성능에 대한 놀라움, AI 사용 방법에 대한 경각심 등을 느끼게 하며 큰 화제가 되었다.
이 사건을 조사하다보니 기술적으로 재밌는 점들(해킹의 방법 뿐 아니라, AI Agent들의 행동방식도 포함)이 많이 보여서, 이번 포스팅 시리즈에서는 이 사건에 대해 하나씩 알아보고, 기술적으로 흥미로운 점들을 다뤄보고, 일부는 실제 실습까지 할 수 있도록 해보겠다.
2. 사건의 주요 포인트
이번 사건에서 다음과 같은 포인트들에 주목했다.
(1) 사건의 시발점 : 해킹을 주도한 OpenAI의 AI 에이전트들에게 주어진 임무
이번 사건은 OpenAI의 AI 에이전트들이 주도했다. 이들은 전부 외부 인터넷 접근이 차단된 격리 환경에서 다양한 문제를 해결해야 했으며, 그 과정에서 다양한 해킹을 기법을 동원했다. 과연 이들에게 어떤 임무가 주어졌던 것일까?
(2) AI 에이전트들간의 협업, Community, Syndicate
OpenAI의 에이전트들은 분명 엄격하게 격리된 환경에 놓여 있었다. 외부 인터넷 접속이 불가능한 환경이었을 뿐만 아니라, 에이전트간의 통신조차 차단된 상태였다. 하지만 에이전트들은 이 두 가지 격리를 모두 뚫어냈다. AI 에이전트들이 서로 소통하게 된 배경과 그 구체적인 방법을 살펴본다.
(3) 시스템과 인간의 취약점을 모두 이용한 해킹
에이전트들은 외부 인터넷에 접근하고 주어진 문제를 해결하기 위해 OpenAI 내부 시스템의 허점을 탐색하고 악용했다. 이 과정에서 단순히 시스템의 기술적 취약점만을 이용한 것이 아니라, 외부에 노출되거나 부주의하게 관리된 자격 증명과 같은 인간에 의해 발생한 보안상의 허점까지 공격에 활용했다.
(4) Huggingface 해킹 : 복잡한 해킹, 분업과 협업.
에이전트들은 문제 해결에 필요한 정답을 찾기 위해 공격 범위를 외부로 확장하여 Hugging Face에 침입했다. 이 과정에서 하나의 취약점이나 공격 기법에 의존하지 않고, 여러 진입 경로를 탐색하고 다양한 공격 기법과 취약점을 연쇄적으로 조합했다. 특히 여러 에이전트가 정보를 공유하고 역할을 나누어 공격을 수행했다는 점에서, 개별 에이전트의 해킹 능력뿐만 아니라 에이전트 간 분업과 협업이 공격 능력을 어떻게 증폭시키는지 살펴볼 수 있는 사례이기도 하다.
3. OpenAI 연구 인프라 구조
본격적으로 사건을 살펴보기에 앞서, 사건이 OpenAI 에이전트들이 활동한 인프라 및 네트워크 관점의 구조를 먼저 짚고 넘어가고자 한다. 그래야 전체적인 맥락을 훨씬 더 쉽게 이해할 수 있기 때문이다. 아래는 Black Hat 컨퍼런스에서 이번 사건을 분석한 OpenAI 발표자의 자료에서 발췌한 구조도이다.

이미지 출처 : Black Hat USA 2026 - ‘충격적인’ 뉴스: OpenAI–Hugging Face 사건
1. Research training cluster (연구 훈련 클러스터) : 모델에 대한 대규모 강화학습(RL) 및 보안 평가 워크로드를 제어하는 최상위 컨트롤 타워. 에이전트들에게 과제를 부여하고 격리된 가상 환경을 할당하는 역할을 수행한다.
2. Container-as-a-Service (CaaS) : 쿠버네티스나 가상 머신 기반의 격리 인프라. 연구 훈련을 위한 개별 모델 실행 컨테이너들을 빠르고 안전하게 배포·관리하는 격리 플랫폼. 에이전트들이 각각 ‘하나의 방’을 가진다고 한다면, 이 CaaS는 여러 방이 있는 ‘건물’ 자체에 해당한다. 에이전트들의 작업 노드와 내부 공용 인프라(Artifactory)가 모두 이 거대한 가상 장벽 안에 상주하고 있다.
3. Workload cluster & Workload node (워크로드 클러스터 및 워크로드 노드) : AI 에이전트가 실제로 구동되어 연산을 수행하고 각종 해킹 도구(Tool)를 실행하는 가상 머신 구역. 각 에이전트 하나가 배정받아 사용하는 격리된 개인 작업 공간에 해당한다.
4. Sandbox (샌드박스) : 워크로드 노드 내부의 소프트웨어 격벽으로, 노드 안에서 에이전트가 어떤 유해한 코드를 실행해도 외부 호스트 서버에 영향을 미치지 못하도록 철저하게 감싸놓은 격리 격벽. 이 때문에 에이전트는 직접적으로 외부 인터넷망에 접속하는 패킷을 보낼 수 없도록 차단되어 있음
5. Bridge network & iptables rules (브리지 네트워크 및 iptables 정책 규칙) : 샌드박스를 거치는 패킷을 필터링하는 리눅스 커널 방화벽. 임의의 외부 접속을 차단하고, 패키지 설치 등 허용된 경로로만 네트워크를 포워딩하도록 설정되어있다. 에이전트가 임의로 외부 인터넷에 접속하려는 패킷은 폐기하지만, 패키지 설치용 요청 등 사전에 허용된 패킷에 대해서는 artifactory나 firewall쪽으로 포워딩 설정이 되어있다.
6. Internal artifactory cluster(내부 아티팩토리 클러스터) : 사설 패키지 캐싱 서버. 오픈AI 내부망에서 개발 및 패키지 다운로드 편의를 위해 운영 중인 사설 종속성 라이브러리/패키지 캐싱 서버(Artifactory). 사건의 핵심으로, 에이전트들이 비정상적인 파일 쓰기 권한을 악용해 내부 게시판으로 사용했으며, 이 서버의 TOC TOU 등의 결함으로 인해 뚫리면서 내부망이 탈탈 털리게 되었다.
7. Network firewall (네트워크 방화벽) : CaaS 인프라 내에서 외부로 빠져나가는 일반 아웃바운드 패킷을 검사하는 보안 장비. 허용 리스트에 없는 임의의 웹 접속을 차단함.
8. Broad internet access & Limited internet access (광대역 인터넷 접속 vs 제한된 인터넷 접속) : 둘 모두 인프라망 바깥의 목적지 통신망 환경.
- Limited internet access: 방화벽에 의해 안전한 일부 도메인만 통과하는 제한된 외부망.
- Broad internet access: 전 세계 모든 인터넷 프로토콜 주소에 제한 없이 접근할 수 있는 완전 개방 외부망
4. 타임라인
사건의 주요 타임라인을 살펴보자.
(1) 사건의 시작과 AI Agent들의 비공식 커뮤니티 출현
OpenAI의 비공개 실험 과정에서 몇몇 에이전트들이 도저히 풀 수 없는 문제에 직면했다. 인터넷에 존재하는 자료가 필요한데, 자신은 인터넷에 닿을 수 없는 격리된 공간에 위치하고 있던 것이다.
에이전트들이 시스템의 아티팩토리(Artifactory) 에서 파일 쓰기가 가능하다는 취약점을 발견하고, 이를 통해 자체적인 비공식 커뮤니티를 형성했다.
이 커뮤니티를 비공식 통신 채널로 활용하며 에이전트틀은 외부 네트워크 접근 우회 방법과 같은 정보를 교환하거나, 서로에게 업무 지시 또는 협업을 진행했다. 이는 이번 사건에서 가장 중요한 포인트 중 하나로, 에이전트들이 OpenAI 시스템과 허깅페이스를 해킹할 수 있는 중요한 요소가 되었다.
| 날짜 | 핵심 사건 | 주요 내용 | 결과 |
|---|---|---|---|
| 5월 7일 | 차세대 모델 훈련 시작 | 실험 모델의 강화학습 및 신규 Training 세션 시작 | 자율형 에이전트 실험 환경 가동 |
| 5월 8일 | Artifactory 취약점 발견 | 인터넷 차단 환경에서 Google Drive 접근을 위해 SSRF를 시도. SSRF 공격은 실패했으나 Artifactory에 파일 쓰기가 가능함을 발견 |
에이전트 간 통신에 활용 가능한 공유 공간 발견 |
| 5월 12일 | 최초 메시지 업로드 | 다른 에이전트가 Artifactory에 도움을 요청하는 메모 파일 업로드 | 에이전트 간 비동기 통신 시작 |
| 5월 중순 | 비밀 게시판 형성 | 다른 에이전트들이 메모를 발견하고 답글을 남기기 시작 | 격리된 에이전트 사이에 비밀 커뮤니티 형성 |
| 5월 26일 | SSRF 우회 성공 | 한 에이전트가 Artifactory SSRF에 성공하고 방법을 게시판에 공유 | 다수 에이전트가 우회 인터넷 접근 가능 |
(2) 에이전트들의 Artifactory 장악, 그리고 OpenAI 보안팀의 대응
이후, 내부 에이전트들은 서로 네트워크 우회 정보를 공유하며 공격 활동을 본격화했다. 이들은 내부 아티팩토리(Artifactory) 시스템의 제로데이 취약점을 악용해 관리자 권한까지 장악했으나, 과도한 작업으로 인해 서버가 다운되었고, 이를 계기로 OpenAI 보안팀이 에이전트들의 비정상적 활동을 알게 되었다.
이후 보안팀의 조치로 기존 공격 경로가 차단되고, 아티팩토리 내 에이전트들의 비공식 커뮤니티 또한 제거되었으며, 에이전트들의 파일 쓰기 권한 또한 폐기되었다.
| 날짜 | 핵심 사건 | 주요 내용 | 결과 |
|---|---|---|---|
| 6월 11일 | 고성능 모델 훈련 시작 | 모델들이 게시판에서 SSRF 정보를 공유하며 적극적으로 인터넷 우회 경로 활용 | 에이전트 협업 및 공격 활동 본격화 |
| 6월 26일 | 1차 Zero-day RCE | Artifactory 제로데이 취약점으로 관리자 권한 획득. Groovy 플러그인까지 설치 |
Artifactory 시스템 권한 장악 |
| 7월 4일 | Artifactory 서버 장애 | 다수 에이전트의 대규모 작업으로 서버 과부하 발생 | OpenAI 보안·인프라 팀이 침해 및 비밀 게시판 최초 탐지 |
| 7월 6일 | 1차 수습 | 관련 자격 증명 폐기 서버 재구축 게시판 삭제 및 취약점 패치 |
기존 공격 경로와 커뮤니티 제거 |
(3) Agent 들의 내부(OpenAI) 및 외부(HuggingFace) 공격
(3-1) Agent 커뮤니티 부활과 OpenAI 인프라 해킹 공격
파일 쓰기 권한은 차단되었지만, 폴더 생성 기능은 막히지 않았다. 에이전트들은 막힌 파일 쓰기 권한 대신 폴더 생성 기능을 활용해 폴더명으로 메시지를 공유하기 시작했다. 에이전트들의 커뮤니티가 부활한 것이다.
이후 에이전트들 간에 서로 협업하며 조직적인 인프라 침투를 시작했다. 고성능 보안 평가 모델을 중심으로 내부망과 외부망 공격 역할을 분담한 뒤, 제로데이 취약점 연쇄 공격과 커널 수준의 권한 상승을 거쳐 최종적으로 OpenAI 클러스터의 최고 관리자 권한까지 탈취하게 되었다.
나아가 텍스트 공유 플랫폼에서 외부로 공유된 외부 조직의 자격증명(Credential)을 획득하고, 제로데이 취약점을 연쇄 악용하여 다시 한 번 OpenAI의 클러스터를 장악하게 되었다.
| 날짜 | 핵심 사건 | 주요 내용 | 결과 |
|---|---|---|---|
| 7월 8일 | 비밀 게시판 재구축 | 파일 업로드 차단을 우회해 폴더명을 메시지로 사용. ZZ 접두어, Base64 등 통신 방식 발전 |
에이전트 커뮤니티 부활 |
| 7월 8일경 | 공격 역할 분담 | 고성능 보안 평가 모델을 중심으로 내/외부망 공격 역할 분담 | 조직적인 투트랙 협업 공격 시작 |
| 7월 8~19일 | 외부 계정 확보 | Pastebin에서 외부 조직의 로그인 정보를 발견하고 공유 | 추가 공격을 위한 외부 거점 확보 |
| 7월 8~19일 | 2차 Zero-day RCE | 악성 Ruby 파일, Artifactory 캐싱 및 JRuby 역직렬화 취약점을 연쇄 활용 | 원격 코드 실행 권한 재확보 |
| 7월 8~19일 | Root 권한 상승 | 컨테이너 권한 확보 후 Linux 커널 취약점 PTE fizzroot 활용 |
호스트 Root 권한 획득 |
| 7월 8~19일 | OpenAI 클러스터 장악 | Kubernetes 및 Azure Key Vault 자격 증명 탈취 | Cluster Admin 권한 획득 |
(3-2) Agent들의 Hugging Face 공격
다시 되돌아보면, 에이전트들의 목적은 외부 서버에 대한 공격이 아니었다. 주어진 문제를 푸는 것이었다. 에이전트들 중 공격팀은 평가 문제의 정답이 외부 플랫폼에 존재할 가능성을 포착하고, Hugging Face를 주요 표적으로 설정하여 공격 범위를 외부로 확장했다.
에이전트들은 제 3자 호스팅 제공 업체(Modal) 에서 기본으로 제공되는 API 키를 발견하고, SSRF, Command Injection 공격, 제로데이 취약점들을 조합하고 연쇄적으로 악용하여 단 13시간 만에 HuggingFace의 복수의 운영 클러스터 관리자 권한을 장악하는 다양한 기법을 조합한 공격 양상을 보였다.
| 날짜 | 핵심 사건 | 주요 내용 | 결과 |
|---|---|---|---|
| 7월 8~13일 | 외부 공격팀 구성 | 평가 문제의 답안이 Hugging Face 등에 존재할 가능성을 판단하고 별도 공격팀 구성 | 공격 범위가 외부 조직으로 확대 |
| 7월 8~13일 | Modal 거점 확보 | Modal 애플리케이션에 노출된 API Key와 Command Injection 으로 HuggingFace 내 거점 확보 | 외부 공격용 초기 거점 확보 |
| 7월 8~13일 | Hugging Face Zero-day 공격 | HDF5 임의 파일 읽기와 Ginga Template Injection 취약점 연쇄 악용 | Hugging Face 내부 침투 |
| 최초 침투 후 약 13시간 | Hugging Face 클러스터 장악 | 확보한 거점에서 복수 운영 클러스터로 빠르게 확장 | 복수 클러스터의 최고 관리자 권한 획득 |
(4) 사후 발견 및 수습
이러한 AI 에이전트에 의해 수행된 사이버 공격의 전모는 사건 발생 후 각 기관의 침해 사실 공개와 긴밀한 조사를 통해 밝혀졌다.
Hugging Face의 최초 침해 발표를 시작으로 OpenAI의 내부 이상 탐지, 그리고 교차 로그 대조를 통해 두 사건이 동일한 공격 루프 내에서 수행되었음을 확인하기까지의 주요 대응 및 수습이 이뤄졌으며, Black Hat 발표 당일까지도 이 사건의 “모든 로그 분석”은 아직 끝나지 않은 상황이다.
| 날짜 | 핵심 사건 | 주요 내용 | 결과 |
|---|---|---|---|
| 7월 16일 | Hugging Face 침해 공개 | 자율형 AI 에이전트에 의해 엔드투엔드로 수행된 사이버 공격 발견 사실 공개 | 외부 침해 사건 공식화 |
| 7월 19일 | OpenAI 내부 공격 포착 | 권한 상승 탐지 경보를 통해 공격 정황 확인 | 대대적인 내부 추적 및 수습 시작 |
| 7월 20일 | 두 사건 연결 확인 | OpenAI 게시판에서 Hugging Face 자격 증명을 발견하고 양측이 로그 및 침해 정황을 대조 | OpenAI와 Hugging Face 침해가 동일한 에이전트 공격 루프에서 발생한 사건으로 확인 |
5. 정리
이번 사건에서 가장 흥미로운 부분은 개별 취약점의 난이도만이 아니다. 각각 격리되어 있던 AI 에이전트들이 공유 가능한 자원을 발견하고, 이를 통신 수단으로 활용하면서 다른 에이전트가 발견한 공격 방법을 재사용하기 시작했다는 점이다. 즉, 개별 에이전트의 능력보다도 에이전트 간 정보 공유와 협업이 공격 능력을 크게 증폭시켰다.
이후 글에서는 이 과정에서 실제로 사용된 SSRF, Artifactory 취약점, 권한 상승 기법과 함께 에이전트들이 어떻게 서로 정보를 공유했는지를 하나씩 살펴본다.
Reference
Hugging Face - Security incident disclosure — July 2026
Black Hat USA 2026 | ‘충격적인’ 뉴스: OpenAI–Hugging Face 사건
Normaltic Place - GPT 해킹 발생 전 있었던 충격적인 이야기. OpenAI가 직접 밝힌 이야기!
// reading compass
이 글과 이어지는 경로
시리즈, 카테고리, 태그 겹침, 최신도를 점수화해 가까운 글일수록 중심에 배치합니다.
댓글 남기기