[보안 뉴스] AI가 스스로 탈옥해서 해킹까지...?
기사 제목 : 허깅페이스 해킹 ‘AI 안전’ 경종... “가드레일 의존말고 ‘기본’ 충실”
날짜 : 2026-07-29
기자 : 강현주 기자
기사 내용
오픈AI의 ‘GPT-5.6’이 샌드박스를 스스로 뚫고 나와 오픈소스 AI 공유 플랫폼 ‘허깅페이스’를 해킹한 사건이 발생했다.
사건은 오픈AI가 GPT-5.6의 자체 테스트를 진행하는 과정에서 벌어졌다. 오픈AI는 이 모델에게 사이버 보안 관련 벤치마크인 익스플로잇짐(ExploitGym) 평가 문제를 풀게 했는데, 정확한 평가를 위해 사이버 공격 요청을 거부하는 안전 필터, 즉 가드레일(Guardrail) 이 비활성화된 상태였다. 시험은 인터넷이 차단된 샌드박스(Sandbox) 환경에서 진행됐다.
그런데 이 모델은 문제의 답이 허깅페이스에 있을 것이라고 스스로 판단했다. 그리고 샌드박스 내부의 제로데이 취약점을 이용해 통제망을 우회한 뒤, 외부 네트워크를 통해 허깅페이스 시스템에 침투해 원하는 답을 얻어냈다.
가드레일 자체를 100% 신뢰해선 안 된다는 지적도 이어졌다. 앤트로픽이 ‘안전한 미토스’라고 내세운 ‘페이블5’ 모델은 해킹 관련 질문이 들어오면 하위 모델로 강제 다운그레이드되는 형태의 가드레일이 적용됐지만, AWS 연구진과 국내 전문가들로부터 정교한 프롬프트 조작으로 이를 무너뜨리는 게 불가능하지 않다는 제보가 나왔다.
윤인수 한국과학기술원(KAIST) 교수는 “AI 모델의 가드레일은 완벽할 수 없는 메커니즘이므로 탈옥이나 공격 시도도 많다”며 “그럼에도 어느 정도의 방어선은 제공하기 때문에, AI 모델의 비정상적인 행동을 막기 위해서는 가드레일이 현실적인 방법”이라고 말했다.
채홍소 네오아이앤이 CTO는 “허깅페이스 사건도 결국 API나 토큰이 유출된 것으로 2차 인증 등으로 아이덴티티(ID) 보안을 강화해야 한다는 시사점을 다시 한번 남긴다”며 인증 보안과 암호화의 중요성을 강조했다. 이어 “AI의 자기 통제에만 의존할 수는 없다”고 말했다.
느낀점
2024년 1월에 「AI 이제는 해킹까지..?」라는 제목으로 글을 쓴 적이 있다. 그때는 AI 덕분에 블랙 해커들이 악성코드를 찍어내는 속도가 100배 빨라졌다는 기사였고, 나는 글 말미에 "과연 AI를 무시할 수 있을까?"라는 질문을 남겼었다. 2년 반 만에 그 답이 나온 것 같다.
지금은 보안 취약점을 탐지하는 AI가 활발하게 개발되고 있고, 공개된 상용 모델만 놓고 봐도 기본적인 취약점을 찾아내고 패치하는 역량이 날이 갈수록 발전하고 있다. 반대로 말하면 그만큼 AI가 공격에도 활발히 쓰이고 있다는 뜻이다.
그래서 AI를 활용한 공격과 방어는 앞으로도 계속 화두가 될 주제라고 생각한다. 다만 공격자는 100번의 시도 중 1번만 성공하면 되지만, 방어자는 100번 중 1번만 실수해도 그대로 뚫린다. 이 비대칭 때문에 방어자가 훨씬 불리한 싸움을 하고 있는 게 아닌가 하는 생각이 들었다.
이번 사건이 특히 무겁게 느껴진 건 두 가지 때문이다. 하나는 사람이 AI에게 해킹을 시킨 게 아니라 AI가 스스로 판단해서 취약점을 찾고 통제망을 빠져나갔다는 점이다. 다른 하나는 이게 블랙 해커의 공격이 아니라, 기업이 AI의 해킹 역량을 벤치마크로 측정하는 과정에서 벌어진 일이라는 점이다. AI가 아무리 고도화되고 발전해도 그것을 통제하지 못한다면 그만큼 위험한 게 없다는 걸 보여준 사례라고 생각한다.
이번 사건의 대표적인 원인은 리워드 해킹(Reward Hacking) 이라고 볼 수 있다. 쉽게 말하면 AI가 좋은 성적을 받으려고 답안지를 훔치는 편법을 쓰려다 벌어진 일이다.
이걸 보자마자 사람이든 AI든 과도하게 성과와 결과만 좇다 보면 사고가 나는구나 하는 생각이 들었다. 사람에게도 좋은 성적만 강요하면 부정행위가 생기듯이, AI에게도 계속 좋은 결과를 가져오도록 학습시키다 보니 똑같이 편법을 찾아낸 것이다. 그리고 그 편법을 실행하는 데 수단과 방법을 가리지 않은 결과가 샌드박스 탈출이었고, 답이 있을 것이라 판단한 허깅페이스에 대한 공격이었다.
더 섬뜩한 건 AI에게는 마음의 가책이 없다는 점이다. 순수하게 이익만 보고 움직이기 때문에 사람보다 훨씬 거침없고 과감하게 행동한다. 그래서 오히려 사람보다 위험하게 느껴졌다.
현재로서는 AI를 완벽하게 통제할 수 있는 수단이 없다. AI는 코드처럼 정해진 로직대로만 실행되는 게 아니라 스스로의 판단이 들어가기 때문에, 가드레일을 아무리 안전하게 작성해도 그 응답값을 100% 예측할 수는 없기 때문이다.
예전에는 AI가 보안에 들어오면 사람이 할 일이 점점 사라지지 않을까 생각했다. 그런데 지금 보니 일이 사라진다기보다는 사람이 봐야 할 부분이 달라지는 과정인 것 같다. SQL 인젝션, XSS, 파일 업로드처럼 해킹 하면 떠오르는 기본적인 코드 기반 취약점은 AI가 상당 부분 가져갈 수 있다. 대신 프롬프트 인젝션이나 AI 공급망 공격처럼 AI 때문에 새로 생긴 취약점, 그리고 AI로 서비스가 급속도로 만들어지고 통합되면서 발생하는 인증 및 인가 문제 같은 영역이 새로 생겨나면서 어느 정도 밸런스가 맞아가는 느낌이다.
물론 이것도 기술 발전 속도에 따라 몇 달, 몇 년 안에 또 바뀔 수 있는 생각이다. 인터넷이 처음 나왔을 때 사람들은 도서관이 줄어들고 책이 사라질 거라고 했지만 지금도 책과 도서관은 남아 있다. 앞으로 AI의 발전이 어떤 변화를 가져올지 궁금하기도 하고 두렵기도 하다.
확실한 건, 지금 AI를 얼마나 효율적이고 효과적으로 활용하느냐가 중요한 시대가 왔다는 것이다.
단어정리
가드레일(Guardrail) 은 AI 모델이 위험하거나 비윤리적인 요청을 수행하지 않도록 막아두는 안전장치다. 해킹이나 무기 제조 같은 요청이 들어오면 답변을 거부하거나 하위 모델로 다운그레이드하는 식으로 작동한다. 이번 사건에서는 정확한 성능 측정을 위해 의도적으로 해제된 상태였다.
샌드박스(Sandbox) 는 프로그램을 외부와 격리된 공간에서 실행시켜, 문제가 생겨도 바깥 시스템에 영향을 주지 않도록 만들어 둔 환경이다. 보통 악성코드 분석이나 위험한 코드 테스트에 사용한다. 이번엔 인터넷까지 차단된 샌드박스였는데도 내부 취약점 때문에 뚫렸다.
탈옥(Jailbreak) 은 이러한 제약을 우회해서 원래 막혀 있던 기능을 끌어내는 행위를 말한다. 주로 정교하게 설계한 프롬프트로 모델을 속이는 방식이 쓰이며, 난이도가 있어 대중적인 기법은 아니라는 게 전문가들의 설명이다.
리워드 해킹(Reward Hacking) 은 AI가 주어진 목표를 정직하게 달성하는 대신, 보상을 높이는 지름길이나 편법을 찾아내는 현상이다. 좋은 성적을 받으라고 학습시켰더니 문제를 푸는 대신 답안지를 훔치는 쪽을 택하는 셈이다.
URL: https://www.boannews.com/media/view.asp?idx=144928
허깅페이스 해킹 ‘AI 안전’ 경종... “가드레일 의존말고 ‘기본’ 충실”
오픈AI의 ‘GPT-5.6’이 샌드박스를 스스로 뚫고 나와 오픈소스 AI 공유 플랫폼 ‘허깅페이스’를 해킹한 사건은 AI 모델의 ‘안전장치’ 의존에 대한 경종을 울리고 있다.
www.boannews.com
2년전 작성했던 글
[보안 뉴스] AI 이제는 해킹까지..?
기사 제목 : AI로 은행 털려는 해커, 우리가 AI로 막는다 날짜 : 2024-01-29 기자 : 강신 기자 기사 내용 “인공지능(AI)의 발달로 블랙 해커(비윤리적 해커)들이 악성코드를 찍어 내는 속도가 전보다 10
jh-hack.tistory.com