본문 바로가기
728x90

전체 글239

LLM 보안 진단 도구 - promptfoo 사용해보기! Promptfoo란?Promptfoo는 AI 애플리케이션을 자동 테스트할 수 있게 해주는 오픈소스 LLM 평가 및 레드티밍 도구이다.기능목적명령어Evaluations프롬프트·모델 품질 비교. A/B 테스트, 회귀 테스트promptfoo evalRed Teaming보안 취약점 진단. 공격 생성 → 실행 → 판정promptfoo redteam Promptfoo는 크게 Evaluations와 Red Teaming으로 나눠지는데 이번 글에서는 Red Teaming 기능을 리뷰해 보겠다. GitHub - promptfoo/promptfoo: Test your prompts, agents, and RAGs. Red teaming/pentesting/vulnerability scanning for AI. Compa.. 2026. 8. 14.
LLM 보안 진단 도구 - NVIDIA/garak 사용해보기! garak이란?NVIDIA가 관리하는 오픈소스 LLM 보안 진단 도구로 공식 문서에서 스스로를 "LLM을 위한 nmap"이라고 부른다. 대상 모델을 지정하면 알려진 공격 기법을 순서대로 던지고 결과를 집계해 준다.이 글은 garak v0.16.0을 설치해서 돌려보고 소스를 읽으면서 확인한 것들을 정리한 기록이다. 특히 궁금했던 건 "공격이 통했다"를 무엇으로 판단하는가였다. GitHub - NVIDIA/garak: the LLM vulnerability scannerthe LLM vulnerability scanner. Contribute to NVIDIA/garak development by creating an account on GitHub.github.com garak은 어떻게 생겼나 다섯 조.. 2026. 8. 12.
[보안 뉴스] AI가 스스로 탈옥해서 해킹까지...? 기사 제목 : 허깅페이스 해킹 ‘AI 안전’ 경종... “가드레일 의존말고 ‘기본’ 충실”날짜 : 2026-07-29기자 : 강현주 기자 기사 내용오픈AI의 ‘GPT-5.6’이 샌드박스를 스스로 뚫고 나와 오픈소스 AI 공유 플랫폼 ‘허깅페이스’를 해킹한 사건이 발생했다.사건은 오픈AI가 GPT-5.6의 자체 테스트를 진행하는 과정에서 벌어졌다. 오픈AI는 이 모델에게 사이버 보안 관련 벤치마크인 익스플로잇짐(ExploitGym) 평가 문제를 풀게 했는데, 정확한 평가를 위해 사이버 공격 요청을 거부하는 안전 필터, 즉 가드레일(Guardrail) 이 비활성화된 상태였다. 시험은 인터넷이 차단된 샌드박스(Sandbox) 환경에서 진행됐다. 그런데 이 모델은 문제의 답이 허깅페이스에 있을 것이라고 스스로 .. 2026. 8. 5.
Dreamhack - B3 - 막창 좋아하세요? - writeup 보호되어 있는 글 입니다. 2026. 6. 12.
Dreamhack - B3 - mongoboard - writeup 보호되어 있는 글 입니다. 2026. 6. 1.
Dreamhack - G3 - DreamBank - writeup 보호되어 있는 글 입니다. 2026. 4. 26.
728x90