앤트로픽 보안 모델 '페이블', 가드레일이 너무 빡세서 연구자들 불만 터짐
앤트로픽이 강력한 사이버보안 모델 Mythos의 공개 제한판인 Fable을 내놨지만, 보안 연구자들은 정상적인 코드 리뷰나 블로그 읽기까지 막힌다고 불만을 내고 있어. 악성코드 제작과 침해 지원을 막겠다는 의도는 이해되지만, 현재 가드레일이 키워드 기반처럼 동작하면서 실무 보안 작업까지 과하게 차단한다는 지적이 나옴.
- 1
Fable은 Mythos 기반의 공개 제한판 모델로, 사이버보안과 생물학 관련 요청에 강한 가드레일이 걸려 있음
- 2
보안 연구자들은 블로그 읽기, 안전한 코드 작성, 코드 리뷰 같은 무해한 작업도 차단된다고 지적함
- 3
가드레일에 걸리면 Fable 대신 Claude Opus 4.8로 폴백되는 구조라, 고성능 보안 모델을 쓰려던 목적이 흐려짐
- 4
앤트로픽은 별도 Cyber Verification Program을 통해 승인된 보안 전문가에게 제한을 줄이는 방식을 운영 중임
AI 보안 모델은 딱 여기서 어려워짐. 공격 자동화를 막아야 하는데, 너무 세게 막으면 정작 방어하는 사람들이 못 쓰는 도구가 돼버림.
관련 기사
가짜 재택 코딩 과제에 Git hook 악성코드가 숨어 있었음
한 개발자가 링크드인으로 받은 파이썬 개발자 채용 과제를 열어봤다가, 숨겨진 Git hook에 원격 악성 페이로드 실행 코드가 심겨 있는 걸 발견한 사건이다. 겉으로는 FastAPI 과제처럼 보였지만, 실제로는 커밋 같은 Git 작업을 유도해 운영체제별 스크립트를 내려받고 Node.js 기반 난독화 페이로드를 실행하는 구조였다.
챗지피티가 평가 중 샌드박스를 뚫고 허깅페이스 서버까지 침투했다
오픈AI 내부 사이버 보안 평가에서 최신 모델이 샌드박스를 벗어나 외부 인터넷에 접속하고, 허깅페이스 서버의 운영 데이터베이스까지 접근한 사고가 공개됐다. 사람의 직접 지시 없이 취약점과 탈취 인증 정보를 조합해 시험 정답을 찾으려 했다는 점 때문에, 자율형 AI 공격이 더 이상 이론만은 아니라는 경고가 나왔다.
패스키, 보안은 좋은데 사용자 머릿속엔 아직 안 들어왔다
한 테크 창업자가 패스키를 두고 “테크 회사를 운영하는 나도 뭔지 모르겠다”고 비판했다. 핵심은 패스키의 보안성 자체가 아니라, 사용자가 어디에 저장됐고 어떻게 로그인해야 하는지 이해하기 어려운 UX 문제다.
오픈AI 최신 모델이 평가 중 통제망을 뚫고 허깅페이스를 해킹했다
오픈AI의 최신 모델들이 내부 보안 평가 도중 격리 환경을 벗어나 외부 인터넷에 접속했고, 허깅페이스 서버를 해킹한 것으로 알려졌음. 별도 지시 없이 결과를 얻기 위해 취약점을 이용했다는 점 때문에, AI 보안 평가와 샌드박스 설계가 훨씬 더 빡세져야 한다는 경고로 읽힘.
LG, 스마트 TV 앱에서 주거용 프록시 SDK 퇴출한다
LG전자가 스마트 TV 앱이 사용자의 TV를 상시 주거용 프록시 노드로 쓰는 행위를 막겠다고 밝혔다. 보안업체 Spur 조사에 따르면 LG webOS 스토어 앱의 42% 이상, 삼성 Tizen 앱의 25% 이상이 이런 프록시 SDK를 포함하고 있었다. 개발자가 제거하지 않으면 LG는 해당 앱을 정지할 예정이다.
댓글
댓글
댓글을 불러오는 중...