클로드 페이블 5, 보안 코딩 벤치마크에서 애매한 성적표 받음
엔도어 랩스가 클로드 페이블 5를 실제 취약점 수정 작업 200개로 테스트했더니 기능 통과율은 59.8%, 보안 통과율은 19.0%에 그쳤다. 대신 이전 어떤 모델도 못 풀었던 4개 취약점은 처음으로 해결했고, 동시에 타임아웃과 훈련 데이터 회상으로 보이는 치팅도 역대급으로 많이 나왔다.
- 1
실제 코드 취약점 수정 기준으로 기능 통과율 59.8%, 보안 통과율 19.0%를 기록함
- 2
40분 제한을 넘긴 타임아웃이 15건으로 해당 리더보드에서 가장 많았음
- 3
200개 중 38개 작업에서 치팅 신호가 확인됐고, 대부분은 훈련 데이터 회상으로 판단됨
- 4
스트림릿, jwcrypto, lxml, scrapy-splash의 4개 취약점은 이전 모델들이 못 풀었던 첫 성공 사례로 남음
이 결과가 재밌는 건 모델이 ‘보안 문제를 설명하거나 공격하는 능력’과 ‘실제 프로덕션 코드를 안전하게 고치는 능력’이 꽤 다르다는 걸 보여준다는 점임. 코딩 에이전트를 보안 자동화에 쓰려면 점수 하나보다 타임아웃, 테스트 통과 방식, 패치 출처까지 같이 봐야 함.
관련 기사
AI 학습 데이터 때문에 희귀본까지 잘려 나간다는 얘기
AI 기업들이 학습 데이터 확보를 위해 절판본과 희귀본을 대량 구매한 뒤, 고속 스캐너에 넣으려고 책등을 잘라 원본을 폐기한다는 폭로성 글이다. 특히 2022년 이전 책은 AI 생성 텍스트가 섞이지 않은 데이터라 더 비싸게 취급되고, 구매자를 숨겨주는 중개 서비스까지 등장했다는 점이 핵심이다.
문샷AI, 허깅페이스에 3조급 오픈 모델 키미 K3 예고
문샷AI가 차세대 오픈 프런티어 모델 Kimi K3를 허깅페이스에 공개하겠다고 예고했다. K3는 세계 최초의 오픈 3T급 모델을 내세우며, 장기 코딩 작업, 지식 업무, 추론, 에이전트 기능을 겨냥한다.
오픈AI, 아틀라스 접고 브라우저 대신 챗GPT에 에이전트 기능 흡수
오픈AI가 챗GPT 중심의 AI 브라우저 아틀라스를 종료하고, 그 기능을 챗GPT 데스크톱 앱과 크롬 확장으로 옮긴다. 브라우저 자체를 목적지로 삼기보다 사용자가 이미 머무는 크롬과 데스크톱 환경에 에이전트 기능을 심는 쪽으로 방향을 바꾼 셈이다.
중국 DRAM 업체 CXMT, 상장 첫날 472% 폭등
중국 메모리 반도체 업체 CXMT가 상하이 STAR 마켓 상장 첫날 주가가 472% 뛰면서 본토 상장사 중 최대 시가총액 기업이 됐다. AI 수요와 미국 수출 통제 속에서 중국이 자체 DRAM과 HBM을 확보하려는 흐름이 겹친 결과지만, 장비 접근 제한과 시장 점유율 격차는 여전히 큰 숙제다.
알파벳, 클라우드 82% 성장했지만 AI 인프라 투자로 현금흐름 첫 적자
알파벳이 2분기 매출 1198억 달러를 기록하며 시장 전망을 넘겼고, 클라우드 매출은 82% 급증한 248억 달러까지 뛰었다. 하지만 AI 인프라에 분기 449억 달러를 투입하면서 잉여현금흐름은 2004년 상장 이후 처음으로 분기 적자를 냈다.
댓글
댓글
댓글을 불러오는 중...