AI 코딩 도구 'Over-Editing' 문제 정량 측정 — GPT-5.4가 가장 심하고 Claude Opus 4.6이 가장 얌전
Cursor, Copilot, Claude Code 같은 AI 코딩 도구가 버그 한 줄만 고쳐달라는 요청에 함수 절반을 다시 쓰는 'Over-Editing' 문제를 정량화한 연구. 400개 문제를 프로그램적으로 오염시켜 최소 수정 기준을 수학적으로 정의하고, 프론티어 모델들을 Pass@1과 편집 최소성 두 축으로 비교했다. RL 훈련으로 over-editing을 개선하면서도 일반 코딩 능력을 보존할 수 있음을 보였다.
- 1
Over-editing은 테스트로 잡히지 않는 브라운필드 실패 유형 — 코드 리뷰 부담만 폭증
- 2
GPT-5.4는 Levenshtein 0.39, Pass@1 0.723으로 가장 심함 / Claude Opus 4.6은 Pass@1 0.912, Levenshtein 0.06으로 최고
- 3
BigCodeBench 문제를 기계적으로 오염(연산자 뒤집기 등)시켜 ground truth를 수학적으로 정의
- 4
'원본 보존해라' 한 줄 프롬프트만 추가해도 모든 모델 개선, Pass@1까지 오름
- 5
리즈닝 모델은 디폴트로 over-edit 더 함 (Opus 4.6은 예외) — 단 명시 지시 시 역전
- 6
RL만이 out-of-domain 일반화 성공, SFT는 LiveCodeBench에서 43% 성능 저하
- 7
LoRA rank 64가 full RL에 거의 근접 — 스타일 튜닝엔 적은 파라미터로 충분
Pass@1이라는 단일 지표 시대가 끝나고 '얼마나 얌전하게 고치는가'가 새로운 평가 축으로 등장했다. 실무적으로는 모델 선택과 프롬프트 문구 하나가 코드 리뷰 부담을 좌우한다는 구체적 근거가 된다.
관련 기사
테렌스 타오가 풀어쓴 야코비안 추측 반례, AI가 찾은 3차원 반례의 구조
테렌스 타오가 Fable AI로 발견된 3차원 야코비안 추측 반례를 기하적으로 해설한 글이다. 핵심은 상수 야코비안을 가진 다항식 사상이 국소적으로는 가역처럼 보이지만 전역적으로는 가역이 아닐 수 있다는 걸 명시적 예제로 보인 점이다. 2차원 문제는 여전히 열려 있고, 이번 반례는 3차원 이상에서 추측이 거짓임을 보여준다.
RAG 장기 기억 시스템을 감사했더니 ‘관계 이정표’ 1,751개 중 62%가 잡음이었다
한 대화형 AI의 장기 기억 시스템이 몇 달 동안 잘못 추출된 ‘관계 이정표’를 계속 프롬프트에 주입하면서 응답 품질을 망치고 있었다. 팀은 11단계 검색 추적기와 26개 골든셋으로 문제를 측정하고, 추출기 게이트와 기존 데이터 격리 절차를 적용했다. 결과적으로 새 이정표 생성은 하루 6.5개에서 0.5개로 줄었지만, 정확한 기억도 맥락 없이 주입되면 여전히 틀린 응답이 될 수 있다는 교훈이 남았다.
애플 새 음성 인식 API, 온디바이스 영어 전사에서 위스퍼 스몰까지 이겼다
애플의 새 음성 인식 API인 스피치애널라이저가 리브리스피치 벤치마크에서 기존 SFSpeechRecognizer는 물론 위스퍼 스몰보다도 낮은 단어 오류율을 기록했어. 깨끗한 음성에서는 2.12%, noisy 음성에서는 4.56%로, 기존 애플 API 대비 오류율을 3.5~4배 줄였고 위스퍼 스몰보다 약 3배 빠르게 돌았어. 다만 영어·애플 플랫폼·OS 26 조건의 결과라, 다국어와 크로스플랫폼에서는 여전히 위스퍼의 장점이 남아 있어.
AI를 진짜 잘 쓰는 기업, 미국 증시에서 연 30% 프리미엄 받는다는 연구
예일대와 로체스터대 연구진이 기업의 실제 대형 언어 모델 사용 데이터를 분석했더니, AI 활용도가 높은 상위 20% 기업이 하위 20%보다 주당 평균 0.64% 높은 초과수익률을 냈다. 단순히 AI 기업이냐가 아니라, 업무에 AI를 얼마나 깊게 쓰는지가 시장 가치에 반영되고 있다는 얘기다.
ZTE, AI 에이전트폰으로 스마트폰 재도전…진짜 승부처는 앱 생태계
ZTE가 바이트댄스의 더우바오를 탑재한 AI 에이전트 스마트폰으로 시장 재진입을 노린다. 핵심은 사용자가 명령하면 AI가 여러 앱을 직접 열고 조작하는 방식인데, 위챗·타오바오·알리페이 같은 플랫폼과 충돌하면서 생태계 문제가 가장 큰 변수로 떠올랐다.
댓글
댓글
댓글을 불러오는 중...