Anthropic 포스트모템 — Claude Code 품질 저하 원인 3가지 공개, 구독자 전원 사용량 리셋
Anthropic이 지난 한 달간 쏟아진 'Claude Code가 멍청해졌다'는 리포트의 원인을 3가지 독립적인 변경으로 특정했다. reasoning effort 기본값을 medium으로 낮춘 결정, 캐싱 최적화 버그로 추론 기록이 매 턴 삭제된 버그, verbosity를 줄이려는 시스템 프롬프트가 코딩 품질을 3% 깎은 이슈다. 4월 20일 v2.1.116에서 모두 수정됐고 구독자 전원 사용량 한도가 리셋됐다.
- 1
3월 4일부터 4월 20일 사이 3개의 독립적 변경이 겹쳐 품질 저하 발생, API는 무관
- 2
reasoning effort 기본값을 high→medium으로 낮춘 게 잘못된 트레이드오프였고 4월 7일 롤백
- 3
유휴 세션 재개 시 thinking 히스토리를 매 턴마다 삭제하는 버그가 건망증·반복·이상한 툴 선택을 유발
- 4
verbosity 감소용 시스템 프롬프트('100단어 이내')가 Opus 4.6/4.7 eval 점수를 3% 떨어뜨림
- 5
사내 실험들이 버그를 마스킹해서 재현이 한 주 넘게 안 됐음
- 6
문제의 PR을 Opus 4.7 Code Review로 역테스트했더니 4.7은 버그를 찾고 4.6은 못 찾음
- 7
앞으로 프롬프트 변경에 soak period + ablation + 점진적 롤아웃 적용
- 8
구독자 전원 사용량 한도 리셋
LLM 프로덕션에서 '체감 지능'은 모델 가중치가 아니라 하네스(harness) 레이어의 사소한 변경에 좌우된다는 걸 보여주는 케이스. 시스템 프롬프트 한 줄, 캐시 최적화 한 조각이 실제 유저에게는 '멍청해졌다'는 전방위 저하로 인식된다.
관련 기사
기가토큰, 언어 모델 토크나이징을 최대 1000배 가까이 빠르게 만든 러스트 토크나이저
Gigatoken은 언어 모델용 토크나이징을 Rust와 SIMD 최적화로 크게 가속하는 프로젝트다. GPT-2 기준 144코어 EPYC에서 24.53GB/s를 찍으며 HuggingFace Tokenizers 대비 989배, tiktoken 대비 681배 빠른 수치를 제시한다.
AI 연구소들이 ‘펠리컨 자전거’ 벤치마크에 몰래 최적화했을까?
사이먼 윌리슨이 LLM 출시 때마다 던지던 “자전거 타는 펠리컨 SVG를 그려줘” 프롬프트가 너무 유명해지자, AI 연구소들이 여기에 맞춰 모델을 튜닝한 게 아니냐는 의심이 나왔다. 글쓴이는 7개 프런티어 모델로 1,008개 SVG를 만들고 LLM 판정, 특징 추출, 회귀 분석까지 돌렸지만 뚜렷한 증거는 거의 없다고 결론낸다.
알파벳, 구글 클라우드 82% 성장에도 검색 광고와 투자비가 숙제
알파벳이 2분기 매출 1198억달러로 시장 전망을 넘겼고, 구글 클라우드는 전년 대비 82% 성장하며 실적을 끌어올렸다. 다만 검색 광고 매출은 기대치를 아주 살짝 밑돌았고, 인공지능 인프라 투자를 위한 자본지출이 449억달러까지 커지면서 투자자들이 수익화 시점을 더 예민하게 보기 시작했다.
알파벳, AI 투자 논란을 클라우드 82% 성장으로 받아침
알파벳이 2026년 2분기 매출 1198억달러를 기록하며 시장 예상치를 넘겼다. 특히 구글 클라우드 매출이 82% 뛰면서, AI 투자가 비용이 아니라 실제 매출과 이익을 만드는 사업으로 바뀌고 있다는 신호를 줬다. 검색·유튜브 광고도 버티면서 AI가 기존 사업을 잠식한다는 우려도 일단 눌렀다.
알파벳 2분기 실적, 진짜 주인공은 순이익보다 구글 클라우드와 AI 투자
알파벳이 2분기 매출 1198억달러를 기록하며 시장 예상치를 넘겼고, 12분기 연속 두 자릿수 성장도 이어갔어. 다만 순이익과 주당순이익이 폭발적으로 뛴 건 스페이스X 상장에 따른 투자자산 평가이익 영향이 커서, 실제 영업 체력은 클라우드 성장과 AI 인프라 투자 쪽을 봐야 하는 상황이야.
댓글
댓글
댓글을 불러오는 중...