본문으로 건너뛰기
피드

오픈AI GPT-5.5 공개 — 적은 자원으로 더 높은 성능, 그래도 앤스로픽 미토스엔 밀렸다

ai-ml 약 4분
vote
0
댓글
북마크

오픈AI가 GPT-5.5를 출시했다. 전작 대비 적은 컴퓨팅 자원으로 더 높은 성능을 낸다는 효율 중심 업그레이드다. 다만 Terminal-Bench 2.0에서 앤스로픽 미토스(92.1%)에 10%p 차이로 밀려 성능 1위 자리는 되찾지 못했다.

  • 1

    Terminal-Bench 2.0에서 82.7% 기록, 전작 GPT-5.4 대비 7.5%p 상승

  • 2

    GDPval 전문직 업무 평가에서 84.9% 성공률, 전작 대비 1.9%p 개선

  • 3

    앤스로픽 미토스는 Terminal-Bench 2.0에서 92.1%로 여전히 앞서있는 상태

  • 4

    오픈AI는 미토스 대비 파라미터 수나 성능 비교 질문에 즉답 회피

  • 5

    성능 경쟁 축이 '절대 성능'에서 '비용 대비 성능(compute economy)'으로 이동

  • 오픈AI가 23일(현지시간) GPT-5.5를 출시 — 전작 대비 적은 컴퓨팅 자원으로 더 높은 성능을 내는 걸 핵심 세일즈 포인트로 내세움
    • 그렉 브록만 오픈AI 사장 왈 "5.4와 비교해 더 적은 토큰으로 더 빠르고 날카롭게 사고한다"
    • 토큰당 지연 시간은 전작과 비슷하게 유지하면서도 지능만 끌어올렸다는 주장
    • "컴퓨팅 자원 경제(compute economy)로 이동하고 있다"는 발언에서 보듯, 이제는 raw 성능보다 '비용 대비 성능'이 싸움터가 되는 분위기

벤치마크 — 전작 대비 개선, 그러나 미토스엔 밀림

  • 전문직 업무 1320개 수행 능력을 평가하는 GDPval에서 84.9% 성공률 기록 (전작 대비 +1.9%p)
  • AI 에이전트 코딩 능력 측정 벤치인 Terminal-Bench 2.0에서는 82.7% (전작 대비 +7.5%p) — 코딩 쪽에서 확실히 점프
  • 문제는 경쟁사 앤스로픽의 '미토스(mythos)'
    • 같은 Terminal-Bench 2.0에서 미토스는 92.1% — GPT-5.5를 거의 10%p 차이로 압도
    • 미토스는 40개 파트너사에만 제한적으로 공개된 상태라 일반 사용자가 접근하긴 힘듦

중요

> 이번 출시의 진짜 메시지는 "성능 1위 탈환"이 아니라 "같은 가격에 더 많이 쓰게 해주겠다"임. 엔터프라이즈 관점에선 이게 오히려 실용적인 포인트

비교 질문엔 즉답 회피

  • 오픈AI 측은 미토스와의 성능 비교 질문에 "성능 지표를 확인해보라"며 즉답을 피함
  • 파라미터 수가 미토스(10조 개)보다 많은지 물었을 때도 "답하기 어렵다"고 응답 — 모델 스펙 공개에 보수적인 기조 유지
  • 앤스로픽 미토스의 10조 파라미터라는 수치 자체도 업계 관찰자 입장에선 흥미로운 정보

기술 맥락

GPT-5.5의 진짜 포인트는 '토큰당 지연 시간은 그대로, 지능은 더 높게'라는 효율성 측면이에요. 예전엔 모델 하나 더 똑똑하게 만들려면 파라미터를 키우고 연산량을 더 쏟아부어야 했는데, 이제는 같은 연산 예산 안에서 더 나은 결과를 뽑아내는 방향으로 경쟁축이 이동하고 있거든요. 기업 입장에선 이게 돈 문제거든요. API 쓸 때마다 토큰당 비용이 나가는데, 같은 답을 더 적은 토큰으로 뽑아내면 곧바로 운영비 절감으로 이어져요.

Terminal-Bench 2.0은 AI 에이전트가 실제 셸 환경에서 명령어를 실행하며 멀티스텝 작업을 수행하는 능력을 측정하는 벤치마크예요. 단순히 "이 코드 짜줘"가 아니라 "파일을 찾고, 의존성을 설치하고, 테스트를 돌려서 실패하면 고쳐라" 같은 실무형 시나리오를 다루거든요. 여기서 82.7%가 나왔다는 건 실제 개발 워크플로우에 꽂아 쓸 만한 수준에 가까워졌다는 뜻이에요.

GDPval은 오픈AI가 만든 '실제 직업군 업무 수행 능력' 평가 체계로, 1320개의 전문직 태스크를 돌려서 인간 수준을 얼마나 대체 가능한지 보는 지표예요. 84.9%라는 숫자가 인상적이긴 한데, 벤치 설계자가 모델 만든 회사랑 같다는 건 감안해서 볼 필요가 있어요.

오픈AI가 '성능 1위'보다 '같은 값에 더 많이'를 선택한 듯한 출시. 미토스가 프론티어를 가져간 사이 오픈AI는 엔터프라이즈 경제성에 집중하는 전략이 보인다.

댓글

댓글

댓글을 불러오는 중...

ai-ml

알파벳, 클라우드 82% 성장했지만 AI 인프라 투자로 현금흐름 첫 적자

알파벳이 2분기 매출 1198억 달러를 기록하며 시장 전망을 넘겼고, 클라우드 매출은 82% 급증한 248억 달러까지 뛰었다. 하지만 AI 인프라에 분기 449억 달러를 투입하면서 잉여현금흐름은 2004년 상장 이후 처음으로 분기 적자를 냈다.

ai-ml

알파벳 클라우드 매출 82% 폭증했는데, 클라우드 ETF는 왜 빠졌나

알파벳의 2분기 클라우드 매출이 전년 대비 82% 늘며 월가 예상치를 크게 넘었지만, 클라우드 관련 ETF는 오히려 하락했다. 시장은 이제 클라우드 매출 성장률만 보는 게 아니라, 그 매출을 만들기 위해 데이터센터와 칩에 얼마나 많은 자본지출이 들어갔는지를 따지고 있다.

ai-ml

젠슨 황 “중국산 오픈소스 AI, 좋으면 써야 한다”

젠슨 황 엔비디아 CEO가 미국 정부의 중국산 오픈소스 AI 모델 규제 움직임에 반대했다. 딥시크, 알리바바, 문샷 AI 같은 중국 모델이 백도어라는 우려는 오해에 가깝고, 좋은 오픈소스 모델은 기업들이 활용할 수 있어야 한다는 주장이다.

ai-ml

업스테이지 ‘솔라 오픈 2’ 공개, 한국어·에이전트 성능으로 독파모 2라운드 승부

업스테이지가 오픈웨이트 LLM ‘솔라 오픈 2’를 공개했다. 2500억 매개변수 중 150억 개만 활성화하는 MoE 구조, 100만 토큰 컨텍스트, H200 2장 구동 가능성을 앞세워 한국어·에이전트·기업 도입성을 동시에 노린 모델이다.

ai-ml

아이벡스, 오픈소스 로봇·비전으로 볼트 검사 투입 자동화한다

아이벡스가 정보통신산업진흥원의 오픈소스 사업화 과제에 선정돼 케이피에프의 자분탐상 검사라인 자동화에 들어간다. 벌크 상태로 쏟아지는 볼트류를 AI 비전으로 인식하고, 6D 자세 추정과 로봇 제어로 집어서 검사장비에 넣는 흐름까지 구현하는 게 핵심이다.