본문으로 건너뛰기
피드

프렌들리AI, 코딩 에이전트 추론 속도 3배·비용 절반 내세운 서버리스 솔루션 공개

ai-ml 약 6분
vote
0
댓글
북마크

프렌들리AI가 국제인공지능대전에서 코딩 에이전트에 최적화된 추론 엔진과 서버리스 엔드포인트를 선보인다. Claude Code 같은 도구에서 환경 변수만 바꿔 오픈소스 모델로 연결하고, 기존 클로즈드 API 대비 50% 이상 비용 절감과 vLLM 대비 최대 3배 빠른 처리 속도를 강조한다.

  • 1

    프렌들리AI는 5월 6일부터 8일까지 서울 코엑스에서 열리는 AI EXPO KOREA 2026에 참가

  • 2

    GLM-5.1, MiniMax, Kimi 등 오픈소스 모델을 별도 인프라 없이 API로 연결하는 서버리스 엔드포인트를 시연

  • 3

    Claude Code, Kilo Code, OpenCode 같은 코딩 에이전트와의 연동 솔루션을 공개

  • 4

    Claude Code는 ANTHROPIC_BASE_URL과 ANTHROPIC_MODEL 환경 변수 변경만으로 MiniMax-M2.5, GLM-5.1 등으로 전환 가능

  • 5

    기존 클로즈드 API 대비 50% 이상 비용 절감, vLLM 대비 최대 3배 빠른 처리 속도를 내세움

  • 프렌들리AI가 AI EXPO KOREA 2026에서 코딩 에이전트용 추론 솔루션을 공개함

    • 행사는 5월 6일부터 8일까지 서울 코엑스 1층 A홀 전관에서 열림
    • 프렌들리AI는 AI 추론 엔진 소프트웨어 기업이고, 대규모 AI 연산 핵심 기술인 연속 배칭을 세계 최초로 개발한 연구진이 창업했다고 소개됨
    • 현재 LG AI Research, SK텔레콤, 업스테이지, 트웰브랩스, 넥스트데이 AI 등이 프로덕션 환경에서 플랫폼을 활용 중이라고 밝힘
  • 이번 부스의 핵심은 “코딩 에이전트를 더 싸고 빠르게 돌리기”임

    • GLM-5.1, MiniMax, Kimi 같은 검증된 오픈소스 모델을 별도 인프라 없이 서버리스 엔드포인트로 제공
    • Claude Code, Kilo Code, OpenCode 같은 코딩 에이전트와 쉽게 붙이는 연동 솔루션을 공개
    • 낮은 레이턴시와 높은 처리량으로 에이전트 루프가 끊기지 않게 하는 전용 추론 엔진을 강조
  • 연동 방식은 꽤 직관적임. Claude Code 기준으로 환경 변수만 바꾸면 됨

    • ANTHROPIC_BASE_URL과 ANTHROPIC_MODEL을 바꾸면 MiniMax-M2.5, GLM-5.1 같은 모델로 전환 가능
    • Kilo Code나 OpenCode도 비슷한 방식으로 고성능 오픈소스 모델과 연결할 수 있다고 설명함
    • 즉, 개발자가 쓰던 에이전트 도구는 유지하고 뒤쪽 추론 백엔드만 갈아끼우는 그림임

중요

> 프렌들리AI가 내세운 숫자는 꽤 세다. 기존 클로즈드 API 대비 비용 50% 이상 절감, 오픈소스 추론 엔진 vLLM 대비 최대 3배 빠른 처리 속도다.

  • 왜 이게 중요하냐면, 코딩 에이전트는 호출 횟수가 많음

    • 일반 챗봇처럼 한 번 답하고 끝나는 게 아니라 계획, 코드 생성, 실행, 오류 수정 루프를 계속 돈다
    • 이때 레이턴시가 높으면 체감 속도가 바로 무너지고, 토큰 비용이 높으면 팀 단위 도입이 부담스러워짐
    • 프렌들리AI는 연산 규모가 커질수록 비용·성능 격차가 더 벌어진다고 주장함
  • 고객 사례도 성능 메시지를 뒷받침하는 쪽으로 제시됨

    • LG AI Research는 커스텀 모델 API가 단 하루 만에 기업용 모니터링 기능까지 탑재돼 라이브 환경에 적용됐다고 평가
    • SK텔레콤은 대용량 데이터 처리가 안정적이고 응답 속도가 빠른 점을 장점으로 언급
    • 단순 데모가 아니라 실제 운영 환경에서 쓰이고 있다는 점을 강조한 셈
  • 한국 개발자 입장에서는 꽤 실용적인 뉴스임

    • Claude Code류 도구를 쓰고 있는데 비용이나 속도가 걸린다면, 모델 API 호환 레이어를 바꿔보는 접근이 가능해짐
    • 특히 오픈소스 모델을 쓰고 싶지만 GPU 인프라 운영은 부담스러운 팀에게 서버리스 추론 엔드포인트는 현실적인 타협점이 될 수 있음

기술 맥락

  • 이 기사에서 기술적 선택은 “좋은 모델을 고른다”보다 “에이전트 루프를 버틸 추론 백엔드를 고른다”에 가까워요. 코딩 에이전트는 요청을 한 번 보내고 끝나는 서비스가 아니라, 계속 모델을 호출하면서 코드를 만들고 고치는 구조거든요.

  • 서버리스 엔드포인트를 내세운 이유는 팀이 GPU 인프라를 직접 운영하기 어렵기 때문이에요. 모델은 오픈소스로 쓰고 싶지만 배포, 스케일링, 모니터링까지 직접 맡으면 운영 부담이 너무 커져요.

  • 환경 변수만 바꿔 Claude Code 같은 도구와 연결하는 방식은 마이그레이션 비용을 낮추려는 선택이에요. 개발자 워크플로우를 바꾸지 않고, 뒤쪽 모델 제공자와 추론 엔진만 교체할 수 있어야 실제 도입이 쉬워요.

  • vLLM 대비 최대 3배 빠르다는 주장은 추론 엔진 레이어의 경쟁을 보여줘요. 코딩 에이전트에서는 레이턴시가 곧 작업 시간이고, 작업 시간이 곧 비용이라서 추론 최적화가 제품 경쟁력으로 바로 이어져요.

코딩 에이전트가 실무 도구가 되려면 모델 성능만큼 중요한 게 추론 지연과 비용이다. 프렌들리AI의 메시지는 개발자가 쓰던 에이전트 도구는 유지하되, 뒤쪽 모델과 추론 엔진만 바꿔 더 싸고 빠르게 돌리자는 쪽이다.

댓글

댓글

댓글을 불러오는 중...

ai-ml

엘지, 7500억 파라미터급 케이 엑사원 2.0 오픈소스로 공개

엘지 AI연구원이 7500억 파라미터 규모의 케이 엑사원 2.0을 허깅페이스에 공개했다. 이전 2360억 파라미터 모델보다 3배 이상 커졌고, 장문 이해 평가에서 중국 모델을 크게 앞섰다는 수치가 제시됐다.

ai-ml

구글 어스 AI 편집 기능, 가짜 위성사진 논란으로 하루 만에 철회

구글이 구글 어스에 AI 이미지 생성 도구 나노 바나나 2를 붙였다가 허위정보 악용 우려로 24시간도 안 돼 기능을 롤백했어. 실제 지형과 건물 위에 전쟁, 폭발, 군사시설 같은 가짜 장면을 그럴듯하게 만들 수 있다는 점이 OSINT 전문가들의 강한 반발을 불렀어.

ai-ml

국가가 AI 경쟁을 이유로 개인정보 원칙을 흔들 때 생기는 문제

이 글은 소셜미디어의 개인정보 제공, 기업의 데이터 수집, 국가 주도의 AI 정책을 하나의 흐름으로 묶어 비판한다. 특히 피지컬 인공지능 특별법안처럼 영상·음성 정보를 정보주체 동의 없이 수집할 수 있게 하는 특례가 개인의 존엄과 자기결정권을 AI 경쟁력보다 뒤로 미루는 신호라고 본다.

ai-ml

오픈AI, 멀티 에이전트 모델 ‘아스트라’ 비공개 시연했다는 보도 나옴

오픈AI가 차세대 모델 라인업으로 알려진 ‘아스트라’를 미국 정책 입안자와 규제 당국자에게 비공개 시연했다는 보도임. 핵심은 여러 AI 에이전트가 오래 상호작용하며 복잡한 프로젝트나 고급 수학 문제를 단계적으로 푸는 멀티 에이전트 협업 능력임.

ai-ml

한국, AI 허브 되겠다고 미국 빅테크와 남미 광물 공급망을 한 번에 묶음

이재명 대통령 순방 성과 브리핑의 핵심은 한국을 메모리 반도체 공급국을 넘어 글로벌 AI 공급망의 중심축으로 만들겠다는 구상임. 미국에서는 AI 빅테크와 벤처캐피털을 만나고, 브라질·칠레·아르헨티나에서는 희토류·리튬·구리 같은 핵심광물 협력 채널을 열었다는 내용임.