xAI「Grok 4.6」, GPT-5와 동등 수준에서 더 낮은 가격
xAI의 언어 모델 「Grok 4.6」이 Artificial Analysis의 벤치마크 지수에서 OpenAI의 「GPT-5.6 Sol」과 동일하게 61점을 기록했다. 에이전트 작업에서는 경쟁사인 Claude Opus 5의 약 절반 수의 단계로 처리를 완료하며, 가격은 Claude Opus 5보다 60% 이상 낮은 수준으로 책정되어 있다.

xAI가 개발한 언어 모델 「Grok 4.6」이 성능 평가에서 OpenAI의 「GPT-5.6 Sol」과 동일한 점수를 기록했다. 제3자 기관 Artificial Analysis가 공표하는 인공지능 벤치마크 지수에서 두 모델 모두 61점을 획득하여 Anthropic의 「Claude Opus 5」에 이어 2위에 나란히 올랐다. 최상위 등급의 모델들이 치열하게 경쟁하는 구도가 다시 한번 드러난 형태라 할 수 있다.
근년에 대규모 언어 모델의 성능 경쟁은 상위 모델 간에 빠르게 접근하고 있으며, 단순한 정확도 지표만으로 차이를 드러내기 어려워지고 있다. 이러한 상황 속에서 주목받고 있는 것이 「에이전트 성능」과 「비용」이라는 2가지 평가 축이다. 에이전트란 사용자의 지시를 받아 여러 단계를 자율적으로 수행하는 인공지능의 동작 모드를 의미하며, 복잡한 업무의 자동화에 직결되므로 산업 활용에서의 중요성이 높아지고 있다.
에이전트 작업에서의 구체적인 수치를 보면 Grok 4.6은 복잡한 워크플로를 약 53단계로 완료한다. 한편, 같은 범주에서 최고 평가를 받고 있는 Claude Opus 5는 유사한 작업에 103단계를 요구한다. 적은 단계로 동등 이상의 처리를 수행할 수 있다는 것은 처리 속도의 향상이나 응용프로그래밍인터페이스 비용의 절감으로 이어지며, 기업이 실제로 시스템에 통합할 때의 장벽을 낮추는 효과가 있다고 할 수 있다.
가격 면에서도 차이는 크다. Grok 4.6의 요금은 Claude Opus 5와 비교하여 60% 이상 낮은 수준으로 책정되어 있으며, 성능과 가격 양면에서 OpenAI나 Anthropic에 대한 대항축을 제시하는 전략이 보인다. 높은 성능을 갖추면서 낮은 비용을 구현할 수 있다면, 비용 의식이 높은 기업 사용자나 개발자에 대해 호소력이 높아질 것으로 위치지어진다.
xAI는 일론 머스크가 설립한 인공지능 기업으로, Grok 시리즈는 X(구 Twitter)의 플랫폼과도 연계하면서 개발이 계속되고 있다. 같은 회사가 Grok을 지속적으로 업데이트하고 있는 배경에는 OpenAI나 Anthropic이 선행하는 엔터프라이즈급 인공지능 시장에서의 존재감을 높이려는 의도가 있다는 평가가 가능하다. 이번 평가 결과는 그러한 전략의 하나의 성과로 포착할 수 있다.
이번 결과가 보여주는 것은 최상위 모델의 성능이 비슷해지고 있는 한편 「얼마나 효율적으로」 「얼마나 저렴하게」 사용할 수 있는지라는 실용면의 경쟁이 본격화하고 있다는 점이다. 특히 에이전트 기능의 효율성은 인공지능을 업무 시스템에 통합하는 기업에게 직접 비용에 영향을 미치는 요소이며, 향후의 선정 기준으로서 더욱 중시될 것으로 예상된다. 벤치마크 상의 점수뿐만 아니라 실제 운용에서의 비용 대비 성능에 주목이 모이는 흐름은 앞으로도 계속될 것으로 보인다.
본 기사는 AI issue 편집부가 사실(fact)을 바탕으로 독자적으로 작성·편집한 저작물입니다. 저작권은 AI issue에 있으며, 무단 전재·재배포 및 AI 학습·활용을 금합니다.