Anthropic, 신형 플래그십 모델 「Claude Opus 5」 발표
Anthropic이 AI 모델의 새로운 플래그십 「Claude Opus 5」를 발표했다. 코딩 및 지식 작업 벤치마크에서 높은 점수를 기록하면서 경쟁 모델로 평가되는 「Fable 5」의 약 절반 수준의 토큰 단가를 실현했다고 밝혔다. 문제 해결 능력을 측정하는 「ARC-AGI-3」에서는 30.2%를 달성했으며, 이는 GPT-5.6 Sol의 약 4배 수준의 점수라고 발표했다.

Anthropic이 동사의 새로운 주력 AI 모델 「Claude Opus 5」를 발표했다. 코딩 및 지식 작업 분야에서 높은 점수를 기록하면서 경쟁 모델과 비교하여 토큰 단가를 대폭 낮춘 것이 특징이다.
AI 업계에서는 현재 모델의 성능 경쟁과 함께 「비용 효율성」이 중요한 평가 축으로 부상하고 있다. 고성능 모델일수록 이용 비용이 높아지기 쉬운 가운데, Anthropic은 성능과 가격의 균형을 강조 포인트로 제시했다. 이러한 움직임은 기업이 AI를 실무에 적용할 때 가격이 병목이 되기 쉽다는 업계 전체의 과제 인식을 반영하는 것으로 보인다.
발표에 따르면, Claude Opus 5의 토큰 단가는 OpenAI의 「GPT-4.5」에 해당하는 것으로 평가되는 경쟁 모델 「Fable 5」의 약 절반으로 설정되어 있다. 성능 측면에서는 코딩 및 지식 작업 벤치마크에서 최고 수준의 점수를 기록했다고 Anthropic이 주장하고 있다. 또한 새로운 문제 해결 능력을 측정하는 지표로 평가되는 「ARC-AGI-3」에서는 30.2%의 점수를 달성했으며, 「GPT-5.6 Sol」의 약 4배 수준에 해당한다고 하고 있다.
ARC-AGI-3은 AI가 기존의 학습 패턴에 의존하지 않고 처음 보는 과제를 얼마나 해결할 수 있는지를 측정하는 벤치마크다. 단순한 지식의 암기나 재현이 아니라 추론과 응용의 유연성을 묻는 내용으로 자리매김되고 있으며, 이 점수의 차이는 단순한 처리 속도나 지식량 이외의 능력 차를 나타내는 것으로 볼 수 있다. 다만 벤치마크 결과가 실제 업무 이용에서의 우위성으로 직결되는지는 용도와 환경에 따라 다르다는 점에 유의할 필요가 있다.
금번 발표가 지니는 의미는 성능 자체에 그치지 않는다. 「고성능=고가격」이라는 종래의 구도에 대해 Anthropic이 가격 경쟁력을 동시에 제시한 것은 기업용 AI 시장에서의 선택지 확대라는 관점에서 주목할 가치가 있다. 특히 비용을 이유로 AI 도입을 신중하게 진행해온 조직에게 이러한 가격 책정은 검토의 계기가 될 수 있다고 자리매김된다.
한편, Anthropic이 제시한 성능 수치는 동사의 발표에 기반하는 것이며, 독립된 제3자 기관에 의한 검증은 아직 확인되지 않았다. 벤치마크의 비교는 각사가 각각 유리한 조건에서 측정하는 경우도 있기 때문에 실제 이용 현장에서의 평가를 기다릴 필요가 있다. 향후 개발자 및 기업에 의한 실사용 검증이 진행되는 가운데 Claude Opus 5의 실력이 더욱 명확해질 것으로 예상된다.
AI 모델의 경쟁은 최고 성능을 추구하는 것뿐 아니라 「사용하기 쉬운 가격으로 충분한 성능을 제공할 수 있는가」라는 방향으로도 확대되고 있다. Anthropic의 금번 움직임은 그 흐름을 가속화하는 한 가지 사례로 볼 수 있다. 업계 전체로서 모델의 상용화(범용화·저가격화)가 진행되는 가운데, 각사가 어떤 차별화 전략을 제시할지가 앞으로의 경쟁의 초점이 되어갈 것이다.
본 기사는 AI issue 편집부가 사실(fact)을 바탕으로 독자적으로 작성·편집한 저작물입니다. 저작권은 AI issue에 있으며, 무단 전재·재배포 및 AI 학습·활용을 금합니다.