Google, Gemini 3.5 Flash에 PC 조작 기능 통합
Google은 인공지능 모델 「Gemini 3.5 Flash」에 컴퓨터, 브라우저, 모바일 기기를 자율 조작할 수 있는 「Computer Use」 기능을 직접 통합했다. PC 조작 평가 지표인 「OSWorld」 벤치마크에서 78.4를 기록했으며, 이는 GPT-4.5와 동등 수준으로 평가된다. 개발자는 Gemini API를 통해 이 기능을 이용할 수 있으며, 소프트웨어 테스트 및 사무 업무 자동화 등에 활용될 것으로 예상된다.

Google은 인공지능 모델 「Gemini 3.5 Flash」에 「Computer Use」 기능을 직접 내장했다고 발표했다. 이를 통해 해당 모델은 개인용 컴퓨터, 브라우저, 모바일 기기의 화면을 인식하면서 자율적으로 조작할 수 있게 되었다.
「Computer Use」란 인공지능이 인간을 대신하여 컴퓨터를 조작하는 기능을 의미한다. 예를 들어 브라우저를 열어 양식에 입력하거나, 응용 프로그램을 실행하여 특정 조작을 연속으로 수행하는 작업을 인공지능이 자체적으로 판단하면서 실행할 수 있다. 이전에는 이러한 기능들이 전용 소프트웨어나 복잡한 설정을 필요로 했지만, 이번에는 모델 자체에 그 능력이 내장된 형태가 되었다.
인공지능이 컴퓨터를 자율 조작하는 접근 방식은 최근 「AI 에이전트」로서 업계 전체에서 주목을 받고 있는 분야다. OpenAI와 Anthropic 등 주요 인공지능 기업들이 각각 유사한 기능 개발을 진행하고 있으며, Google이 이번에 이 기능을 모델에 직접 통합한 것은 그러한 경쟁 속에서의 한 수로 위치지어진다.
성능 면에서는 PC 조작 작업의 평가 지표로 널리 사용되는 「OSWorld」 벤치마크에서 78.4라는 점수를 기록했다. 이 점수는 OpenAI의 GPT-4.5와 동등 수준에 있는 것으로 평가된다. OSWorld는 인공지능이 실제 운영 체제 위에서 얼마나 정확하게 조작할 수 있는지를 측정하는 벤치마크로, 높은 점수는 실무적 상황에서의 신뢰성 높음을 나타내는 지표가 된다.
개발자는 Google의 API (응용 프로그램 간 연결 인터페이스)인 「Gemini API」를 통해 이 기능을 이용할 수 있다. 상정되는 용도로는 소프트웨어의 테스트 자동화 및 사무 업무의 자동화 등이 꼽히고 있으며, 기업의 업무 효율화를 담당하는 도구 개발에 활용될 것으로 예상된다.
이 기능 통합이 갖는 의미는 단순한 성능 향상에 그치지 않는다. 인공지능이 모델 단독으로 화면을 보고 조작까지 완결할 수 있게 됨으로써, 이제까지 인력이 필요했던 정형적인 PC 작업의 대다수를 AI 에이전트에 맡기는 환경이 정비되어 가고 있다고 할 수 있다. 개발자가 손쉽게 에이전트를 구축할 수 있게 되면, 기업 시스템으로의 통합도 가속화될 가능성이 있다.
향후 주목 포인트는 실제 업무 환경에서 얼마나 안정적으로 동작하는가이다. 벤치마크 상의 수치와 실운용에서의 신뢰성이 반드시 일치하지는 않기 때문에, 다양한 조건 하에서의 검증이 중요해진다. Gemini API를 통한 제공이라는 형식은 많은 개발자가 시도하기 쉬운 환경을 정비했다는 점에서 보급으로의 발판이 될 수 있다.
본 기사는 AI issue 편집부가 사실(fact)을 바탕으로 독자적으로 작성·편집한 저작물입니다. 저작권은 AI issue에 있으며, 무단 전재·재배포 및 AI 학습·활용을 금합니다.