Google, Gemini의 동영상 분석을 에이전트형으로 혁신
Google은 AI 모델 'Gemini'의 3가지 버전(3.7 Flash, 3.6 Flash, 3.5 Flash-Lite)에 에이전트형 동영상 분석 기능을 추가했다. 새로운 방식에서는 모델 자체가 어느 장면을 어느 해상도로 분석할지 자율적으로 판단하며, 기존의 균일한 프레임 로딩에 비해 토큰 사용량을 최대 88% 감소시킬 수 있다고 Google은 설명하고 있다. 정확도 향상도 기대되며, 특히 장시간 영상 처리에서 효과가 크다고 설명했다.

Google은 AI 모델 'Gemini'의 여러 버전에 새로운 동영상 분석 기능을 추가했다. 대상이 되는 것은 Gemini 3.7 Flash, 3.6 Flash, 3.5 Flash-Lite의 3가지 모델이며, 동영상을 처리할 때의 방식이 기존과는 크게 다른 '에이전트형'이라고 불리는 방식으로 변경된다.
기존의 동영상 분석에서는 영상을 컷 단위로 일정한 간격에서 프레임별로 로딩하는 방식이 일반적이었다. 이 방법은 단순한 반면, 움직임이 적은 장면에서도 많은 처리 리소스를 소비한다는 문제가 있다. 또한 영상의 길이가 증가할수록 처리 비용(AI에서는 '토큰'이라고 불리는 계산 단위로 측정됨)이 비례하여 증가하는 구조이며, 특히 수시간에 걸친 장시간 영상을 다룰 때는 비효율성이 두드러졌다.
새로운 에이전트형 방식에서는 모델 자체가 어느 장면을 중점적으로 살펴볼지를 판단한다. 즉, 영상 전체를 균일하게 처리하는 것이 아니라 중요하다고 판단한 부분을 선택하여 분석한다. 더욱이 각 장면을 어느 정도의 세밀도(해상도)로 로딩할지도 모델이 자동으로 판단하기 때문에, 필요한 부분에는 상세한 분석을 수행하고 그렇지 않은 부분에는 가벼운 처리로 마칠 수 있다.
Google에 따르면 이 방식으로의 전환을 통해 토큰 사용량을 최대 88% 감소시킬 수 있다고 한다. 동시에 분석의 정확도도 향상된다고 하며, 특히 수시간 규모의 장시간 영상에서 그 효과가 두드러지게 나타난다고 설명했다. 토큰 사용량의 감소는 처리 비용의 저하로 직결되기 때문에, API를 통해 Gemini를 이용하는 개발자와 기업에게는 직접적인 비용 절감으로 이어질 가능성이 있다.
이러한 움직임은 AI 모델의 처리 효율을 둘러싼 경쟁이 활발해지는 흐름과도 맞아떨어진다. 대규모 영상 데이터를 다루는 비즈니스 용도에서는 정확도의 높이와 마찬가지로 비용 효율성이 중요한 선정 기준이 되고 있으며, 장시간 녹화 영상을 자동으로 분석하는 시스템에 대한 수요는 높아지고 있다. 이러한 용도에서 얼마나 저비용이면서도 높은 정확도의 처리를 구현할 수 있는지가 모델의 경쟁력을 좌우하는 요소 중 하나로 자리잡혀 있다.
에이전트형 분석은 모델이 작업에 따라 자율적으로 판단하면서 처리를 진행한다는 생각에 기반하고 있으며, 최근 AI 분야에서 확산되고 있는 'AI 에이전트'의 개념을 모델의 내부 처리에도 적용한 형태라고 할 수 있다. 고정된 규칙에 따라 일률적으로 처리하는 것이 아니라 상황에 따라 판단을 바꾸는 이 접근법은 텍스트 처리나 검색 등의 분야에서도 AI 성능 향상의 핵심이라고 여겨지고 있으며, 동영상 분석으로의 본격적인 적용은 하나의 전환점으로 볼 수 있다.
향후 이 방식이 어느 정도의 실무 현장에서 활용될지, 또한 다른 모델이나 경쟁 서비스에도 유사한 접근법이 확산될지가 주목된다. 동영상을 다루는 업무 시스템이나 감시·분석 도구로의 도입을 검토 중인 사업자에게는 실제 사용 사례에서의 비용 절감 효과와 정확도를 정확히 파악하는 것이 다음 판단의 축이 될 것이다.
본 기사는 AI issue 편집부가 사실(fact)을 바탕으로 독자적으로 작성·편집한 저작물입니다. 저작권은 AI issue에 있으며, 무단 전재·재배포 및 AI 학습·활용을 금합니다.