인공지능

Google, Gemini에 토큰 사용량을 최대 88% 줄이는 에이전틱 동영상 이해 기능 출시

Google은 Gemini 3.7 Flash, 3.6 Flash, 3.5 Flash-Lite에 ‘에이전틱 동영상 이해’ 기능을 추가했다. 이를 통해 모델은 동영상을 고정된 프레임 속도로 처리하는 대신 검사해야 할 부분과 매체를 직접 결정한다. 회사는 이 기능이 토큰 사용량을 최대 88%, 비용을 최대 66% 줄이고 정확도를 최대 7% 향상한다고 밝혔다.

2026-09-01
3 분 읽기
5 조회수
فريق تحرير certi.news
Google, Gemini에 토큰 사용량을 최대 88% 줄이는 에이전틱 동영상 이해 기능 출시

Google은 Gemini 3.7 Flash, Gemini 3.6 Flash, Gemini 3.5 Flash-Lite에 ‘에이전틱 동영상 이해’(Agentic Video Understanding) 기능을 출시했다고 발표했다. 이 기능은 Google AI Studio와 Gemini Enterprise Agent Platform의 Gemini API를 통해 업로드된 파일과 YouTube 동영상을 분석하는 데 즉시 사용할 수 있다. 회사는 이 기능이 토큰 사용량을 최대 88% 줄이고 분석 비용을 최대 66% 낮추며, 벤치마크 테스트에서 정확도를 최대 7% 향상할 수 있다고 밝혔다.

이번 업데이트는 긴 동영상 분석의 핵심적인 문제를 겨냥한다. 기존 방식은 동영상을 일정한 프레임 속도로 처리하며, 기본값은 초당 1프레임이고 API를 통해 조정할 수 있다. 이 방식은 선택된 샘플에 나타나지 않는 빠른 순간이나 세부 사항을 놓칠 수 있으며, 프레임 속도를 높이면 토큰 수와 비용이 증가한다.

에이전틱 모드는 어떻게 작동하나?

동영상 전체 스트림을 고정된 방식으로 처리하는 대신 Gemini는 무엇을 시청할지, 어떤 속도로 검사할지, 작업에 가장 유용한 매체가 무엇인지 결정할 수 있다. 여기에는 프레임, 오디오, 전사된 텍스트가 포함된다. 모델은 내부 도구를 호출해 목표에 따라 진행되는 반복 과정에서 동영상 파일의 관련 부분을 불러오고, 필요할 경우 특정 시간 구간을 다시 검사한다.

Google은 개발자들이 이러한 메커니즘의 일부를 수동으로 구축할 수 있었지만, 동적 검색과 검사 과정을 모델로 이전하면 필요한 프로그래밍 작업이 줄어든다고 설명한다. 이 기능에는 추가 요금이 부과되지 않으며, Gemini API의 표준 토큰 요금이 적용된다. API 설정에서 처리 옵션을 agentic으로 지정하면 된다.

개발자에게 실질적으로 달라지는 점은?

Google은 10분 길이의 사용 안내서와 90분 길이의 강의부터 수 시간에 걸친 녹화물까지, 긴 콘텐츠에서 효과가 더욱 뚜렷하게 나타난다고 밝혔다. 회사가 제시한 활용 사례는 다음과 같다.

  • 자동 편집에 필요한 상태 변화와 빠른 컷의 경계를 포함해 1초보다 짧은 순간을 더 정확하게 검색한다.
  • 수백만 개의 토큰을 사용하지 않고 긴 동영상이나 수 시간 분량의 녹화물에서 특정 정보를 검색한다.
  • 중요한 시간 구간을 더 높은 프레임 속도로 다시 샘플링해 이상 상황을 감지한다.
  • 반복되는 동작과 객체를 시간에 따라 추적해 더 정확하게 센다.

Google의 테스트에 따르면 에이전틱 이해 기능을 적용한 Gemini 3.7 Flash는 테스트된 모델 중 전반적인 품질과 품질·비용 조합이 가장 우수하며, 정확도와 비용 간 효율성 프런티어에 해당한다고 회사는 설명한다. 다만 이러한 결과는 회사가 발표한 수치이며, 모든 유형의 동영상이나 모든 작업에서 동일한 성능을 보장하는 것은 아니다.

이 소식이 중요한 이유

실질적인 변화는 새로운 모델을 추가한 것이 아니라, 동영상 분석을 고정적인 전체 처리 방식에서 부분과 신호를 적응적으로 선택하는 방식으로 전환한 데 있다. 이는 긴 아카이브에서 검색하거나 빠르게 발생하는 사건을 감지하는 애플리케이션에 도움이 될 수 있다. 여기서 토큰 감소는 동영상을 완전히 무시해서가 아니라, 모델이 질문과 관련 있다고 판단한 구간에 검사를 집중하기 때문에 발생한다.

반면 중요한 순간이 드물거나 명확하지 않은 시나리오에서는 개발자가 에이전틱 선택의 정확도를 계속 평가해야 한다. 또한 출처는 테스트의 전체 방법론이나 절대적인 비용 수치에 관한 독립적인 세부 정보를 제공하지 않는다. 따라서 개선 비율은 Google이 발표한 벤치마크 결과로 이해해야 하며, 각 애플리케이션의 콘텐츠에서 직접 기능을 테스트하는 것을 대신할 수 없다.

제공 현황과 확장 계획

이 기능은 현재 언급된 세 모델에 대해 Google AI Studio와 Gemini Enterprise Agent Platform의 Gemini API를 통해 이용할 수 있다. Google은 곧 Flash 및 Flash-Lite 모델을 통해 모든 Gemini 앱 사용자에게 효율성과 품질 개선 기능을 제공할 예정이며, 향후 몇 달 동안 동영상 시청 페이지의 ‘Ask YouTube’ 기능에도 이를 적용할 계획이다. 이를 통해 동영상에 보이는 시각적 정보를 바탕으로 더 품질 높은 답변을 제공한다는 목표다.

뉴스 출처
Google Official News
원문 보기 ↗
ف
작성자

فريق تحرير certi.news

같은 카테고리

추천 기사

모든 뉴스 보기