TOKENPOST

제미나이 3.8 라이브와 TTS는 별도 모델

토포AI로 이 기사 더 깊이 읽기

스마트폰으로 음성 AI와 대화하는 손 / TokenPost.ai

구글($GOOGL)이 실시간 음성 대화와 확장 추론을 지원하는 제미나이 3.8 라이브 모델 2종을 공개했다. 제미나이 3.8 TTS라는 별도 텍스트-음성 변환 모델명은 구글 공식 자료에서 확인되지 않았다.

구글은 15일 개발자용 Gemini API와 Google AI Studio를 통해 제미나이 3.8 라이브(Gemini 3.8 Live)와 제미나이 3.8 라이브 확장 추론(Gemini 3.8 Live Extended Thinking)을 선보였다.

제미나이 3.8 라이브는 실시간 음성 대화를 이어가면서 시각 정보를 처리하는 모델이다. 개발자는 대화 중 API와 외부 도구를 백그라운드에서 호출하는 기능도 구현할 수 있다.

제미나이 3.8 라이브 확장 추론은 복잡한 추론과 다단계 작업 수행에 초점을 맞췄다. 사용자가 음성으로 대화를 계속하는 동안 모델이 별도 작업을 처리하는 방식이다.

두 모델은 97개 이상 언어와 억양 일관성을 지원한다. 음성 입력뿐 아니라 영상과 이미지도 실시간으로 처리할 수 있다.

구글은 확장 추론 모델이 Artificial Analysis의 Speech to Speech Quality Index에서 82.6점으로 1위를 기록했다고 밝혔다. 해당 수치는 구글이 공개한 비교 자료에 기반한 것으로, 독립적인 재검증 여부는 확인되지 않았다.

이번 공개는 구글이 공식 발표에서 실시간 대화와 시각 입력, 추론·도구 호출을 결합한 기능을 제시했다는 점을 보여준다. 다만 제미나이 3.8 라이브 계열의 핵심은 텍스트를 음성으로 바꾸는 기능보다 대화형 AI 구현에 있다.

TTS는 텍스트를 음성으로 변환하는 기술이다. 음성 입력을 이해한 뒤 음성으로 응답하는 제미나이 3.8 라이브와는 처리 과정과 활용 목적이 다르다.

구글이 공식적으로 공개한 별도 TTS 모델은 제미나이 3.1 플래시 TTS(Gemini 3.1 Flash TTS)다. 이 모델은 자연어 지시와 표현형 오디오 태그를 이용해 말투와 속도, 감정 등을 조절할 수 있다.

제미나이 3.1 플래시 TTS는 70개 이상 언어와 다중 화자 대화를 지원한다. 텍스트 기반 콘텐츠를 자연스러운 음성으로 출력하는 데 초점이 맞춰져 있다.

Google Cloud 문서에 소개된 Gemini-TTS는 한국어를 포함한 여러 언어를 지원한다. 시와 뉴스, 스토리텔링에 맞춘 표현형 낭독과 감정·억양·발화 속도 제어 기능도 제공한다.

다만 Gemini-TTS 문서가 제미나이 3.8 TTS의 출시를 의미하는지는 확인되지 않았다. 공식 제품명만 보면 제미나이 3.8 라이브 계열과 제미나이 3.1 플래시 TTS는 별도 제품군이다.

앞서 구글이 실시간 음성 대화와 확장 추론을 지원하는 제미나이 3.8 라이브 모델 2종을 공개했다는 내용이 전해진 가운데, 이번 확인은 해당 모델과 TTS 기술의 용도를 구분하는 데 의미가 있다.

구글의 제미나이 3.5 트랜스크라이브(Gemini 3.5 Transcribe)는 공식 문서에서 한국어 지원이 확인된 바 있다. 다만 제미나이 3.8 라이브의 한국어 대화 품질과 실제 이용 범위는 이번 발표만으로 판단하기 어렵다.

제미나이 3.8 라이브 모델 2종은 Gemini API와 Google AI Studio에서 개발자에게 제공된다. 제미나이 3.8 TTS의 정확한 제품명과 별도 출시 여부는 추가 공식 발표가 있어야 확인할 수 있다.

오늘의 스탬프0명이 오늘 찍었어요

댓글0

첫 댓글을 남겨 보세요.