언어 바꾸기English
이전 목록

구글, Gemini 3.1 Flash Live 출시: 저지연 오디오·비디오·툴 사용 실시간 멀티모달 음성 모델

Google Releases Gemini 3.1 Flash Live: A Real-Time Multimodal Voice Model for Low-Latency Audio, Video, and Tool Use for AI Agents

TL;DR AI

핵심 요약

2분
  1. Gemini 3.1 Flash Live 구글이 Gemini 3.1 Flash Live를 개발자용 프리뷰로 출시했다, gemini Live API를 통해 개발자용 프리뷰로 출시됨.

  2. 해당 모델은 멀티모달 스트림을 네이티브로 처리해 지연을 줄인다 멀티모달 스트림을 네이티브로 처리해 지연을 줄이도록 설계됨.

  3. Google 구글은 이 모델을 자사 최고 품질의 오디오·음성 모델이라고 표현했다 구글이 자사 최고 품질의 오디오·음성 모델이라고 설명함.

  4. Multimodal Live API는 WebSockets를 사용하는 상태 유지 양방향 스트리밍을 제공한다, webSockets(WSS)를 사용한 상태비저장이 아닌 양방향 스트리밍 인터페이스를 제공함.

  5. API는 16kHz 16비트 PCM(리틀엔디언) 원시 오디오를 입력으로 받고 원시 PCM 오디오를 출력한다 입력으로 16kHz, 16비트 PCM(리틀엔디언) 원시 오디오를 요구하고 출력으로 원시 PCM 오디오를 반환함.

원문 보기