Gemini 3.5 Transcribe - Google 发布的旗舰语音转文本模型
Últimos recursos sobre IAPublicado hace 17 horas Círculo de intercambio de inteligencia artificial 1.9K 00
Gemini 3.5 Transcribe是什么
Géminis 3.5 Transcribe 是 Google 发布的旗舰语音转文本模型,与传统语音识别只做逐字记录不同,能直接输出润色过、格式规范的成稿。自动删除口头禅、理解"周二,不,周三"式的自我修正并实时改稿。词错误率低至实时流式 4.0%、预录音频 2.6%,速度比前代快约 70%,支持 85+ 种语言的自动检测与转写。模型提供实时流式(gemini-3.5-transcribe-live,亚秒级延迟)和预录批处理(最长 1 小时、支持说话人识别)两个 API 入口 ,支持自定义词汇表与 llamada a funciones 任务委派 ,已落地于 Gboard Rambler、macOS 版 Gemini 等场景,定价约每千分钟 5 美元 。

Gemini 3.5 Transcribe的功能特色
- 智能成稿转写:不满足于逐字记录,直接将原始音频转换为润色过、格式规范的文本,自动删除"嗯""呃"等口头禅,并理解口语中的自我修正(如"约周二——不,周三")实时改稿 。
- Reconocimiento de gran precisión:实时流式词错误率仅 4.0%,预录音频低至 2.6%(Artificial Analysis 测量),为同类领先水平.
- 极速转写:从语音到最终文本的速度比前代 Chirp 3 快约 70%.
- Soporte multilingüe:可自动检测并转写 85+ 种语言,包括口音和方言.
- 双 API 入口:提供实时流式 API(gemini-3.5-transcribe-live,亚秒级延迟,单会话最长 10 分钟)和预录批处理 API(gemini-3.5-transcribe,支持最长 1 小时音频).
- 说话人识别与词级时间戳:预录音频可归属最多 3 位说话人(3 人以上为实验性),并提供词级时间戳,适合会议记录与通话分析.
- 双模式输出:开发者可在"Smart"智能清理模式与"Verbatim"逐字保留模式间切换(Smart 模式不支持说话人分离和词级时间戳).
- 自定义词汇表:支持传入专业术语、人名、产品名等,显著提升特定领域的识别准确率.
- Llamada a la función:可在转写过程中直接将文件分析、图像生成等任务委派给其他 Gemini 模型,实现语音驱动的智能体工作流.
Gemini 3.5 Transcribe的核心优势
- "理解语义"而非"记录声音":是它与竞品最本质的差异,不是把音频转成原始文字,是直接产出可用成稿,自动去除口头禅、修正口语自我纠正、完成排版,省去了传统"转写后还需 LLM 二次加工"的环节.
- 业界领先的识别精度:实时流式词错误率仅 4.0%,预录音频低至 2.6%(Artificial Analysis 测量),多语言基准 FLEURS 上流式 5.50%、非流式 5.04%,均处于同类最佳水平.
- 速度与延迟双优:转写速度比前代 Chirp 3 快约 70%;实时流式入口提供亚秒级延迟,满足语音智能体、实时字幕等对响应速度敏感的场景.
- 一个模型覆盖全场景:从 10 分钟内的实时流式对话到最长 1 小时的预录音频,从个人语音输入(Gboard Rambler、macOS 应用)到企业级会议记录、通话分析,用两个 API 入口即可覆盖 。
- 面向开发者的可控性:提供 Smart 智能模式与 Verbatim 逐字模式切换、自定义词汇表(术语/人名/产品名)、说话人识别、词级时间戳,可按法律取证、会议纪要等不同场景精确配置 。
- 原生融入 Gemini 生态:支持 function calling,转写中即可把分析、图像生成等任务委派给其他 Gemini 模型,天然适合构建语音驱动的智能体;并已被 LiveKit、Pipecat、Vercel 等平台快速集成 。
- alta relación calidad-precio:定价约每千分钟 5 美元(约 0.005 美元/分钟),在旗舰级精度下保持了有竞争力的成本.
Gemini 3.5 Transcribe官网是什么
- Página web del proyecto:https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-5-transcribe/
Gemini 3.5 Transcribe的操作步骤
- Obtener acceso: en Google AI Studio 创建账号并获取 API Key,模型目前以公开预览(Public Preview)形式提供;也可通过已集成的第三方平台(LiveKit、Pipecat、Vercel 等)接入 。
- 选择 API 入口:根据场景二选一,实时场景用
gemini-3.5-transcribe-live(Live API,双向流式、亚秒级延迟,单会话最长 10 分钟);处理已有音频用gemini-3.5-transcribe(Interactions API,支持最长 1 小时的预录文件). - 准备音频输入:流式场景直接推送麦克风音频流;预录场景上传音频文件(按所选入口支持的格式与时长限制)。
- 配置转写参数::
- 选择输出模式,"Smart"智能清理(去口头禅、自动改稿、排版)或"Verbatim"逐字保留 ;
- 如需区分说话人,开启说话人识别(最多 3 人,3 人以上为实验性)并附带词级时间戳(注意:Smart 模式与此二者互斥).;
- 如有专业术语、人名、产品名,传入自定义词汇表提升准确率;
- 语言默认自动检测(85+ 种语言),也可显式指定.
- 挂载 Function Calling(可选):定义函数工具,让模型在转写中直接把分析、图像生成等任务委派给其他 Gemini 模型,构建语音驱动的智能体工作流.
- 调用并接收结果:实时模式随说随出文本,实现"语音到成稿"比前代快约 70%;预录模式返回带说话人归属和时间戳的完整转写 。
Gemini 3.5 Transcribe的适用人群
- 应用开发者与语音智能体团队:通过 Live API 亚秒级延迟的双向流式能力,可构建实时语音助手、客服机器人;function calling 支持转写中直接委派任务,天然适合语音驱动的智能体开发 。
- 企业与呼叫中心:预录 API 支持最长 1 小时音频、说话人归属(最多 3 人)和词级时间戳,适合会议记录、通话质检与客户洞察分析.
- 内容创作者与自媒体人:Smart 模式自动去口头禅、修正口语自我纠正、输出排版成稿,可把口播、播客、采访录音直接变成可用的文案初稿.
- 职场人士与会议纪要需求者:无需人工整理录音,"语音到成稿"比前代快约 70%,显著提升会后整理效率 。
- 跨语言与国际化团队:自动检测并转写 85+ 种语言(含口音和方言),适合多语言会议、跨境业务沟通场景 。
Gemini 3.5 Transcribe的常见问题
Q:识别准确率怎么样?
A:词错误率(WER)处于业界领先水平:实时流式 4.0%,预录音频 2.6%(Artificial Analysis 测量);多语言基准 FLEURS 上流式 5.50%、非流式 5.04%。
P: ¿Qué idiomas son compatibles?
A:可自动检测并转写 85+ 种语言,包括各类口音和方言,无需预先指定。
Q:能处理多长的音频?
A:分两个入口:实时流式(gemini-3.5-transcribe-live)单会话最长 10 分钟;预录音频(gemini-3.5-transcribe)最长支持 1 小时。
Q:能区分多个说话人吗?
A:可以,预录音频支持最多 3 位说话人的归属识别(3 人以上为实验性),并提供词级时间戳。
© declaración de copyright
Derechos de autor del artículo Círculo de intercambio de inteligencia artificial Todos, por favor no reproducir sin permiso.
Artículos relacionados
Sin comentarios...




