谷歌最强语音转写模型来了:准确率进前五,但还没打过ElevenLabs
- GOOGLX0%
- GPT0%
动察 Beating AI 快讯,谷歌发布 Gemini 3.5 Transcribe,这是目前最准确的谷歌语音转写模型,也是谷歌首次在专用转写模型中加入 Smart 模式。模型分实时和录音转写两版,目前已开放 Gemini API 公测。Artificial Analysis 评测中,非流式 WER(词错误率,越低越好)为 2.6%,实时版为 4.0%。最终转写延迟相比上一代 Chirp 3 缩短 70%。
Smart 模式不再只是把声音逐字变成文字。比如你说「周二开会,不,周三」,它会直接留下「周三」;「嗯、啊」等口头禅也会自动删除,还能把口语整理成段落、列表、日期和数字。需要会议记录原话时,也可以继续使用默认的逐字转录模式。
模型支持 85 种以上语言和中途切换语言,还能加入自定义专业词汇。录音转写约每分钟 0.005 美元,也就是每 1000 分钟 5 美元;实时版约每分钟 0.009 美元。独立榜单上,它比 OpenAI GPT Transcribe 的 3.3% 更准,但还没超过 ElevenLabs Scribe v2:后者 WER 为 2.2%,每 1000 分钟约 3.67 美元。
这套模型已经用于 Android 的 Rambler 和 macOS 版 Gemini,接下来还会进入 Chrome。届时可以直接在网页输入框里说话打字。
来源:BlockBeats
免责声明:当前内容均来自第三方观点或由AI直接翻译第三方观点,CoinEx不保证内容的真实性、准确性和原创性,不构成CoinEx相关的任何投资建议。数字资产价格波动剧烈,请注意潜在风险。
热搜榜
- 币种价格24H涨跌