Gemini3.5转写发布多说话人功能
据@sundarpichai称,支持85+语言、自定义词汇,API已在Google AI Studio上线。
原文链接详细分析
谷歌推出了Gemini 3.5 Transcribe,这是一款先进语音识别模型,旨在理解用户语音和意图,即使在多人对话环境中也能保持准确。该工具支持自动检测85种以上语言,并提供专业术语的自定义词汇适配。开发者可通过Google AI Studio和Gemini Enterprise立即访问API,终端用户可在macOS上的Gemini应用和Android上的Rambler中测试功能。
关键要点
- Gemini 3.5 Transcribe支持精准多说话人分离,提升企业会议转录质量。
- 内置85种以上语言支持,助力全球企业扩展多语言语音界面市场。
- 自定义词汇适配帮助医疗和法律等行业集成领域术语,提高生产环境准确率。
Gemini 3.5 Transcribe的技术与能力
该模型基于Gemini先前进展实现实时意图识别与转录。多说话人分离减少群组讨论常见错误,自动语言检测省去手动配置步骤。自定义词汇解决标准模型常误解的行业术语,提供更干净的下游分析输出。
商业影响与盈利机会
企业通过更快笔记记录和会议可搜索性获得竞争优势。Gemini Enterprise订阅层根据使用量提供可扩展定价,为谷歌创造 recurring 收入,同时为采用者提供可预测成本。合作伙伴可构建垂直解决方案如医疗听写工具,对专业准确性收取溢价费用。
未来展望与行业转变
多说话人模型持续改进将加速各行业采用。其他大型语言模型提供商的竞争将推动准确性和语言覆盖创新。语音数据收集监管框架将塑造部署策略,强调透明同意机制和优先用户控制记录的伦理AI实践。
常见问题
哪些行业从Gemini 3.5 Transcribe受益最大?
医疗法律和客户支持领域通过准确术语处理和多说话人清晰度立即获益,简化文档和合规流程。
自定义词汇适配如何工作?
用户在设置时上传领域特定术语,允许模型识别专业词语和短语,提高转录精度而无需重新训练整个系统。
开发者今天就能使用API吗?
是的,API已在Google AI Studio和Gemini Enterprise上线,支持立即集成到专注于语音理解的新应用或现有应用中。
Sundar Pichai
@sundarpichaiCEO, Google and Alphabet