AI 快讯列表关于 语音识别
| 时间 | 详情 |
|---|---|
|
2026-08-03 22:25 |
OpenAI GPT Live驱动实时语音突破
据OpenAI称,GPT Live可边听边说并不中断推理与工具调用。 |
|
2026-08-03 20:38 |
OpenAI GPT‑Live实现连续语音
据@OpenAI称,GPT‑Live可边说边听,推理与工具调用不中断。 |
|
2026-07-30 23:39 |
TPU缘起揭示推理硬件转向
据JeffDean称,餐巾纸算例促成TPU,推理硬件将成下一专业化方向。 |
|
2026-07-23 19:34 |
Claude语音升级拓展工具与多语
据@claudeai称,语音模式用更强模型,支持多语并可中途调用外接工具。 |
|
2026-07-08 18:01 |
Pictory AI数分钟加速字幕生成
据pictoryai称,创作者数分钟生成与自定义字幕,提升可访问性与观看时长。 |
|
2026-07-08 17:44 |
GPT Live全双工语音发布 体验升级
据The Rundown AI称,GPT Live实现全双工对话、模型协作与实时翻译。 |
|
2026-07-08 17:22 |
GPT Live登场:实时语音突破
据OpenAI称,GPT-Live登陆ChatGPT,带来更自然的实时语音交互与多模态助理能力。 |
|
2026-07-08 16:11 |
语音AI挑战赛揭晓三强
据DeepLearning.AI称,7天赛有500+迭代与38作业,评审后评出前三名。 |
|
2026-07-08 15:30 |
语音AI挑战揭晓三强榜单
据DeepLearningAI称,38份参赛作品与500次迭代涌现前三名与可拨打电话的代理。 |
|
2026-07-08 14:18 |
Typeless 2.0重塑语音起稿效率
据@huang_song_称,Typeless 2.0将口述意图转成清晰文本,支持全平台。 |
|
2026-06-09 17:34 |
Gemini 3.5即時翻譯覆蓋70多語種
据JeffDean称,新模型支持70多语言,正上线Google翻译与AI Studio的Live API。 |
|
2026-06-08 22:48 |
OM1多语言支持解锁无缝对话
据@openmind_agi称,OM1可中途无缝切换语言,母语交流并以指定语言回复,无需配置。 |
|
2026-05-29 20:03 |
OpenAI同传模型登陆可穿戴设备
据gdb称,gpt realtime translate支持70+语种输入到13种语音输出,并已在智能眼镜上演示。 |
|
2026-05-21 22:00 |
AI故障扰乱毕业典礼引哗然
据FoxNewsAI称,亚利桑那高校毕业典礼AI出错引嘘声并走红。 |
|
2026-05-21 18:01 |
Pictory AI自动去静音提升视频流畅
据@pictoryai称,自动去静音优化网络研讨与教程视频,提高完播与参与度。 |
|
2026-05-11 23:46 |
实时交互模型演示忽略企业价值
据@emollick称,演示偏向趣味提醒,忽视会议与培训等高价值用例。 |
|
2026-05-07 20:09 |
OpenAI发布实时语音翻译API
据Greg Brockman称,OpenAI已在API开放语音到语音实时翻译,开发者可即刻集成。 |
|
2026-04-14 20:45 |
VoxCPM2 发布:OpenBMB 开源多模态语音大模型与在线演示—2026 最新深度解读
据 Twitter 用户 God of Prompt 指出,OpenBMB 发布了多模态语音语言模型 VoxCPM2,并提供 Hugging Face 在线演示、OpenBMB 模型页下载与 GitHub 源码(来源:@godofprompt;链接:huggingface.co/spaces/openbmb/VoxCPM-Demo、huggingface.openbmb.com/model/openbmb/VoxCPM2、github.com/OpenBMB/VoxCPM)。据 GitHub 项目页介绍,VoxCPM 面向语音理解与语音生成场景,便于团队快速原型化语音助手与呼叫机器人,并以开放权重支持自部署与二次开发。根据 Hugging Face 演示页,企业可在浏览器内测试实时语音输入与文本转语音式输出,降低联络中心与多语言客服机器人的集成门槛。依托 OpenBMB 模型页公开的模型文件,企业可探索本地化部署、合规敏感场景以及面向行业术语的微调与定制 IVR。 |
|
2026-04-14 16:22 |
语音UI新突破:双代理架构实现低延迟对话与屏幕同步
据AndrewYNg在推特上表示,Vocal Bridge提出“双代理”语音架构:前台代理负责低延迟实时对话,后台代理承担推理、合规和工具调用,从而化解语音模型低延迟但不稳定与传统语音管线高智能但过慢的技术权衡。根据Andrew Ng的分享,他用Vocal Bridge结合Claude Code在一小时内为数学测验应用接入语音,实现口述作答、语音反馈与屏幕动画同步更新。另据Vocal Bridge官网信息,该平台面向需要亚秒级轮询且保留LLM推理能力的开发者,通过并行运行的代理管线提升可靠性。对行业的意义在于,语音可成为现有可视化应用的通用UI层,除呼叫中心外,还将加速教育、办公协作、医疗接诊与现场服务等场景的商业化落地。 |
|
2026-03-27 12:43 |
Genspark Realtime Voice发布:通勤场景下的全免提AI助手与工作流革命
据X平台用户@godofprompt转引@genspark_ai演示,Genspark Realtime Voice可在通勤中全程语音完成日程查询、发送邮件和消息、搜索与播放列表、生成幻灯片、深度研究与数据分析,展示了可落地的环境式AI。根据@genspark_ai的说明,该产品可连接汽车并以对话方式操控生产力任务,成为区别于桌面形态的语音优先助手。据该帖报道,其商业影响在于将行政与研究任务前置到行车时段,并为企业级日历、邮箱、文档与分析系统的安全集成创造机会;同时推动超低时延语音链路、设备端唤醒词与说话人分离,以及具备审计能力的安全API编排的需求增长。 |