-
微软最强转录 AI 模型:MAI-Transcribe-2 登场,60 语种平均词错误率 5.2%
微软昨日(9 月 3 日)发布博文,宣布推出 MAI-Transcribe-2,宣称是其最快、最准确、最便宜的 AI 语音转文字模型。
AI资讯2026-09-04AI资讯 -
谷歌发布 Gemini 3.5 Transcribe 语音转文本模型,能自动删除口头禅
这款 AI 模型可自动删除语音中的口头禅、修正错误内容,语音转录速度提升约 70%,实时语音错误率降至 5.5%,还支持自定义词汇表。但智能润色可能改变原措辞,不适合需保留原···
AI资讯2026-08-27AI资讯 -
阿里推出国内首个 AI 语音平台 CosyVoice Studio,限时免费体验
该平台基于自研语音模型 Qwen-Audio 打造,包含语音记录 CosyFlow、语音智能体 CosyAgent 和音频内容创作工具 CosyCreative 等功能。
AI资讯2026-08-07AI资讯 -
腾讯混元发布语音识别模型 Hy ASR 3.0 preview,元宝已首发上线
腾讯混元今日发布了新一代语音识别模型 Hy ASR 3.0 preview。
AI资讯2026-08-04AI资讯 -
阿里发布 Qwen-Audio-3.0-ASR-Flash 语音识别大模型,让 AI 更好听懂专业词汇
Qwen-Audio-3.0-ASR-Flash 主要在上下文一致性、行业词识别和热词定制化三个维度做了系统性的优化,同时让模型具备语音润色能力,可直接输出结构化文本。
AI资讯2026-07-31AI资讯 -
马斯克旗下 SpaceXAI 最智能 AI 语音模型,Grok Voice Think Fast 2.0 登场
埃隆 · 马斯克(Elon Musk)旗下 SpaceXAI 公司昨日(7 月 29 日)发布 Grok Voice Think Fast 2.0,是其功能最强大、最智能的语音对语音(speech-to-speech) AI 模型。
AI资讯2026-07-30AI资讯 -
OpenAI 将打造“贾维斯”式语音助手,未来有望登陆第三方智能眼镜
人类长期依靠点击、键盘输入完成的大量操作,未来都有可能被 AI 接管。布罗克曼表示:“我认为,我们终有一天会发现,点击和输入只是人机交互发展中的一个阶段,从来不是人···
AI资讯2026-07-25AI资讯 -
位列 Artificial Analysis 榜首,阿里千问发布语音合成大模型 Qwen-Audio-3.0-TTS
包含面向实时交互的 Flash 版本(首包延时 300ms 级别)和面向高质量生成的 Plus 版本。
AI资讯2026-07-20AI资讯 -
OpenAI 最智能语音模型:GPT-Live-1/mini 登场,边听边说让 AI 对话更接近真人聊天
OpenAI 今天(7 月 9 日)发布 GPT-Live 系列模型,定位新一代全双工语音模型,可同时聆听与说话,让 AI 对话感觉更接近真人。
AI资讯2026-07-09AI资讯 -
OpenAI 更新 2.1 系列 GPT Realtime AI 模型,p95 延迟至少降低 25%
OpenAI 昨日(7 月 7 日)发布公告,宣布在其 API 调用中,新增 gpt-realtime-2.1 和 gpt-realtime-2.1-mini 两款模型,官方表示 p95 延迟至少下降 25%。
AI资讯2026-07-08AI资讯
微信客服