← 端侧AI、本地推理与云端成本

离线语音ASR/TTS模型密集开源

离线语音识别与合成模型正密集开源,端侧部署能力持续增强。近期多家发布低延迟、多语言多方言的实时模型,如阿里Fun-ASR-Realtime单模型支持30种语言和16种方言,Cartesia Sonic 3.5首音频延迟约82ms,Kokoro仅82M参数可在CPU上离线运行。同时,阶跃星辰推出端侧模型全家桶,面壁智能发布本地语音助手方案,为硬件集成提供丰富的算法现货
7月15日进过日报
阿里发布实时语音交互对话模型 Qwen-Audio-3.0-Realtime
阿里巴巴今日发布实时语音交互对话模型 Qwen-Audio-3.0-Realtime,包含推理更强的 Plus 版本和速度更快的 Flash 版本。
7月15日
阿里千问输入法上线 macOS 版:最快 300 字/分,AI 自动润色
阿里千问输入法 macOS 版今日上线官网,支持最快 300 字/分的 AI 语音输入,可自动润色、将口语转为工整文字,并支持 9 种方言,纯净无广告。
7月15日
阶跃星辰发布 Step Edge 端侧模型全家桶
阶跃星辰推出 Step Edge 端侧模型全家桶,
7月15日
Gradium 发布实时语音翻译模型 stt-translate 和 s2s-translate
Gradium 发布两款实时语音翻译模型:stt-translate(语音转文本)和 s2s-translate(语音转语音)。
7月15日
Cartesia 发布 Sonic 3.5 与 Ink 2 实时语音模型
Cartesia 推出 Sonic 3.5 和 Ink 2 两个模型,作为单一实时语音栈,分别负责文本转语音和语音转文本。
7月11日进过日报
面壁智能VoxCPM驱动Whispera本地语音助手
面壁智能OpenBMB发布基于开源模型的Windows本地实时语音助手Whispera。
7月8日
网易有道"子曰4"多模态模型、语音合成模型全量开源
网易有道宣布将其"子曰"大模型4.0的多模态模型与语音合成模型面向全球全量开源。
7月7日
借助Kokoro实现本地化、对CPU友好且高质量的TTS(文本转语音)功能
Kokoro 是一款仅 82M 参数的文本转语音模型,能在 CPU 上完全离线运行,生成高质量语音。
7月7日
使用Whisper转录整场演讲
它使用Whisper转录了整个演讲。我们热爱开源!
7月7日
Cohere Transcribe Arabic:专为阿拉伯语最棘手转录问题打造的开源模型
Cohere 发布开源语音识别模型 Cohere Transcribe Arabic,参数量为 20 亿,
7月6日进过日报
阿里千问升级Fun-ASR-Realtime实时语音识别模型,单模型支持16种方言和30种语言
阿里千问今日升级实时语音识别大模型Fun-ASR-Realtime,单模型支持16种方言和30种语言,API已上线阿里云百炼平台。
7月6日
Fun-ASR-Realtime 发布:单模型支持30种语言与16种方言,识别准确率领先
通义实验室发布Fun-ASR-Realtime实时语音识别模型。单模型覆盖30种语言及16种方言,针对东亚、东南亚地区重点优化。
7月6日
AssemblyAI 发布 Universal-3.5 Pro Realtime 流式语音转文本模型
AssemblyAI 推出流式 STT 模型 Universal-3.5 Pro Realtime,
7月3日
Interfaze 开源 diffusion-gemma-asr-small,基于 DiffusionGemma 并行去噪解码器的多语言扩散 ASR 模型
Interfaze 开源了 diffusion-gemma-asr-small,据称是首个开源多语言扩散 ASR 模型。
7月1日
VoxCPM2:2B开源语音编辑模型,声音可像滤镜一样调整
面壁智能发布VoxCPM2,一个2B参数的开源语音模型,支持30种语言及9种方言。
6月29日
xAI语音API登陆Vercel AI Gateway
来自xAI的最先进语音API,现已加入Vercel AI Gateway
6月27日
Wan Streamer v0.1:首个端到端Transformer实时音视频对话模型
阿里通义实验室Wan团队发布Wan Streamer v0.1,首个端到端Transformer实现实时音视频对话。
6月25日
MOSS-TTS-Local-Transformer-v1.5 在 SGLang-Omni 上:原生流式 48 kHz 语音服务
MOSS-TTS-Local-Transformer-v1.5 是一款开源 TTS 模型,
6月24日
gpt-realtime-2 唤醒词与推理演示
计算机!启动防火墙! 使用 gpt-realtime-2,你可以在上下文中提示唤醒词、进行推理,并构建一些傻乎乎的游戏。
6月18日
火山引擎上线豆包实时语音模型3.0 API 服务,开启邀测
火山引擎上线豆包实时语音模型3.0(Seeduplex)API 服务并开启邀测。
6月5日
dots.tts 技术报告
dots.tts 是一个 2B 参数的连续自回归 TTS 基座模型,在连续潜在空间中建模语音。
6月4日
Nemotron Parakeet ASR 印尼语准确率达 97.7%
当法律和监督依赖于转录内容时,70-80% 是不够的。
6月4日
Nemotron 3.5 ASR:为你的语言、领域或口音进行微调
Nemotron 3.5 ASR 是一个 600M 参数的多语言流式语音识别模型,
6月3日
Miso One 开源语音模型:8B 参数、110ms 延迟、一次语音克隆
Miso One 正式发布,一个 8B 参数的开源权重语音模型(TTS),旨在模拟真实人类朗读的温暖与节奏。
5月27日
Reachy Mini 实现完全本地化语音交互
Reachy Mini 机器人现可通过 `speech-to-speech` 库实现完全本地化的语音交互,无需依赖云端。
5月23日
StepAudio 2.5实时语音发布:副语言感知与人格化交互
StepAudio 2.5 Realtime是一款实时语音模型,能够深度理解用户语音中的语气、语速、停顿乃至微表情等副语言特征。