
专注 AI 工程化实践与出海外贸技术一、发生了什么Cactus Compute 于 10 月 2 日开源了语音识别模型 Whistle来源Cactus 官方博客单文件 16.9 MB纯 CPU、零依赖支持英德法西意荷波七种语言Apache 2.0 协议。发布当天波澜不惊一周后的 10 月 8 日却以 743 分冲上 Hacker News 当日第二大热帖来源HN 讨论 item?id5000842710 月 9 日仍在各日报头条来源ai-tldr、小宇宙 HN 日报。二、技术拆解Whistle 最容易被误读成「更小的 Whisper」。拆开看就知道不是——它的小不靠压缩靠一连串主动砍掉的设计决策来源官方博客与模型卡砍频带。前端只保留 250–3500 Hz3.5–8 kHz 的信息在进编码器之前就被扔掉了。语音的晶核不在高频但这也意味着它对远场混响、音乐背景这类录音先天吃亏。砍词表。文本词表只有 8192 个 piece且和同家的文本模型 Needle 共享。这直接封死了「加一种语言」的路——想加第八种动的是两个模型共用的引擎来源theclarity.today 的拆解。砍单次时长。一次最多 30 秒没有内置说话人分离会议场景准确率约 74%来源logeshwaran.org 整理的 FAQ。长音频的分段代码调用方自己写。砍完之后塞进来的是30 秒音频只产生 375 帧每 80ms 一帧解码器每层一个门控交叉注意力读编码器K/V 每段音频只投影一次——5 路束搜索只维护 5 份短转录缓存不重扫音频。结果是 Apple M4 Pro 上首词延迟 11.1 ms、解码 1319 token/秒约为 Whisper base 的 5 倍厂商口径单一机型实测。但真正有意思的不是数字是复用Whistle 和 Needle8–29 MB 的工具调用模型共享同一个 C 引擎、同一个 .cact 容器、同一套量化。一个二进制装下两个模型「语音进、函数调用出」的离线语音助手就是一行needle_complete的事来源官方博客。上周写欧洲开源模型 Kolibri 时提过https://blog.csdn.net/qq_43274490/article/details/167039345那边把激活参数压到 3.46B 好塞进小显存Whistle 是同一条路更绝的端侧版本——连运行时都不单独要。昨天写 Haiku 5.5 计价那篇提过https://blog.csdn.net/qq_43274490/article/details/167282390云端小模型在拼价格表的形状端侧是另一个极端边际成本归零代价全在设计期付掉。维度WhistleWhisper baseMoonshine tiny v2体积16.9 MB145.3 MB41.9 MB语言7 种自动检测多语仅英语首词延迟*11.1 ms约慢 6.6 倍—解码速度*1319 tok/s约 1/5约 1/5对 Whisper base 战绩8 项共享测试赢 5 项赢 TED-LIUM / AMI / MLS—硬限制30 秒/次、无说话人分离无无*测于 Apple M4 Pro 单一机型全部为厂商自报口径来源explainx.ai 明确说明未独立运行过。缺点栏不是装饰Whistle 输的三项恰好是讲座TED-LIUM和会议AMI——长录音、多说话人、真实噪声正是「砍」掉的能力在讨债。HN 评论也有用户反馈偶发卡死、整段对话复读成同一句来源小宇宙 HN 日报转述。三、我的判断第一端侧 ASR 的「够用线」被重画了但只重画了一格。唤醒词、短指令、单轮问答这类 30 秒内的场景16.9 MB 11ms 零网络依赖是碾压性的——手表、耳机、机器人、车机从此不必为「听懂一句话」上云。但长音频场景短板栏写得明明白白。别顺着热度脑补成「云端 ASR 要完了」。第二别把 5 倍速度当产品声明。全部性能数字出自厂商且只在 M4 Pro 一台机器上测过来源theclarity.today。目标设备是手表和单片机测试机却是最强消费级 CPU 之一——「在你的芯片上自己测一遍」不是抬杠是必要动作。这个坑和上周 GPT-6 作弊那篇同源https://blog.csdn.net/qq_43274490/article/details/167177162评测环境决定结论成色。第三慢热一周才爆火说明传播拐点在「第一批人真的跑通了」。10 月 2 日发布时它只是又一个模型卡直到有人发现 16.9 MB 真能在浏览器标签页里跑、真能拼成离线语音助手HN 才把它顶上去。对小团队的朴素推论「五分钟能跑起来的 demo」比发布日热度更能决定传播拐点。四、对开发者的启示端侧选型先列砍了什么再看塞了什么。频带、词表、时长、说话人分离每一刀都对应一类场景。上设备前拿真实录音测 WER别信跨机型外推的速度倍数。运行时复用是端侧最被低估的杠杆。一个引擎同时跑 ASR 和工具调用模型省的是第二套依赖、量化和内存预算。长音频调用方自管分段按静音切而非硬切 30 秒用词级时间戳把切点对齐到词边界。# pip install cactus-needle# 长音频先转 16kHz 单声道ffmpeg -i in.m4a -ac 1 -ar 16000 in.wavimportneedle modelneedle.Whistle()# 单段≤30s词级时间戳 关键词偏置专治小模型写错人名地名rmodel.transcribe(clip.wav,word_timestampsTrue,# 每个词带 start / end / probabilitykeywords[Krzysztof,Siobhan]# 解码时抬高这些词的概率)print(r[text],r[language])# 长音频按静音切分ffmpeg silenceremove 或 VAD每段 30s 依次喂入# 用词级时间戳把跨段边界对齐到词上再拼接——不要硬切词会被切半FAQQ支持中文吗A不支持。只有英德法西意荷波七种词表与 Needle 共享、仅 8192 个 piece加语言要动引擎。中文场景继续用 Whisper 或云服务。Q比 Whisper large 强吗A不是。对标的是 base 档8 项共享测试赢 5 项讲座和会议场景反而输。大 Whisper 依然更准只是体积和延迟不在一个量级。Q能商用吗AApache 2.0无收入门槛。权重在 Hugging Face引擎覆盖 17 个平台目标含浏览器 WASM。上周相关文章上周 OpenAI 撤回三份数学手稿正好是这期的镜子https://blog.csdn.net/qq_43274490/article/details/167224571那天写的「验证才是瓶颈」在 Whistle 这里换个说法——厂商自报的性能数字同样需要第三方验证。再往前一周的《本周 AI 观察》把「分层」当主线https://blog.csdn.net/qq_43274490/article/details/166994479Whistle 是把分层又压了一层——从模型分层压到运行时分层。这个专栏每天一篇 AI 解读关注不迷路。你的语音场景现在跑在云端还是端上卡住你的是延迟、成本还是那段分段代码