Hacker News 中文摘要

RSS订阅

苹果新推出的SpeechAnalyzer API,与Whisper及其前身进行基准测试 -- Apple's new SpeechAnalyzer API, benchmarked against Whisper and its predecessor

文章摘要

苹果新推出的SpeechAnalyzer语音API在LibriSpeech测试中表现优异,词错误率仅2.12%,远超Whisper Small的3.74%和旧版SFSpeechRecognizer的9.02%,且运行速度比Whisper Small快约三倍,成为目前最准确的设备端语音引擎。

文章总结

好的,这是根据您的要求,对原文进行中文重述和精简后的版本:

标题:苹果新语音API vs Whisper:首个真实基准测试

核心结论:

苹果新推出的SpeechAnalyzer是我们测试过的最准确的设备端语音引擎。在LibriSpeech数据集的干净和嘈杂语音测试中,它都击败了我们使用的所有Whisper模型(包括Whisper Small),同时运行速度比Whisper Small快约三倍。而被其取代的旧API(SFSpeechRecognizer)在干净语音测试中表现最差,甚至落后于仅40MB的Whisper Tiny模型。

| 引擎 | 干净语音词错率 | 嘈杂语音词错率 | 模型大小 | | :--- | :--- | :--- | :--- | | Apple SpeechAnalyzer | 2.12% | 4.56% | 系统内置 | | Whisper Small | 3.74% | 7.95% | ~460MB | | Whisper Base | 5.42% | 12.51% | ~140MB | | Whisper Tiny | 7.88% | 17.04% | ~40MB | | Apple SFSpeechRecognizer (旧版) | 9.02% | 16.25% | 系统内置 |

(注:词错率越低越好,表示识别错误越少。所有引擎均在Apple M2 Pro设备上本地运行。)

为何进行此测试:

苹果在iOS 26和macOS 26中,用新的SpeechAnalyzer和SpeechTranscriber API取代了SFSpeechRecognizer,但未公布任何准确率数据。这使得开发者在决定是否迁移,或比较苹果内置识别与Whisper时,只能靠猜测。我们恰好在自己的产品中同时使用了这两套引擎,因此能够用相同的代码和音频进行公平对比。

是否应迁移至新API?

是的。这是数据中最明确的结论。新API将词错率降低了3.5到4倍:干净语音从9.02%降至2.12%,嘈杂语音从16.25%降至4.56%。新API在我们测试的所有场景中都表现更优,并且能输出带标点和大小写的文本,而旧引擎的输出则较为粗糙。

SpeechAnalyzer vs Whisper

更令人惊讶的是,苹果的新引擎也以明显优势击败了我们使用的最大Whisper模型(Whisper Small),且处理每秒钟音频的计算时间仅为Whisper Small的三分之一。在苹果硬件上进行英语识别时,内置引擎已成为我们可测量的最强设备端选择。

Whisper仍有两个优势:支持更多语言(SpeechTranscriber仅支持约30种),且可在任何平台上运行,不限于苹果设备。但对于在最新iPhone或Mac上进行英语转录,Whisper作为准确率首选的时代已经结束。

速度与验证方法

所有引擎的运行速度都远超实时。SpeechAnalyzer在准确率更高的同时,速度比Whisper Small快约3倍。

为确保结果可信,我们做了两点:首先,我们使用Whisper官方发布过的LibriSpeech数据集进行测试,我们的Whisper测试结果与官方数据高度吻合,证明了测试方法的可靠性。其次,我们公开了所有原始转录文本,任何人都可以下载并自行验证。

对开发者的启示

如果您使用的是当前一代的iPhone或Mac,那么英语设备端转录的最佳引擎已经内置在操作系统中。这个注重隐私的选项不再是妥协之选。我们的产品正是基于此基准测试结果,在支持的语言上优先使用SpeechAnalyzer,其他情况则使用Whisper。

评论总结

根据评论内容,总结如下:

主要观点与论据:

  1. Apple SpeechAnalyzer 性能显著提升(作者 get-inscribe,评分 None):

    • 在 LibriSpeech 测试集上,新 API 的词错误率(WER)从 9.02% 降至 2.12%,比旧 API 提升 3.5-4 倍,且速度是 Whisper Small 的 3 倍。
    • 关键引用:
      • "the new API cuts WER 3.5-4x vs the old one (2.12% vs 9.02% on test-clean)"
      • "it also beat Whisper Small on both splits at about 3x the speed"
  2. 对基准测试的质疑(多位评论者,如 modeless、pzo、satvikpendem):

    • 认为仅与 Whisper Small/Tiny/Base 比较不够全面,应对比更先进的模型(如 Whisper Large V3、Nvidia Nemotron/Parakeet、Mistral Voxtral)。
    • 关键引用:
      • "Whisper small/tiny/base are almost four years old... Is there really nothing better to benchmark against by now?"(modeless)
      • "This is useless test... when you have these day Whisper-V3-Large and Whisper V3-Turbo"(pzo)
  3. 开源与本地运行需求(drnick1、tancop):

    • 强调模型需开源、可本地运行,否则无法替代 Whisper 等开放模型。
    • 关键引用:
      • "If this isn't open source/weights and can't run locally, I don't see how this is a replacement for Whisper"(drnick1)
      • "life's too short to let apple keep their models exclusive"(tancop)
  4. 实际使用体验(ashivkum、paul7986):

    • 在数学讲座等场景中,SpeechAnalyzer 速度快、质量略逊于 Whisper Large,但可用于实时转录。
    • 用户对 Siri 在旧设备上的表现失望,认为不如 ChatGPT 流畅。
    • 关键引用:
      • "Just ran it against Whisper-Large-V2... substantially faster and only slightly worse"(ashivkum)
      • "the new Siri on my old phone... doesn't come close. It's the same old 'Could you try that again,' Siri"(paul7986)
  5. 其他建议与补充(ks2048、summarity、port3000):

    • 建议使用标准基准(如 Hugging Face ASR 排行榜)进行对比。
    • 提及 Voxtral 在会议转录中表现优异,Whisper 则较差。
    • 关键引用:
      • "just get the results on a standard benchmark, so you can compare against all"(ks2048)
      • "Vs Voxtral would be a better comparison... Seems to understand/infer all the technobabble"(summarity)

平衡性总结:
- 支持方:认可 Apple 新 API 在准确率和速度上的显著提升,尤其适合实时转录。
- 质疑方:批评基准测试不全面,强调开源、本地运行及多语言支持的重要性。
- 中立方:建议使用标准基准,并关注实际场景(如会议、数学讲座)的适用性。