顯示具有 OpenAI 標籤的文章。 顯示所有文章
顯示具有 OpenAI 標籤的文章。 顯示所有文章

AI 第一次寫出能登 Annals of Mathematics 等級的證明:OpenAI 解了 Erdős 80 年難題,但故事比新聞稿更複雜

2026 年 5 月 20 日,OpenAI 的 X 帳號貼了張圖:一張紙上散著一堆點,兩兩之間有線連著。標題很客氣:「Today we're sharing a breakthrough on the planar unit distance problem」。然後數學圈炸鍋——但炸法跟你想像的不一樣。

Erdős unit distance 問題視覺化

把這個問題用一句話講完

紙上 n 個點,最多有幾對距離恰好等於 1?

這就是 Paul Erdős 在 1946 年發表 在 American Mathematical Monthly 的問題。簡單到一個高中生聽得懂,難到全世界最頂尖的數學家頂了 80 年。Brass、Moser、Pach 在 2005 的 Research Problems in Discrete Geometry 直接寫:「可能是組合幾何裡最有名(也最容易解釋)的問題。」 Noga Alon 形容它是「Erdős 最喜歡的問題之一」 ,Erdős 本人甚至為它出過獎金。

Erdős 自己證明了下界:

u(n) ≥ n^(1 + Ω(1/log log n))

意思是「至少會以這個速度成長」。然後他 conjecture:上界也差不多就這樣——n^(1+o(1)) 是最佳。
1984 年 Spencer、Szemerédi、Trotter 給了上界 O(n^(4/3)),至今未動。中間夾著 conjecture 的空間,80 年沒人填過。

直到 5 月 20 日,這個間隔被一個 LLM 撕了個小口。

看清楚這次發生了什麼

Erdős 1946 歷史氛圍

我先把細節釐清,因為媒體報導跟學者反應落差很大。

OpenAI 官方公告 5/20 發布。內部一個未公開的模型——Scott Aaronson 的部落格透露代號是 GPT-5.5 Pro ——用一個 prompt 完成了任務:

反證了 Erdős 的 conjecture。找出構造,給出 u(n) ≥ n^(1+δ),其中 δ 是固定正數。OpenAI 官方版本未明確 δ 數值, Scott Aaronson 部落格估算 δ ~ 10^-38 。

對。反證,不是證明。
δ 究竟多小不影響數學意義——只要是固定正數,就是 polynomial improvement,conjecture 就垮了。Erdős 認為「上界長得就像下界」,AI 直接證明這想法錯了。

關鍵更有意思的是方法:

領域角色
組合幾何(combinatorial geometry)原問題在這個領域
代數數論(algebraic number theory)AI 用來打開問題的工具
核心結構:Golod-Shafarevich 無限類域塔AI 拿來建構反例

「拿數論工具來解組合幾何」這件事本身在學界不算新,但沒人想到要這樣用。
The Conversation 的解析 講得很白:「80 年來,大家都覺得 Erdős 的直覺大概是對的——直到 AI 用一個完全不同領域的工具,找到了能打破上界的構造。」

Ars Technica 補充 :Erdős 假設「方形格點」大概就是最優,AI 找到一種比格點更複雜但更稠密的點排列——「想像成 Erdős 格點的聰明改版」。

OpenAI 公開了完整 prompt ,但完整 125 頁的中間推理檔案沒釋出。Nature 的解析裡 Sébastien Bubeck 強調這是「experimental, general-purpose reasoning model」——不是專門訓練解數學的模型。一個通用推理模型,吃下一個改寫成機器可讀格式的 Erdős 原題,吐出一個正確的反例構造。

數學家的真實反應

數學家反應

這裡開始變有趣。OpenAI 找了 9 位頂尖數學家先看結果,並請他們寫了 一份共同回應論文 (arXiv 2605.20695)——Alon、Bloom、Gowers、Litt、Sawin、Shankar、Tsimerman、Wang、Matchett Wood 聯名。這個陣容本身就是一個訊號:學界願意把這件事當「真的數學」看。

Noga Alon(Princeton 組合學泰斗)寫得最直接:

「There is no doubt that the solution to the unit-distance problem is a milestone in AI mathematics: if a human had written the paper and submitted it to the Annals of Mathematics and I had been asked for a quick opinion, I would have recommended acceptance without any hesitation. No previous AI-generated proof has come close to that.」

Annals of Mathematics 是數學界頂級期刊。Alon 說「毫不猶豫推薦接受」——這句話在學界的重量很重。

Tim Gowers(Fields Medal 得主)的反應更耐人尋味。他先是嚇傻, 被 Ars Technica 引述了一句很誠實的話 :

「I spent the evening adjusting my world view: If the AI could come up with a proof like that, then maybe it would be all over for mathematicians very soon.」

夭壽。
但他後來研究細節後鬆口氣——他在 companion paper 裡補充:「這次 AI 做的事,更接近 AlphaEvolve 那種優化工作,而非『靈感性洞察』。」也就是說:AI 在已知概念空間裡找到了人類沒注意到的組合,這跟「想出全新理論框架」還有距離。

Daniel Litt:

「至今 AI 自主產出的最獨特、最有趣的結果。」

Gil Kalai 在自己部落格 的標題用了一個字:「Amazing.」——這位老先生不會輕易這樣寫。

Scott Aaronson 的部落格標題就猛了 :「Dispatches from the possibly last days of human relevance」。
真的可能嗎?接下來這段最關鍵。

故事的反高潮:人類幾天內就改進了 AI

AI 與人類協作

這篇 blog 我覺得最該講的不是「AI 多神」,而是接下來發生的事。

Scott Aaronson 那篇部落格 寫的一個關鍵後續:

「Shortly afterward, Will Sawin, a human (!), improved GPT's construction to get ~n^1.014 pairs.」

意思是:AI 給的構造把 δ 推進到一個極小但確定為正的數(Aaronson 推估 10^-38 量級);Princeton 數學家 Will Sawin 沒幾天時間,把同樣的構造方向細化,把 δ 推到 0.014——這個改進 由 OpenAI 官方公告正式收錄 。隨後 MathOverflow 與 erdosproblems.com 論壇上 多位學者持續推進,目前最佳記錄已到 δ ≈ 0.0346——包括 ChatGPT 5.5 Pro 與人類數學家來回協作的成果。連 Gil Kalai 也補了一筆:Anthropic 後續用自家系統獨立自主反證了同一 conjecture 的強形式,且這條線索激發 Bloom、Sawin、Schildkraut、Zhelezov 接著反證了 Erdős-Szemerédi sum-product conjecture(實數版)。

Daniel Litt 的補充也很關鍵 :他被 OpenAI 找去檢查結果,看了一下就確認 AI 的解法是對的;然後他自己「nerd-sniped」進去想了一個週末,但「這些(後續優化)想法現在大概都已經被涵蓋了」——意思是 AI + 大批人類數學家後續快速跟進,把這個構造的細節給做完了。

這形成一個很乾淨的故事弧:

角色做的事
Erdős(1946)提出 conjecture,給下界
Spencer/Szemerédi/Trotter(1984)給最佳已知上界 n^(4/3)
GPT-5.5 Pro(2026/5/20)找到反例的「框架方向」(δ 極小但 > 0)
Will Sawin(2026/5 月底)沿著 AI 的方向把 δ 推到 0.014
MathOverflow + ChatGPT 5.5 Pro 接力(5 月下旬)δ 持續推進,目前最佳 ≈ 0.0346
Anthropic 系統(後續)自主獨立反證同一 conjecture(強形式)
9 人共同論文解釋、消化、推廣
目前狀態conjecture 被反證,但確切上下界仍有巨大未知

這不是「AI 取代數學家」,是「AI 把第一條岔路找出來,數學家走得比 AI 還深」。Litt 那句最有意思:

「我猜這次它幸運地找到一個——專家試過但漏掉相對簡單路徑的——案例。但我猜這種案例其實不那麼罕見,我們可能很快就會發現。」

如果他的猜測對,接下來幾年數學界會像被翻書——一堆「大家都覺得對」的 conjecture 會被類似手法戳破。

更大的脈絡:AI 寫得了論文,但需要人類寫得了問題

AI 點亮被遺忘的路徑

這件事不孤立。把脈絡拉開看:

中間夾著 FrontierMath benchmark ——300+ 道專家級題目,Tier 4 是研究等級。 2025 中 o4-mini 在 Tier 4 才 6.3% ,多數頂級模型 0%。Tim Gowers 與 Terence Tao 共同預測:「會抵抗 AI 好幾年。」
不過——2026/5/11 Epoch AI 自己宣告,AI 輔助複查發現 FrontierMath 約 1/3 題目有「fatal errors」 。benchmark 本身正在被 AI 修正。

DeepMind 也沒閒著:AlphaEvolve 用演化式搜尋設計演算法、Co-Scientist 跑多 agent 科研協作。Gowers 在 companion paper 裡那句點得很好:

「數學的知識邊界是很尖銳的(spiky),未來幾個月幾年,會有更多長存的 open problem 被 AI 用『意外連結』解掉。AI 正幫我們更完整地探索我們花了好幾世紀建起來的這座數學大教堂——還有什麼沒被看見的奇景?」

同類的「AI 找到人類漏掉的」也發生在其他領域。Code with Claude 2026 keynote 提到 Claude Mythos 在 OpenBSD source tree 找出 27 年前的漏洞 ——同樣是「在大家都看過的東西裡找到沒看見的路徑」。

這個型態的價值,比「AI 拿 IMO 金牌」更深。
IMO 題目有標準答案;研究問題沒有。AI 開始在「沒答案的問題上找方向」,這才是質變。

工程師可以怎麼想這件事

不寫數學論文的人也應該關心這件事,因為同一個機制在 codebase、在系統設計裡都會發生。

「人類試過但漏掉相對簡單路徑」——這句話換到工程語境就是:

  • 你的舊系統裡有沒有「大家都以為要這樣」但其實有更乾淨解法的地方?
  • 你看了 N 年的 codebase 有沒有「沒人質疑過的 invariant」?
  • 你的 benchmark / monitoring 有沒有「假設大家都對」的盲區?

GPT-5.5 Pro 解 Erdős 不是因為它比 Erdős 聰明,是因為它沒有 Erdős 的 prior——它不被「應該長這樣」的直覺綁住,就把代數數論的工具搬過來試。
寫 code 的工程師如果不開始用同樣的 mindset 配對 AI,那是浪費。我自己(硬韌體背景)最近開始把 AI 用在「拿出大家公認的 design pattern 重新審視」——不一定每次有收穫,但已經幾次找到老設計裡的盲點。

Daniel Litt 那句該背起來:

「人類試過但漏掉相對簡單路徑的案例,可能不那麼罕見。」

放到你的工作場景,這句話是禮物。

寫在最後

5/20 那張看起來樸素的點圖,背後不只是一次 AI 勝利。它是個訊號:AI 第一次在沒人指路的問題上找到方向,方向正確到讓人類數學家願意花幾天接力把細節做完,並聯名寫一篇 companion paper 解釋這件事。

Will Sawin 把 δ 從 10^-38 推到 0.014 也是訊號——人類的角色沒消失,但形狀變了。
從「想出第一條路」變成「走通 AI 指出來的路」。

很多人會問:「下一步呢?」我不知道。但 Gowers 那句「what other unseen wonders are waiting in the wings」是我接下來幾個月會反覆想的事。
你的工作裡,有什麼是「大家都試過但漏掉相對簡單路徑」的?這個問題,比 Erdős 88 年前那道題還難。


延伸閱讀

ChatGPT使用技巧全指南(2025年5月最新)

本文將全面介紹ChatGPT Plus的各種模型功能與實用技巧,讓您從訂閱中獲得最大價值。

2025年5月最新更新!包含o3和o4-mini等最新模型詳解

很多使用者每個月花費20美元訂閱了ChatGPT Plus版本,卻沒有充分利用訂閱提供的多樣化AI模型功能。其實,在ChatGPT Plus中包含了多達八款功能強大的AI模型,每個模型都有各自的特長,從圖像分析、計劃任務到快速回應,都能滿足不同的使用需求。

ChatGPT模型架構:兩大系統的全新定位(2025年5月最新)

隨著AI技術迅速發展,OpenAI已經將ChatGPT模型明確劃分為兩大系列,設計宗旨和功能特長各異:

  1. GPT系列:屬於「通用型模型」,強調回應速度、多模態處理和即時互動,適合日常對話、內容創作和一般應用。
  2. o系列:屬於「推理模型」,專為複雜推理、深度分析和專業領域設計,適合解決需要多步驟邏輯思考的專業問題。

ChatGPT最新模型詳解(2025年5月更新)

GPT系列模型

GPT-4o(2024年5月13日推出)

  • 全能型多模態旗艦模型,能夠處理文字、語音、圖像和影片
  • 支援即時互動、圖像分析和生成高品質圖片
  • 能從影片中截取畫面進行分析,適合處理多媒體內容
  • 已開放給所有用戶使用(免費、Plus、Pro、Team和Enterprise)
  • 適用場景:旅遊規劃、數學教學、商品推薦、日常創意內容生成

GPT-4o mini(2024年7月18日推出)

  • GPT-4o的輕量版,速度更快、成本更低
  • 適合日常快速問答和小型圖像分析任務
  • 從2025年1月起免費可用
  • 不擅長複雜規劃任務或高精度圖片生成
  • 適用場景:日常使用、簡單圖像分析、高頻率互動

GPT-4.5(2025年2月27日推出)

  • 專業情感多模態版,OpenAI最新研究預覽模型
  • 特點:更高情商、更強知識準確性、創意生成、低幻覺率
  • 在語言理解、情感互動和專業推理上表現優秀
  • 目前僅限Plus和Pro用戶使用,且有使用次數限制
  • 適用場景:創意構想、品牌行銷策略、主觀性規劃任務、商業文案、小說或學術論文

GPT-4.1(2025年4月14日推出)

  • 超長上下文處理的專業API模型
  • 具備超長上下文處理能力和卓越的資訊整合性能
  • 目前僅透過API供開發者使用,尚未整合進ChatGPT網頁版
  • 適用場景:商業分析報告、學術研究、策略建議、多輪對話串接的應用開發

o系列模型

o3(2025年4月17日更新)

  • OpenAI推出的最高階推理模型
  • 特色:強大的邏輯推理能力,能"用圖像思考",使用Python來處理圖片
  • 整合了ChatGPT內建工具,可以即時搜尋網路資料、使用Python做分析或繪圖、解讀與生成圖片
  • 思考時間較長,但提供詳盡資訊
  • 適用場景:學術研究、工程技術、技術文件撰寫、程式設計、邏輯分析等專業任務

o4-mini(2025年4月17日推出)

  • 高效率推理模型,o3-mini的進化版
  • 特色:快速進行高級推理、成本低、效率高
  • 同樣具備整合工具、搜尋網路資料和圖片處理能力
  • 思考時間短,適合快速獲取資訊
  • 適用場景:教育輔助工具、軟體應用測試、中小企業AI應用、需要大量快速互動的情境

o4-mini-high(2025年4月17日推出)

  • 深度推理增強版
  • 在o4-mini基礎上增強了視覺推理能力
  • 適用場景:需要快速分析圖片中數量、關係等視覺元素的任務

注意:o3和o4-mini系列已取代了之前的o1、o3-mini和o3-mini-high模型。免費用戶可通過選擇"Think"選項來嘗試o4-mini。

ChatGPT各訂閱方案權益(2025年5月)

免費版(Free)

  • 可使用GPT-4o mini
  • 有限使用GPT-4o和o3-mini
  • 具備網路搜尋功能
  • 有限支援檔案上傳、資料分析、圖片生成與語音模式
  • 可使用自訂GPTs

Plus方案(每月20美元)

  • 包含免費版所有功能
  • 擴大訊息傳送、檔案上傳、資料分析與圖片生成的使用限額
  • 提供標準與進階語音模式,支援視訊與螢幕共享
  • 使用多種高階推理模型(o3、o4-mini、o4-mini-high)
  • 可體驗GPT-4.5研究預覽
  • 可建立與使用「專案」、「任務」、「自訂GPTs」

Pro方案(每月200美元)

  • 高級模型無限制使用
  • 擴展上下文窗口達128,000個token
  • 數據分析:處理大型數據集
  • Sora視頻生成功能:生成高解析度、長達20秒的無水印視頻
  • 優先功能測試和更快的響應速度

如何有效利用ChatGPT各模型的實用技巧

1. 選擇合適的模型

需求類型 推薦模型 說明
日常快速問答 GPT-4o mini或GPT-4o 速度快,能滿足一般對話需求
多媒體內容處理 GPT-4o 圖像、音頻和影片處理能力強
專業邏輯分析 o3 深度推理,處理複雜問題
高效率處理 o4-mini 優化速度與推理能力的平衡
複雜內容創作 GPT-4.5 創意生成與情感理解能力強
長篇內容處理 GPT-4.1 (API) 支援超長上下文窗口

2. 提升提示詞效率的技巧

  • 思維鏈技術:讓模型透過逐步思考來解決複雜問題
  • 提示鏈方法:將高度複雜任務拆解為多個單一任務,確保資訊順利傳遞
  • 提供多個範例:在指令中提供精心設計的範例,幫助模型理解預期輸出
  • 使用XML標籤:標記指令中的不同段落,區分上下文、指示和範例
  • 善用長上下文提示:將大量前置資料放在指令上方,任務目標放在下方

提示範例:「我希望你分析以下產品數據,首先計算平均銷售額,然後找出表現最好的三個產品,最後給出促銷建議。數據如下:[數據]。請你按步驟思考,每一步都寫出你的分析過程。」

3. 充分利用多模態功能

  • 圖像分析:使用GPT-4o或o3解析圖片中的複雜資訊
  • 使用Python功能:特別是o3和o4-mini模型可以使用Python來裁剪、轉換或處理圖片
  • 即時搜尋網路資料:o系列模型可以搜尋最新資訊補充回答

4. 進階功能應用

  • 自訂GPTs:根據特定需求創建專屬AI助手
  • 檔案上傳分析:上傳專業領域資料供模型參考
  • 語音模式:使用語音互動提高效率

總結

ChatGPT在2025年已發展出清晰的通用型和推理型兩大模型系列,能滿足從日常對話到高階專業分析的各種需求。付費用戶應根據自身需求,明智選擇適合的模型,並掌握提示詞優化和多模態功能使用技巧,以充分發揮訂閱價值,實現最佳工作效率。

若有任何問題或建議,歡迎留言或分享您的使用心得!

tags: `ChatGPT` `AI工具` `OpenAI` `提示詞技巧` `2025更新`

本文最初發布於 HackMD @BASHCAT。

在 macOS 上安裝使用 Whisper.cpp 完整指南

📄 文件說明:本文檔詳細介紹如何在 macOS 系統上安裝、編譯和使用 Whisper.cpp 進行即時語音辨識,支援中文(繁體/簡體)。最後更新:2025年5月

📚 簡介

whisper.cpp 是 OpenAI Whisper 語音識別模型的 C/C++ 實作版本,與原版 Python 相比,具有以下優點:

  • 🚀 更快速:C++ 實作使推理速度提升 4-5 倍
  • 💻 更輕量:不需要 Python、PyTorch 或大型 ML 框架
  • 📱 更便攜:可在多種裝置上運行,包括 CPU 和 GPU 支援

主要功能

  • ✓ 即時麥克風語音辨識
  • ✓ 支援多國語言(含繁體/簡體中文)
  • ✓ 高精度語音轉錄
  • ✓ 低延遲和高效能
  • ✓ 語音活動偵測(VAD)整合
  • ✓ 時間戳標記(定位詞語時間點)
  • ✓ 輸出多種格式(文字、SRT、VTT 字幕)
  • ✓ 支援 Apple Silicon 原生加速

🛠️ 環境設置

系統需求

  • macOS 10.15 (Catalina) 或更新版本
  • 4GB+ RAM(建議 8GB+)
  • 支援 Intel 和 Apple Silicon (M1/M2/M3) 晶片

💨 快速安裝方法 (2025年最新)

使用 Homebrew 一鍵安裝 (最簡單)

2025年,Whisper.cpp 已正式提供 Homebrew 安裝套件,這是最簡單的安裝方法:

# 安裝 Whisper.cpp 和依賴的 ffmpeg
brew install whisper-cpp ffmpeg

:::tip 提示:這種方法適合快速入門,但功能相對有限。若需要最大化效能或啟用進階功能(如 Metal 加速),建議從源碼編譯安裝。 :::

檢查安裝版本

安裝後,您可以檢查 Whisper.cpp 的版本:

whisper-cpp --version

目前最新穩定版本為 v1.7.2(截至2025年5月)。

🎤 安裝 SDL2 音訊處理函式庫

whisper.cpp 的即時轉錄功能依賴 SDL2 來擷取麥克風音訊。

在終端機中執行以下命令安裝 SDL2:

brew install sdl2

📥 從源碼編譯安裝 (進階選項)

1. 複製專案

git clone https://github.com/ggerganov/whisper.cpp.git
cd whisper.cpp

# 切換到最新穩定版本(目前為v1.7.2)
git checkout -b v1.7.2 v1.7.2

2. 啟用 Metal 和 Core ML 加速 (Apple Silicon 專用)

對於 M1/M2/M3 芯片的 Mac,可以啟用 Metal 和 Core ML 加速以獲得最佳效能:

# 使用 Metal 加速(Apple Silicon 優化)
cmake -B build -DWHISPER_METAL=ON -DWHISPER_SDL2=ON

或者也可以啟用 Core ML:

# 使用 Core ML 加速
cmake -B build -DWHISPER_COREML=ON -DWHISPER_SDL2=ON

3. 標準編譯(適用於所有 Mac)

如果不需要特殊加速,可以使用標準編譯:

cmake -B build -DWHISPER_SDL2=ON
cmake --build build --config Release

編譯完成後,whisper-stream 可執行檔將位於 build/bin/ 目錄中。

🔎 模型選擇與下載

Whisper 提供多種不同大小和精確度的模型。對於中文語音辨識,建議使用多語言模型,而非僅限英文的 *.en 模型。

模型對照表 (2025年更新)

模型名稱 檔案大小 記憶體需求 相對速度 準確度 中文支援 備註
tiny 75MB 390MB 最快 最低 ✅ 基本支援 適合極度受限的裝置
base 142MB 500MB 快 較低 ✅ 支援 適合一般對話
small 466MB 1.0GB 中等 中等 ✅ 良好支援 平衡速度和準確度
medium 1.5GB 2.6GB 較慢 較高 ✅ 優良支援 適合專業轉錄
large-v3 3.1GB 5.0GB 慢 最高 ✅ 最佳支援 最高準確度
large-v3-turbo 3.0GB 4.8GB 中等 較高 ✅ 最佳支援 新: 平衡速度與準確度

注意:

  • 帶有 -q5_0 或 -q8_0 後綴的模型是量化版本,犧牲少量準確度來換取更快的速度和更小的檔案大小
  • 帶有 -turbo 後綴的模型是2024年新增的平衡型模型,提供更好的效能和精確度平衡

Apple Silicon 專用模型

對於 M1/M2/M3 芯片的 Mac,可以使用專為 Apple Silicon 優化的模型版本:

# 下載 Apple Silicon 優化版 large-v3 模型
./models/download-ggml-model.sh large-v3-applesilicon

一般模型下載

使用內建的下載腳本取得所需模型:

# 下載 base 多語言模型(支援中文,較小)
./models/download-ggml-model.sh base

# 或下載量化版 large-v3 模型(最佳中文支援,速度較快)
./models/download-ggml-model.sh large-v3-q5_0

# 或下載新的 turbo 模型(平衡速度與準確度)
./models/download-ggml-model.sh large-v3-turbo

# 或下載完整 large-v3 模型(最佳準確度,但較慢)
./models/download-ggml-model.sh large-v3

提示:下載時請使用模型名稱(如 large-v3),而非檔案名稱(如 ggml-large-v3.bin)。

🎧 音訊格式處理

Whisper.cpp 最佳支援 16kHz、16-bit 單聲道 WAV 格式。如果您的音訊檔案是其他格式,需要先進行轉換。

使用 ffmpeg 轉換音訊

# 將任何音訊檔案轉換為 Whisper 最佳支援格式
ffmpeg -i 輸入檔案.mp3 -ar 16000 -ac 1 -c:a pcm_s16le 輸出檔案.wav

從影片提取音訊

# 從影片提取音訊並轉換為適合的格式
ffmpeg -i 影片檔案.mp4 -ar 16000 -ac 1 -c:a pcm_s16le 輸出檔案.wav

🚀 執行即時語音轉錄

中文語音辨識(即時麥克風輸入)

# Homebrew 安裝版本的執行方式
whisper-cpp \
  --model <sub>/tools/ggml-large-v3-turbo.bin \
  --language zh \
  --threads 4 \
  --step 500 \
  --length 5000 \
  --vad-thold 0.6 \
  --print-colors \
  --split-on-word \
  --max-len 65

# 或使用源碼編譯版本的執行方式
./build/bin/whisper-stream \
  -m models/ggml-large-v3-q5_0.bin \
  -l zh \
  -t 4 \
  --step 500 \
  --length 5000 \
  --keep 200 \
  --vad-thold 0.6 \
  --freq-thold 100.0 \
  -ps \
  -kc \
  -f whisper_output.txt

2025年新增實用參數

參數 說明
--split-on-word 在單詞邊界分割文本,避免單詞被截斷
--print-colors 使用彩色輸出,提高可讀性
--max-len <n> 設定每行最大字元數,適合字幕製作
--no-timestamps 關閉時間戳記輸出
--output-vtt 輸出 WebVTT 格式字幕
--output-srt 輸出 SRT 格式字幕

原有參數說明

參數 說明
-m 模型檔案路徑
-l zh 語言設定為中文(支援繁體/簡體)
-t 4 使用 4 個執行緒
--step 500 每 500ms 擷取語音進行分析
--length 5000 每輪處理 5 秒音訊
--keep 200 保留前一段 200ms 防止語音被截斷
--vad-thold 0.6 語音活動偵測門檻,0.50.8 間調整
--freq-thold 100.0 高通濾波,消除背景低頻雜訊
-ps 顯示特殊 tokens,如 [NOISE]
-kc 保留語境,可提升對話連貫性
-f whisper_output.txt 將輸出儲存至文字檔

:::tip 最佳化提示:若模型辨識結果出現重複詞彙循環,可以:

  1. 降低 --keep 值至 100ms
  2. 不使用 -kc 參數
  3. 增加 --step 間隔時間至 1000ms
  4. 考慮使用未量化的完整模型 :::

📊 效能參考數據 (2025年)

以下是在不同 Apple 裝置上處理 10 分鐘中文音訊的參考時間:

裝置 模型 處理時間 即時因子
MacBook Pro M3 large-v3-turbo 1.5 分鐘 6.7x
MacBook Pro M2 large-v3-q5_0 2 分鐘 5.0x
MacBook Air M1 medium 1.8 分鐘 5.5x
Mac Mini Intel i5 small 2.5 分鐘 4.0x

即時因子:處理時間與音訊長度的比率,越高越好

📱 進階應用:集成到 iOS/macOS 應用

Whisper.cpp 2025年版本提供了 XCFramework 支援,方便開發者集成到自己的 iOS 和 macOS 應用中。

建立 XCFramework

# 在 whisper.cpp 目錄下
cd apple
./setup.sh
./build-xcframework.sh

這將在 apple/framework/whisper.xcframework 生成可直接集成到 Xcode 專案的框架。

在 Xcode 專案中使用

  1. 將生成的 whisper.xcframework 拖曳到您的 Xcode 專案
  2. 在 Build Phases > Link Binary With Libraries 中確認框架已加入
  3. 在 Swift 或 Objective-C 代碼中引用 Whisper API
import whisper

// 初始化 Whisper 上下文
let context = whisper_init_from_file("path/to/model.bin")

// 使用 Whisper 進行轉錄
// ...

// 釋放資源
whisper_free(context)

📝 常用指令範例

建立便捷執行腳本

可以創建 whisper-mic.sh 腳本,方便日後執行:

#!/bin/bash
./build/bin/whisper-stream \
  -m models/ggml-large-v3-q5_0.bin \
  -l zh \
  -t 4 \
  --step 500 \
  --length 5000 \
  --keep 200 \
  --vad-thold 0.6 \
  --freq-thold 100.0 \
  -ps \
  -kc \
  -f whisper_output.txt

加上執行權限:

chmod +x whisper-mic.sh

處理音訊檔案(非即時)

使用 whisper-cli 工具處理預先錄製的音訊檔:

./build/bin/whisper-cli \
  -m models/ggml-large-v3-q5_0.bin \
  -f samples/zh.wav \
  -l zh \
  --output-txt \
  --output-srt

自動檢測語言

# 自動檢測音訊的語言
./build/bin/whisper-cli \
  -m models/ggml-large-v3.bin \
  -f samples/audio.wav \
  --auto-language

🔍 常見問題排解

1. 辨識結果重複詞彙或句子

問題:輸出像 [_BEG_]回顧一年的房地產[_TT_100][_TT_100]回顧一年的房地產[_TT_200]... 反覆出現。

解決方案:

  • 減少 --keep 參數值
  • 移除 -kc 參數
  • 增加 --step 間隔
  • 使用更高質量的模型

2. 輸出含有 [_BEG_] 和 [_TT_] 標記

說明:

  • [_BEG_] 表示新段落開始
  • [_TT_150] 是時間戳標記(表示 1.5 秒)

這些是內部標記,用於標示轉錄時間點,一般可忽略。

3. 不想在終端顯示輸出

./build/bin/whisper-stream ... > /dev/null

這會將所有輸出導向空設備,但仍保留檔案輸出(如有使用 -f 參數)。

4. Metal 或 Core ML 加速無法使用

問題:編譯時啟用了 Metal 或 Core ML,但執行時出現錯誤。

解決方案:

  • 確保您使用的是 Apple Silicon Mac
  • 使用 xcode-select --install 確保開發工具齊全
  • 嘗試更新至最新的 macOS 版本

🌐 網頁版支援 (2025新增)

Whisper.cpp 現在也支援在網頁瀏覽器中運行(透過 WebAssembly):

  1. 在線試用:https://ggml.ai/whisper.cpp/
  2. 自行部署:
    cd examples/web
    ./build.sh
    python -m http.server
    

📚 參考資源


tags: whisper openai audio-transcription speech-recognition cpp macos

本文最初發布於 HackMD @BASHCAT。

8GB 的 RK3588 能跑多聰明的 LLM?ROCK 5C 用 NPU 實測 5 個模型

先講結論,省得你滑到最後: 在一片 8GB 的 RK3588 板子上,用 NPU 跑得最聰明的是 Qwen3-4B-Instruct-2507,我出的 7 題全對,但每秒只吐 3.7 個 token。 想要順一點的對話體驗,Qwen3.5-2B 的 8.4 tok/s 是比...