MuScriptor 音訊轉 MIDI的真正價值,不是按一下就得到「完美樂譜」,而是把原本只能聽的錄音,轉成可以移動音符、換音色、重配和聲的編輯起點。這篇會從素材權利、官方示範站與本機安裝開始,一路做到 DAW(數位音訊工作站)/MuseScore 清理、固定片段 A/B(只改一個條件的前後對照)與交付前驗收。你不需要先會寫程式,但要接受一件事:AI 先產生粗轉錄,真正可用的 MIDI 還要靠人把節拍、樂器、時值與力度整理好。
截至 2026 年 8 月 24 日,MuScriptor 是 Kyutai 與 Mirelo 開發的多樂器轉錄模型,能把音訊輸出成 MIDI,也能透過 MuseScore 產生樂譜。接下來會依序完成官方示範站初步檢查、本機安裝、模型選擇、DAW 清理與六項交付驗收;輸出是否可用,統一用同一套清單判斷。
先說結論:MuScriptor 給你的是粗譜,不是母帶答案
- 第一次使用:先拿自己錄製或已取得處理權利的短片段到官方示範站,確認模型能否辨認主旋律、低音與主要節奏。
- 需要反覆處理:接受 Hugging Face 的非商用權重條款後,用本機版固定模型與指令,保留可重做的流程。
- 進入編輯:把原始音訊與 MIDI 同時放進 DAW,先校正小節與速度,再清理錯音、重疊音符、誤判樂器與力度。
- 準備交付:用同一段來源做 A/B,確認結構、音高、分軌、節奏與檔案相容性;只要其中一項仍會讓下游誤判,就還不是完成品。
本文的錨點公式:可交付 MIDI = AI 粗轉錄+節拍校正+樂器分軌+人工驗收。後面每一步都在補這四塊,而不是追求一個神奇的「100% 正確」按鈕。

MuScriptor 音訊轉 MIDI 在做什麼?先分清楚音訊、MIDI 與樂譜
MP3、WAV 裡存的是聲音波形;MIDI 存的是「哪個音、何時開始、何時結束、分到哪種樂器」等事件。MuScriptor 會先把輸入轉成 16 kHz 單聲道,在連續的小片段上辨認 onset(開始點)、offset(結束點)、pitch(音高)與 instrument(樂器類別),再把事件寫進多軌 MIDI。這類任務叫 automatic music transcription(自動音樂轉錄),和把人聲變逐字稿的語音辨識不同;如果想先理解本機音訊前處理的共通問題,可延伸讀NeMo-Speech.cpp 本機音訊 API 教學。
目前官方輸出會依偵測到的樂器程式建立軌道,方便 Ableton Live 等 DAW 分開處理;鼓組使用 MIDI 鼓組專用通道(percussion channel)。可是模型沒有從錄音保留原始 velocity(力度值),因此你不能把 MIDI 的強弱當成演奏者真實力度。在頻率重疊、失真或重度處理的密集混音中,它仍可能誤判音高、時值或樂器;輸出是 MIDI 事件,不是音訊 stem。
這也解釋了 MuScriptor 與兩種常見 AI 音樂工具的方向差異。AI 鋼琴 Copilot從已經是 MIDI 的按鍵事件出發,預測下一句;MiniMax Music 3 本機教學從文字與歌詞生成新音訊。MuScriptor 則是把既有音訊反推成可編輯事件:不是續寫,也不是生成新歌。

開始前先過授權關:程式碼 MIT,不等於權重可商用
MuScriptor 程式碼採 MIT 授權,但 small、medium、large 模型權重採 CC BY-NC 4.0。BY 要求適當標示,NC 限制商業使用;「repo 是開源」不能自動覆蓋權重條款。模型卡還要求你對輸入音訊具備必要權利,且不得用於未獲授權的音樂轉錄。
- 個人研究、學習或非商用 demo:先讀完整權重條款,保留使用的模型版本、來源與標示。
- 接案、上架、客戶交付或營利產品:不要只憑「免費下載」推定可用;先向權利人確認模型權重、原錄音、詞曲、表演與改編所需授權。
- 公開歌曲:聽得到或買得到不等於可拿來轉錄並散布 MIDI。最穩妥的練習素材是自己的錄音、明確公版且編曲權利也已確認的材料,或得到書面許可的片段。
所以「技術上能匯出」和「權利上能交付」是兩道不同的門。本文教的是技術清理與驗收方法;是否能商用,必須回到你的所在地、使用情境與實際授權鏈判斷。
第一步:用一組固定素材做小樣,不要先丟整首歌
先建立三種自己有權處理的固定片段,每段截取足以涵蓋一個完整樂句的區間。長度不是越長越好;目的是讓你快速辨認模型在哪一類材料出錯,並讓每次改模型或設定時都能重跑同一組。
- 單一鋼琴或乾淨旋律:檢查基本音高、和弦與時值。若這組已大量錯誤,先查輸入品質與拍點,不必直接挑 large。
- 人聲較少的樂團段落:觀察 bass、drums、keyboard/guitar 是否被拆到合理軌道。
- 完整混音的密集段落:故意放入最難的副歌或疊加段,測試錯誤密度是否已超過人工修正價值。
將三段原音檔設成唯讀,另建工作副本;記錄檔名、開始與結束時間、BPM 是否已知、預期樂器,以及你認為的主旋律與低音。這就是最小評測集。想把它做成可重複的回歸測試,可套用AI Evals 新手指南的固定資料、單一變因與評分規則(rubric)觀念。
第二步:先跑官方示範站,再決定是否自架
MuScriptor 音訊轉 MIDI的官方 demo 適合回答一個問題:「這類音訊值得繼續嗎?」上傳第一組短片段,下載 MIDI,先不要急著看五線譜;直接在系統預聽或 DAW 裡聽一次,確認主旋律、低音輪廓與主要節奏是否存在。若最重要的音樂資訊都不見了,後面精修只會變成重抄。
Show HN 上流傳的 10 秒說法來自第三方 Pianoify 包裝,不能當成 MuScriptor 官方示範站規格。若素材敏感、需要批次重做或必須固定模型版本,直接改用本機版。
第三步:本機安裝與第一個 MIDI
現行 PyPI 套件要求 Python 3.10 以上。先在 Hugging Face 登入,打開你要用的 medium 模型頁並接受權重條款;存取會自動核准,但仍需要帳號與登入憑證(token)。接著安裝 uv,在終端執行:
uvx hf auth login
uvx muscriptor transcribe input.wav --model medium -o output.mid
Linux 與 Apple Silicon Mac 可以用 uvx muscriptor serve開本機網頁介面;Windows 若要使用相容的 NVIDIA GPU,才用 uvx --torch-backend=cu128 muscriptor serve選擇 CUDA 12.8 運算後端,只有 CPU 的 Windows 則直接用 uvx muscriptor serve。Intel Mac 依官方相容性說明以 uvx --python 3.12 muscriptor serve固定 Python。這些是目前官方 README 的啟動方式,不代表任何一台符合名稱的電腦都會有相同速度。

small、medium、large 怎麼選?先用成本最低的可用基準
- small(103M,約 1.03 億參數):官方稱為只有 CPU 機器的實用選擇。適合驗證安裝、檔案與流程,不能預設在複雜混音上等同較大模型。
- medium(307M,約 3.07 億參數,預設):官方定位為速度與準確度的折衷。沒有特殊限制時,先拿它建立同一組固定片段的基準結果。
- large(1.4B,約 14 億參數):官方把它列為較準、但更需要 GPU 的選項。只有當 medium 的錯誤確實會阻礙交付,而且增加推論成本值得時,才在同一素材上 A/B。
截至 2026 年 8 月 24 日,官方 README 的平台指令會依機型選用不同加速方式;硬體表現也會隨 RAM、MuScriptor/PyTorch 版本、模型與片段長度而變。Apple Silicon 會自動使用 MPS(蘋果晶片的 GPU 加速)。第一次執行時,記錄首次載入時間、轉錄時間與輸出錯誤型態,再用同一段素材比較模型。
第四步:知道樂器時,用限制重跑;不知道時不要亂猜
若你明確知道素材只有 acoustic piano 與 drums,可先列出支援名稱,再用樂器限制重跑:
uvx muscriptor list-instruments
uvx muscriptor transcribe input.wav \
--model medium \
--instruments acoustic_piano,drums \
-o constrained.mid
--instruments是硬性遮罩,不在清單裡的樂器 token(模型事件代碼)不會出現在輸出。因此它適合修正「已知編制卻一直冒出錯誤音色」,不適合拿未知完整混音亂填答案。限制太窄會禁止未列樂器 token,可能造成漏音或錯誤標記;請保留 unrestricted(無限制)與 constrained(有限制)兩份,用同一段音訊比較。
如果你要的是印刷或演奏用譜,先注意版本差異:截至 2026 年 8 月 24 日,PyPI 最新仍是 0.3.0;該版本的官方 CLI 原始碼只列 MIDI/JSON/JSONL 輸出。目前 GitHub main文件雖已加入下列 sheets 指令,但它尚未成為 PyPI 正式版;只有明確釘選並驗證含 sheets 的開發版、另裝 MuseScore 4 以上,而且輸出目錄不存在或為空時,才使用:
muscriptor transcribe input.wav --format sheets --output score/
因此使用 uvx muscriptor的 0.3.0 讀者,應先輸出 MIDI,再依MuseScore Studio 手冊匯入整理;官方線上介面則可依當下選項下載樂譜。開發版 sheets 路線會建立量化後 MIDI、MusicXML、總譜 PDF 與部分樂器分譜,但只有在你明確釘選並驗證相應程式版本(commit)時才能依賴。官方也提醒穩定速度的錄音較適合格線量化,rubato(自由速度)會顯著變差。若素材有自由速度,先輸出原始 MIDI 到 DAW 校正 tempo map(速度隨時間變化的對照),再決定是否匯成樂譜,通常比直接硬壓成整齊拍點安全。
第五步:匯入 DAW,照「結構→分軌→音高→時值→力度」清理
在 Ableton Live、Logic Pro、Cubase、REAPER 或其他 DAW 建立新專案,把原始音訊放在第一軌,MuScriptor MIDI 從同一時間點匯入。以下順序刻意把高影響錯誤放前面;若小節線都在漂,先逐顆修音只會重做。
- 結構與 tempo:找第一個可靠 downbeat(每小節第一個重拍),對齊小節 1;到片段尾端再看一次是否漂移。固定速度素材可調 BPM;rubato 或逐段變速素材要做 tempo map,不要整段一次 quantize(把音符吸附到拍點)。
- 分軌:逐軌單獨播放(solo),依聽到的角色改名。錯誤而稀疏的假軌可刪除;同一角色被拆成兩軌可合併;真正不同的低音與和聲不要為了畫面整齊硬塞一起。
- 音高:先修主旋律與低音根音(bass root),再處理內聲部。優先刪除音域不合理、瞬間爆成密集音群或與原音完全無關的孤立音。
- 音符起點與長度:只選已確認的樂句做局部量化(quantize);先校起點,再修過短、過長與互相壓住的音符。保留人味時可降低量化強度(amount),不要把所有音硬吸到 100% 格線。
- 力度與表情控制:MuScriptor 不保留原錄音力度,重新用力度編輯器(velocity editor)做樂句弧線、重拍與層次;需要時另加控制器資料(CC)。這不是美容,而是讓 MIDI 從機械播放變成可編曲素材。
Ableton Live 12 MIDI 編輯手冊說明 quantize、note start/end 與 velocity 工具;MuseScore Studio 手冊則說明 MIDI/MusicXML 開啟方式。不同 DAW 選單名稱不一樣,但清理順序相同。

第六步:用固定片段 A/B,決定該手修、重跑還是放棄
建立 A/B 之前,先把原音與 MIDI 輸出成音訊(render),並對齊相同起點、相同片段範圍與近似聽感音量。A 是來源音訊,B 是目前 MIDI;第一輪看著 DAW 比對,第二輪把檔名隱藏或交給另一位合作者隨機播放,避免你因為知道哪個是「修過的」就自動替它找理由。
- 結構:開頭 downbeat 對齊,片段尾端沒有持續漂移,段落長度合理。
- 音高:主旋律、低音根音與必要和聲可辨認,沒有隨機密集音群。
- 分軌:每軌扮演一個可理解角色,沒有會誤導編曲者的假樂器。
- 節奏:音符起點、長度、鼓點與律動(groove)可用,沒有卡住不放的音符(stuck notes)或破壞樂句的重疊。
- 表情:力度與必要控制已重建,不把固定 velocity 當完成品。
- 交付:檔案能在目標 DAW/譜軟體開啟,速度/拍號(time signature)、軌名、版本與權利紀錄齊全。
接著用錯誤範圍決策。只有幾顆音錯,手修最快;整個樂器被誤判,拿明確樂器清單重跑;從頭到尾固定漂移,先做 tempo map;每軌都充滿錯音,改用更乾淨的 stem(獨立樂器音訊)、較簡單片段或人工重錄,別讓沉沒成本把「重抄」假裝成「AI 加速」。
要比較 small/medium/large,也只能在同一固定素材、同一清理規則下記錄「達到六項標準所需的人工分鐘數」。模型原始音符多不多不是最終判準;如果 medium 只錯少數音,而 large 省不了足夠人工時間,就沒有升級理由。
最常踩的 7 個坑
- 把第三方 10 秒限制套到官方 demo:先確認服務網址與版本;Show HN 的 Pianoify 不是 MuScriptor 官方站。
- 把 MIT repo 當成權重可商用:程式與模型是兩份授權,輸入歌曲還有另一條權利鏈。
- 一開始就用整首密集混音:你會無法判斷錯在音訊、拍點、樂器還是模型。先用固定短片段分類錯誤。
- 看到 MIDI 就全選 100% 量化:自由速度與律動會被壓扁,錯誤拍點還可能整齊地錯下去。
- 把軌道名稱當真相:逐軌單獨播放聽角色;模型標籤是猜測,不是音訊分軌(stem separation)。
- 忽略 velocity:目前轉錄沒有保留原始力度,直接交付往往會像機械琴。
- 只挑最成功的樣本:保留單鋼琴、較乾淨樂團與密集混音三組,才能知道工具在哪些素材上值得用。
FAQ:MuScriptor 音訊轉 MIDI 新手最常問的 8 題
1. MuScriptor 可以把任何歌曲一鍵變成正確鋼琴譜嗎?
不行。它是多樂器粗轉錄工具,不是保證正確的編曲師。乾淨、節拍穩定且音色清楚的素材通常較容易整理;密集混音、rubato、罕見音色與強烈效果需要更多人工判讀。
2. 官方 demo 有 10 秒限制嗎?
截至 2026 年 8 月 24 日,10 秒說法只出現在第三方 Pianoify 的 Show HN 討論,不能當成 MuScriptor 官方站規格。需要固定模型與輸入條件時,改用本機版。
3. 沒有 NVIDIA GPU 能不能用?
可以先試 small;Apple Silicon 會自動使用 MPS。官方將 small 定位為 CPU-only 的實用選項,medium 是預設折衷,large 更需要 GPU。實際速度仍取決於硬體、音訊長度與軟體版本。
4. 模型會自動把每種樂器分成獨立 stem 嗎?
不會產生乾淨的音訊 stem。它會把辨認到的音符依樂器程式寫進 MIDI 軌道,但軌名與事件都可能誤判。若要音訊分離,那是另一種 source separation 任務。
5. 為什麼匯出的 MIDI 聽起來沒有原曲表情?
因為模型目前沒有保留原始力度,音色也由你的播放器或虛擬樂器(virtual instrument)決定。在 DAW 重建力度、奏法(articulation)、踏板(pedal)/控制器資料(CC)與音色,是必要的編曲步驟。
6. 應該直接輸出 sheets,還是先輸出 MIDI?
PyPI 0.3.0 一律先輸出 MIDI。只有已釘選並驗證含 sheets 的 main開發版、安裝 MuseScore 4 以上,而且素材節拍穩定時才試 sheets;rubato、混音或要進 DAW 則先用 MIDI。原始 MIDI 讓你先處理 tempo map 與錯音,再匯成 MusicXML/樂譜,較不容易讓錯誤量化定型。
7. 用 MuScriptor 轉出的 MIDI 可以商用嗎?
不能只看輸出格式就回答可以。權重是 CC BY-NC 4.0,且你還要確認錄音、詞曲、表演、編曲與散布權。商業或客戶交付前,應取得適用授權或另選可支援該用途的方案。
8. 怎樣才算清理完成?
六項驗收同時通過:結構不漂、主要音高正確、分軌可理解、節奏與重疊可用、力度已重建、目標軟體可開且版本/權利紀錄完整。只要下游仍需要猜你的意圖,就還沒完成。
給新手的 6 個重點
- 先拿有權處理的固定短片段試官方 demo,別從整首歌開始。
- repo 是 MIT、權重是 CC BY-NC 4.0;技術可行與商用可行要分開查。
- medium 是官方預設基準,small 適合 CPU,large 要有可衡量的人工節省才值得。
- 先對齊 tempo/downbeat,再處理分軌、音高、時值與力度。
- 已知編制可用
--instruments重跑;未知素材不要用限制逼模型猜錯答案。 - 用固定片段、同一標準記錄人工修正時間;可編輯不等於可交付。
AI 音樂工具真正有用的地方,是把不可編輯的聲音變成可討論的草稿,而不是替創作者取消判斷。若你想延伸這個觀念,可讀AI 創作怎麼保留主體感;若想理解模型為什麼在常見音色表現較好、在罕見分布較不穩,可接著看AI 模型怎麼學習。
接著閱讀
左右滑動查看更多推薦
結語:完成不是拿到 .mid,而是下游不必猜
回到開頭的公式:可交付 MIDI = AI 粗轉錄+節拍校正+樂器分軌+人工驗收。MuScriptor 音訊轉 MIDI 把最費力的第一版事件拉出來,但 tempo、軌道角色、錯音、重疊、velocity 與權利邊界仍由你負責。今天先建立三段固定素材,用 medium 跑出第一版;如果主要結構存在,就依六項清單清理。若錯誤密到等同重抄,保留結果當失敗樣本,換 stem、換片段或回到人工製作,這也是合格的判斷。
想把創作工具、模型判讀與工作流設計一次補齊,可以從 AlphaLab 的AI 實戰課程開始;也歡迎到AI 專區繼續探索音樂生成、本機模型與創作方法。





