video-use 教學真正難的,不是叫 Claude Code 或 Codex 幫你下剪輯指令,而是把「看起來剪完」變成「可以交付」。這篇會帶你用一支約 3 分鐘的 talking-head 訪談,走完逐字稿、時間軸、EDL、渲染到繁中字幕與切點驗收;最後拿到的不是神奇按鈕,而是一條可重跑、可定位錯誤的品質鏈。
先說結論:Agent 剪片=文字決策+時間碼執行+邊界驗收
video-use 官方儲存庫的核心設計,是先把語音轉成帶時間碼的逐字稿,讓 Agent 依文字判斷內容;遇到需要看畫面的地方,再按需產生 timeline view。Agent 最後寫出 EDL(Edit Decision List,剪輯決定清單),渲染器才把那些時間區段變成 MP4。可以把它想成:逐字稿是劇本、EDL 是剪接單、ffmpeg 是執行剪刀。
- 適合:單人訪談、教學、產品解說,主要工作是刪贅詞、停頓與重複段落。
- 不該期待:自動理解每個品牌專名、保證每個切點無爆音,或不經人工觀看就直接交片。
- 完成標準:內容沒有刪錯、繁中字幕可讀、每個切點的人聲與畫面都通過 A/B。

video-use 教學第一步:先做三個前置閘門
1. 先確認你接受把音訊送到轉錄服務
目前專案流程會抽出 16 kHz 單聲道音訊,再送往 ElevenLabs Speech-to-Text;所以有保密義務的訪談,應先取得受訪者與資料擁有者同意。它不是把整支影像上傳給模型,但音訊本身仍可能包含姓名、客戶與未公開資訊。
2. 先修正目前主分支的轉錄模型名稱
截至 2026 年 9 月 23 日,video-use 主分支的 helpers/transcribe.py 仍指定 scribe_v1;但 ElevenLabs 已在 2026 年 6 月 8 日更新的退場公告確認 Scribe v1 會在 7 月 9 日移除,現行 Speech-to-Text API使用 scribe_v2。安裝後先把該檔案唯一的 model_id 改成 scribe_v2,再用 rg 'model_id' helpers/transcribe.py 確認。這不是效能調校,而是目前能否轉錄的相容性閘門。
3. 先確認 ffmpeg 真的有字幕濾鏡
不要只跑 ffmpeg -version。請跑 ffmpeg -hide_banner -filters | grep -E ' (subtitles|ass|drawtext) ';若沒有任何輸出,燒錄字幕會在渲染階段失敗。Homebrew 的 ffmpeg-full 官方 formula包含 libass,安裝命令是 brew install ffmpeg-full;它是 keg-only,執行專案前仍要確認終端實際叫到的 ffmpeg 路徑與濾鏡清單。
AlphaLab 在隔離的暫存專案跑過 16 個單元測試與 15 個子測試,全部通過;無字幕的合成片段也能渲染。加入繁中 SRT 後,這台機器的預設 Homebrew ffmpeg 因缺少 subtitles 濾鏡而停止。這個結果只證明前置檢查能提早抓到環境問題,不代表我們已完成付費轉錄或完整三分鐘訪談實測。
從零建立 3 分鐘訪談專案
先準備一支你有權處理的 MP4,最好是單人、收音清楚、畫面固定。新手不要一開始就用多機、背景音樂或多人搶話,否則你很難知道問題出在轉錄、內容決策還是混音。
- 複製專案:
git clone https://github.com/browser-use/video-use.git,進入資料夾後執行uv sync。 - 把 Skill 連到你使用的 Agent:先執行
mkdir -p ~/.claude/skills ~/.codex/skills;Claude Code 可用ln -s "$PWD" ~/.claude/skills/video-use,Codex 可用ln -s "$PWD" ~/.codex/skills/video-use。若目標已存在,先確認它指向哪裡,不要直接覆蓋。Skill 本質是帶有SKILL.md、腳本與參考資料的資料夾;可先讀 Claude Code Skills 文件或 Codex Skills 文件了解載入方式。 - 設定
ELEVENLABS_API_KEY,完成前述 Scribe v2 與字幕濾鏡檢查,再把素材放進獨立工作資料夾。 - 第一次提示只做「刪重複句、長停頓與明顯口誤」,不要同時要求 B-roll、背景音樂、直式改版與動態字幕。
一個可用的提示可以是:「請剪成 90–120 秒的繁中訪談精華。保留問題背景、核心方法與結論;刪除重複句與超過 1 秒的無語停頓。先提出 EDL 與刪除理由,不要直接渲染。每個切點避開詞中、吸氣與爆破音。」如果你還不熟 Agent 的工具迴圈,先讀 AI Agent Harness 是什麼;想比較兩個終端 Agent 的工作模式,可接著看 Claude Code vs Codex。
看懂 transcript → timeline → EDL → render → self-eval
逐字稿:低成本的內容索引
逐字稿不是最終字幕,而是讓 Agent 能搜尋「這句話在哪裡」的索引。先校正人名、產品名、英文縮寫與數字,再談剪輯;否則一個專名誤判,可能讓 Agent 把同一概念當成兩件事。ElevenLabs 的現行 Scribe v2 文件提供 word-level timestamps 與 speaker diarization,但供應商列出的中文整體表現不能替你的繁中口音、專名與錄音環境背書。
timeline view:需要時才看畫面
當文字無法回答「這裡是否有手勢、投影片是否切換、跳剪是否突兀」,才生成特定時間範圍的 timeline PNG。這比把每一幀都送進 Context 更像剪接師先看場記,再回看片段。若你想深入理解 Agent 為何需要外部工具與狀態,用 30 行偽代碼打造 Agent Harness會把這個迴圈拆得更細。
EDL:先審決定,再花時間渲染
EDL 的價值是把創意決定變成可檢查資料:每段保留區間都有 source_start、source_end 與理由。先檢查它是否刪掉問題、上下文或結論,再渲染;不要等成片完成才發現語意斷裂。最實用的規則是:每刪一段,都能用一句話回答「刪掉後,下一句的代名詞還指得到前文嗎?」
render 與 self-eval:第一層檢查,不是交付保證
渲染器會處理片段拼接、字幕、音量等工作;self-eval 再產生邊界附近的視覺或波形檢查。官方 README 將淡入淡出描述為降低爆音的機制,但 2026 年 7 月仍有使用者在 issue #162回報 AAC segment 邊界的 click,而且自動評估沒有抓到。這是公開問題回報,不是 AlphaLab 的重現結果;它提醒我們:波形看起來平順,不等於耳機聽起來無瑕疵。
繁中字幕 preset:字型、斷行、標點與安全區
繁中字幕的第一個坑不是翻譯,而是 glyph(字型裡實際存在的字形)。video-use 目前的字幕樣式硬編碼 Helvetica;issue #118指出非拉丁字可能變成方框。請先選一套確定包含繁中字形、且你有權嵌入成片的字型,再做 20 秒測片。
- 字型:先用
fc-match 'PingFang TC'或系統字型工具確認實際檔案;不要只相信字型名稱。 - 斷行:以語意片語為單位,一到兩行;避免把人名、數字單位或否定詞拆開。
- 標點:逐字稿可保留較完整標點,字幕則刪除不必要的逗號,但問號、否定與轉折要留下。
- 安全區:先以橫式 16:9 交付版為基準,字幕不要貼底;若還要裁直式,另建 preset,不要共用同一組座標。
- 抽樣:至少找一段中英混排、數字、專名與雙行字幕,先渲染再放大檢查。
把字型、字級、行數、底部距離與描邊寫進專案 README 或 preset 檔,每次重跑都引用同一組。這和 Claude 省 Token 的做法相同:把穩定規則留在可重用資產,不要每回合重新解釋。
video-use 教學核心:逐一驗收每個 cut boundary
真正的驗收單位不是「整支片」,而是每一條 cut boundary。對每個切點保留原片與成片前後各約 1.5 秒,先盲聽成片,再看畫面,最後回到原片 A/B。驗收表至少記錄:時間碼、問題、證據、修正方式、複驗結果。

A. 內容有沒有刪錯
先讀 EDL 理由,再聽成片。若一句話以「所以、但它、這件事」開頭,回查前一段是否仍保留必要指涉。內容錯切通常沒有技術錯誤訊息,卻最傷可信度。
B. 有沒有爆音、吞字或呼吸被截斷
戴耳機聽每個切點,特別注意 p、t、k 等爆破音、句首子音與吸氣。發現 click 時,不要只拉長 crossfade;先把切點移到自然停頓,仍有問題再比較音訊重編碼版本。任何「已修好」都要重新輸出該區段並複驗。
C. 畫面有沒有跳格或嘴型突變
固定鏡頭的 jump cut 不一定錯,但應該是有意識的風格。若嘴型、手勢或投影片在一幀內跳變,可把切點往停頓移、加入 B-roll,或承認這段不適合刪。不要為了秒數硬剪。
D. 字幕有沒有漏字、錯字或安全區問題
對照校正後逐字稿逐句播放,專名與數字要全文搜尋;再用實際交付尺寸看一遍,而不是只在編輯器大視窗看。方框字、兩行互撞與字幕貼底,都屬於阻擋交付的問題。
五個最常踩的坑,以及怎麼判定修好
- 把 README 當成環境保證:先跑模型名稱與 ffmpeg 濾鏡閘門;能產出帶繁中字的 20 秒測片才算通過。
- 逐字稿沒校正就剪:先建立專名詞表,全文搜尋同音誤字;每個專名在字幕與音訊一致才算通過。
- 一次要求太多創意:第一輪只處理內容 EDL,第二輪字幕,第三輪視覺裝飾;每輪都有可比較的輸出。
- 只看 self-eval:它能縮小檢查範圍,不能取代人耳。每個邊界都有人工 A/B 記錄才算完成。
- 修一處卻沒全片回歸:局部複驗後再從頭播放交付 MP4;首尾、音量、字幕與畫幅全部通過才出片。
如果你常在 Claude Code、Codex 與桌面工具之間切換,Claude、Claude Code、Cowork 差異可以幫你決定哪一層負責規劃、哪一層負責執行;但不論用哪個 Agent,驗收責任都不會自動消失。
常見問題 FAQ
video-use 可以完全離線嗎?
依目前主分支的預設流程,不是。語音轉錄會呼叫 ElevenLabs;若你要改成本機轉錄,需要自行替換該步驟並重新驗證時間碼與後續資料格式。
沒有 ElevenLabs key 還能先學嗎?
可以先學 EDL、渲染與驗收,但不能把它宣稱為完整工作流實測。最實際的做法是先用自製 transcript fixture 驗證渲染環境,再決定是否啟用付費轉錄。
為什麼繁中字會變成方框?
常見原因是指定字型沒有繁中 glyph,或 ffmpeg 找不到字型檔。用一段含罕見字、英文與數字的測片,搭配 fc-match 檢查,比只看設定名稱可靠。
self-eval 通過就可以交片嗎?
不可以直接等同。公開 issue 已有自動評估未抓到 click 的案例;出片前仍應逐切點戴耳機 A/B,並完整播放最終 MP4。
切點爆音一定要增加 fade 嗎?
不一定。先移到自然停頓、避免切在爆破音與吸氣中;若仍有編碼邊界問題,再比較重編碼與不同 fade 設定,並用同一副耳機盲聽。
可以直接剪一小時 Podcast 嗎?
技術上可逐步處理,但新手應先用三分鐘片段建立 preset 與驗收表。短片通過後再分章處理長內容,否則錯誤會在大量切點上一起放大。
Claude Code 和 Codex 哪個剪得比較好?
本文沒有足夠的同素材盲測證據支持排名。兩者都能載入 Skill 並呼叫腳本;成品差異更可能來自提示、逐字稿、EDL 審核與你的驗收標準。
最少要留下哪些交付紀錄?
至少保存素材版本、校正後逐字稿、EDL、字幕 preset、最終 MP4,以及每個有問題切點的時間碼、修正與複驗結果。這些資料讓你能重跑,也讓下一位編輯知道為什麼這樣剪。
給新手的 6 個重點
- 先把 video-use 視為「可程式化剪輯管線」,不是免審的 AI 剪輯師。
- 目前先把 Scribe v1 改成 Scribe v2,再測轉錄。
- 字幕渲染前,用命令確認 ffmpeg 有 subtitles/ass 濾鏡。
- 逐字稿先校正專名,EDL 先審語意,再花時間 render。
- 繁中 preset 先用 20 秒測片驗證字形、斷行與安全區。
- 每個 cut boundary 都做原片/成片 A/B,最後完整播放交付檔。
接著閱讀
左右滑動查看更多推薦
下一步:先交付 20 秒,再放大到 3 分鐘
今天不要先追求「全自動剪完」。先挑一段同時包含繁中、英文專名與一個跳剪的 20 秒素材,讓它通過模型、字型、字幕濾鏡與切點 A/B 四道閘門;接著再把同一套 preset 放大到三分鐘。你會得到的不只是一支 MP4,而是一條下次仍能相信的製作流程。想系統化建立更多 AI 工作流,可瀏覽 AlphaLab AI 專區與完整課程。






