你已經會用 AI 生成一段漂亮畫面,接著很快會撞上真正的難題:十幾個鏡頭要怎麼維持同一種風格?失敗版本由誰重試?哪些片段該留下?最後又怎麼剪成一支能交付的影片?Claude Code AI 影片工作室要解的,正是把這些零散動作變成一條可重跑、可驗收的創作流程。
這篇專為第一次把 AI Agent 用在影片製作的創作者寫。你不必先成為工程師;我會用最白話的方式,帶你完成安裝、風格契約、三鏡頭試拍、人工選片與 FFmpeg 組片,並說清楚哪些工作能交給 Agent,哪些決定仍要留在人手上。
先說結論:Claude Code AI 影片工作室不是全自動導演
先記住這句公式:AI 影片工作室 = 人的品味 + Agent 的重複能力。人負責決定故事、風格、哪個鏡頭值得留下;Agent 負責讀取拍攝清單、呼叫模型、輪詢工作、整理版本與執行可重複的剪輯命令。
換句話說,Claude Code 不是突然變成會審美的導演,而是成為一位不怕重複工作的製片助理。真正的升級不是「一句 prompt 直接成片」,而是把每次生成都放進有輸入、有輸出、有人工批准點的迴圈。

Claude Code AI 影片工作室是什麼?先看懂四個零件
- Skills=「工作手冊」。把模型使用方式、提示詞規則與交付檢查寫成可重用的
SKILL.md。 - Subagents=「分組助理」。把彼此獨立的鏡頭族群交給不同 worker,讓研究、提示詞與狀態整理可以平行進行。Claude Code 的官方 subagents 文件也把平行研究與高輸出工作列為典型用途。
- Bash=「真正動手的手」。Claude Code 透過本機終端機呼叫 Higgsfield CLI 與 FFmpeg;前提是工具已安裝、登入,而且權限已明確設定。
- Manifest 與 log=「場記板」。每個鏡頭的起始幀、動作、秒數、狀態、job id 與入選檔案都寫進文字檔,下一次才能精準重跑。
這裡有一個很重要的校正:一般具名、非 fork 的自訂 subagent 會載入主 session 可見的 CLAUDE.md 階層,但不會自動拿到父對話、父 session 已讀過的檔案或父 session 已呼叫的 skill。若要保證每位 worker 一啟動就有同一套影片 skill,請在 agent 定義的 skills: 欄位明確預載。這與「所有東西自動繼承」差很多。
先選入口:Supercomputer 還是 Claude Code+CLI?
想先用聊天介面做片:Higgsfield Supercomputer 會把自然語言需求拆成計畫、選擇模型,並在渲染前顯示 credit 成本等你批准。官方目前也標示一個不耗 credits 的 LLM Free Mode;Free Mode 以外的文字請求仍可能依 prompt 複雜度與所選 LLM 扣 credits,圖片與影片生成則另行計費。適合不想先碰終端機、希望快速看懂整條流程的人。功能與計費方式可直接看官方 Supercomputer 頁面。
想掌控每個檔案與每次重試:使用 Claude Code+Higgsfield CLI。你的專案資料夾就是片場,CLAUDE.md 寫工作規則,CSV/Markdown 寫 shot manifest,CLI 提交生成工作,FFmpeg 負責組片。本文接下來走這條路,因為它最能教會你可攜、可替換模型的製作方法。
Claude Code AI 影片工作室怎麼安裝?先跑這 5 行
先確認本機已有 Node.js、Claude Code 與 FFmpeg,再依 Higgsfield 官方 CLI和官方 Skills 安裝指南執行:
npm i -g @higgsfield/cli higgsfield auth login npx skills add higgsfield-ai/skills higgsfield model list --video --json higgsfield model get seedance_2_0 --json
最後兩行不是裝飾。模型名稱、解析度、秒數與可接受的參考素材會變動;model list 告訴你現在真的能呼叫什麼,model get 則回傳該模型當下的參數 schema。不要拿另一個模型的 flags 硬套過來。
截至 2026 年 7 月 29 日,Higgsfield 的官方 schema 把 seedance_2_0 列為可用 job type,支援 --start-image、--end-image、480p/720p/1080p/4K,以及 std/fast 模式;fast 只支援 480p/720p。Higgsfield 對 --duration 只標示整數、預設 5,因此執行前仍要讀 live schema;BytePlus 的現行 Seedance 2.0 模型文件則把影片長度定在 4~15 秒。ByteDance 在 Seedance 2.0 官方發布中也確認文字、圖片、影片與音訊參考,以及最長 15 秒多鏡頭音畫生成。下面的第一支作品只用 5 秒、1080p,先把變因降到最低。
先搭片場:資料夾、CLAUDE.md 與 Shot Manifest
在終端機建立一個乾淨專案:
mkdir -p ai-video-studio/{frames,clips,normalized,selects,logs}
cd ai-video-studio
touch brief.md style-contract.md shots.csv CLAUDE.md
CLAUDE.md 適合保存長期規則,但它是給模型看的指示,不是信用卡鎖或硬性併發限制。依照 Claude Code 的專案記憶文件,把穩定、反覆會用到的規則放在這裡;真正的工作數上限要由 queue、腳本或供應商端限制執行。
# AI Video Studio Rules - 先讀 brief.md、style-contract.md、shots.csv。 - 未取得人工批准,不提交會消耗 credits 的生成工作。 - 第一輪每個 shot 最多 2 個候選。 - 每次重試只改一類變因:動作、運鏡、光線三選一。 - 執行前先讀 live model schema;不要猜 model id 或 flags。 - 每個 job 把 id、prompt、model、status、output 與 keep/reject 寫入 logs/jobs.jsonl。 - Subagent 必須使用專案相對路徑,完成後只回報摘要與檔案位置。
shots.csv 則是場記板。新手第一輪只做三個鏡頭:
shot_id,status,start_frame,motion_prompt,duration_seconds,resolution,selected_file 001,planned,frames/001.png,"低角度跟拍紙船進入積水,水面微波,暖光反射",5,1080p, 002,planned,frames/002.png,"側向平移,紙船穿過霓虹倒影,一道水花掠過船尾",5,1080p, 003,planned,frames/003.png,"緩慢抬升,紙船停在晨光邊緣,雨勢逐漸變小",5,1080p,
六階段實作:從一句故事到 15 秒 AI 短片

Stage 1:先寫 Brief,定義這支片不變的邊界
先別急著選模型。把題目寫成可驗收的任務:15 秒、9:16、三個鏡頭、主角是一艘紙船、雨夜走到晨光、沒有對白、配樂最後再加。再補上受眾、平台、交付檔名與候選上限。這些條件比「幫我做得電影感」更能讓 Agent 做對下一步。
Stage 2:把參考畫面蒸餾成「風格契約」
風格契約不是貼一位導演的名字,而是把可觀察元素寫出來:低機位、35mm 顆粒、雨後柏油反光、冷藍環境光、暖色窗光、淺景深、黑位微抬、動作克制。把同一段文字放進每個靜幀與影片 prompt,整組鏡頭才會朝同一個方向收斂。
參考圖只用你有權使用的素材,並把「角色身份、構圖、動作」分成三類控制。Seedance 官方也明說多主體一致性、文字渲染、複雜編輯與細節穩定仍有改善空間,音訊也可能偶發失真;所以一致性不是開關,而是逐步鎖住變因。
Stage 3:先挑起始靜幀,再讓畫面動起來
Frame-first 是控制策略,不是鐵律。這次先生成三張起始幀,確認紙船外觀、雨夜色盤與構圖後才進影片;若你只是在發想,也可以先用 text-to-video 探方向。重點是不要同時更換人物、光線、鏡頭與動作,否則你不知道哪個改動真正有效。
Stage 4:每個鏡頭只給一個主要任務
圖片已經定義「看起來是什麼」,影片 prompt 主要描述「接下來發生什麼」。一個好用模板是:運鏡+主體動作+場內事件+速度/節奏。例如:低角度緩慢跟拍。紙船向前漂入積水中央;右側落下一滴大雨,波紋推動船身輕微轉向。動作連續、節奏克制。
Stage 5:先估 credits,再提交有界生成迴圈
第一個鏡頭先跑成本估算,不送出 job:
higgsfield generate cost seedance_2_0 \ --prompt "low-angle slow tracking shot; the paper boat drifts into the puddle as one heavy raindrop creates a ripple that turns it slightly" \ --start-image ./frames/001.png \ --duration 5 \ --resolution 1080p
人確認成本後,再把 cost 換成 create:
higgsfield generate create seedance_2_0 \ --prompt "low-angle slow tracking shot; the paper boat drifts into the puddle as one heavy raindrop creates a ripple that turns it slightly" \ --start-image ./frames/001.png \ --duration 5 \ --resolution 1080p \ --json
把回傳的 job id 寫進 logs/jobs.jsonl,再用 higgsfield generate get <job_id> --json 查狀態。手動測一個 job 時可加 --wait;批次流程則應分開 submit 與 poll,避免把整個 Agent 卡在一次長時間 Bash 呼叫。每輪最多兩個候選,人工標記 keep/reject 後才進下一鏡。
要增加 background subagents,先確保鏡頭互不依賴,並用確定性的 queue 控制同時提交數。不要只在 CLAUDE.md 寫「記得限流」;那是指示,不是 semaphore。實際可跑多少工作,仍由帳戶方案、供應商狀態與當下回應決定。
Stage 6:正規化、寫清單,用 FFmpeg 重建剪輯
FFmpeg 的 concat demuxer 讀的是檔案清單,不認得 shot manifest 裡的 keep/mute 狀態。先把入選片段統一成相同解析度、fps、像素格式與音訊 stream。下面以 720×1280、24fps、靜音底軌的 proof of concept 為例:
ffmpeg -i selects/001.mp4 \ -f lavfi -i anullsrc=channel_layout=stereo:sample_rate=48000 \ -t 5 -map 0:v:0 -map 1:a:0 \ -vf "scale=720:1280:force_original_aspect_ratio=decrease,pad=720:1280:(ow-iw)/2:(oh-ih)/2,fps=24,format=yuv420p" \ -c:v libx264 -crf 18 -preset medium \ -c:a aac -b:a 192k -shortest normalized/001.mp4
三段都正規化後建立 clips.ffconcat:
ffconcat version 1.0 file 'normalized/001.mp4' file 'normalized/002.mp4' file 'normalized/003.mp4'
ffmpeg -f concat -safe 0 -i clips.ffconcat \ -c copy picture-lock.mp4 ffmpeg -i picture-lock.mp4 -stream_loop -1 -i score.wav \ -map 0:v:0 -map 1:a:0 \ -c:v copy -c:a aac -b:a 192k \ -shortest -movflags +faststart master.mp4
這份文字清單讓同一版剪輯可重建。若要保留部分環境音,再用 FFmpeg 的 amix 官方濾鏡混入配樂;若片段規格不同,先正規化再 concat。完整語法可對照 FFmpeg concat 官方文件。
6 個最容易讓 AI 片場失控的坑
- 一開始就做長片。先完成三鏡頭、15 秒 proof of concept,才能看懂風格、生成與剪輯哪一層出問題。
- 把「電影感」當完整規格。改寫成鏡頭、光線、色盤、材質、景深與節奏,模型才有可執行資訊。
- 每次重試改五件事。一次只改動作、運鏡或光線其中一類,log 才能告訴你哪個變因有效。
- 假設模型名稱與 flags 永遠不變。每次開案先跑
model list與model get,再讓 Agent 建指令。 - 把 CLAUDE.md 當硬性限流器。把候選上限寫進規則是好事;信用額度與併發仍要由 cost check、queue 和人工批准真正控制。
- 以為關掉 session 仍會自動跑完。Claude Code 的
/loop需要 session 保持開啟;要做可離線、可恢復的長時間流程,改用 Routines、Desktop 排程或 CI。官方行為可查排程與/loop文件。
Claude Code AI 影片工作室常見問題
沒有程式背景,也能開始嗎?
可以。你主要用自然語言寫 brief 與審片;第一次仍要照著終端機指令安裝 CLI、登入並確認 FFmpeg。把第一個目標縮到三鏡頭,學習曲線會平很多。
一定要用 Higgsfield 嗎?
不一定。本文用 Higgsfield 示範,是因為官方 CLI 把多種圖片、影片與音訊 job 放在同一命令面;核心方法其實是 brief、風格契約、shot manifest、人工批准、log 與文字化剪輯,能移植到其他有穩定 API/CLI 的工具。
Supercomputer 和 CLI 可以一起用嗎?
可以。你可以先在 Supercomputer 用聊天介面探索製作計畫,再把需要精準檔案命名、批次狀態與可重跑剪輯的部分移到 Claude Code+CLI。兩者的價值分別是低門檻與高控制。
Seedance 2.0 一定要先放起始圖嗎?
不用。它支援 text-to-video;本文使用起始圖,是為了先鎖住紙船、構圖與色盤,再把 prompt 集中在動作與運鏡。發想階段可以先從文字生成,進入定稿再改成 reference-driven 流程。
可以把 15 秒直接生成成一個多鏡頭影片嗎?
可以嘗試。Seedance 2.0 官方支援最長 15 秒多鏡頭輸出;但若你要逐鏡批准、替換其中一段或明確記錄失敗原因,拆成三個 5 秒 shot 更容易管理。
Subagent 越多,影片就做得越快嗎?
不一定。只有互不依賴的工作才適合平行,例如不同鏡頭的提示詞草稿或狀態整理。影片供應商的併發、Claude Code 用量、權限與人工審片都可能成為瓶頸;先把單 job 流程跑穩,再增加 worker。
為什麼要存 JSONL log?
因為記憶不能靠感覺。把 prompt、模型、job id、結果檔、keep/reject 與修改變因寫成一行一筆,下一次開案時可要求 Claude 先讀取並彙整;沒有 log,就只剩「好像上一版比較好」。
最後一定要輸出 4K 嗎?
不用。解析度應由交付平台與素材品質決定。第一輪 proof of concept 用 720p 或 1080p 已足以判斷動作與節奏;若最終交付真的需要 4K,再依 live schema、編碼相容性與成本選擇原生生成或後段放大。
給 AI 創作者的 7 個重點
- AI 影片工作室的核心不是模型數量,而是「人審美、Agent 跑迴圈」的清楚分工。
- Skills 教流程,subagents 做平行分工,Bash 呼叫工具,manifest 與 log 保存狀態。
- 先做三鏡頭、15 秒小片,確認整條 pipeline 再放大。
- 風格契約要寫可觀察元素,不要只丟一個模糊形容詞。
- 先查 live schema、先估 credits、人工批准後才提交付費生成。
- CLAUDE.md 是指示層;queue、權限與供應商限制才是執行層。
- FFmpeg 把入選片段正規化並用文字清單組片,版本才真的可重建。
📚 延伸閱讀
- OpenMontage 教學:想看更完整、開源的 Agent 影片 pipeline,可從這篇延伸。
- Agent Harness 是什麼?:先理解模型之外的工具、狀態與控制層。
- 從零做一個 AI Agent Harness:把規劃、工具呼叫、停止條件與驗收串成可執行迴圈。
- Claude Code 動畫網站教學:用另一種創作專案練習參考、規格、產出與瀏覽器驗收。
- Taste Skill 教學:把模糊的「品味」翻成 Agent 能遵守的設計旋鈕。
- Claude Token 節省技巧:長流程與多 Agent 開始變貴時,先從上下文與任務切分下手。
- AI 創作者教學:探索更多用 AI 做網站、影像與內容系統的實作文章。
- AlphaLab 課程:想把零散技巧變成固定創作工作流,可從系統化課程開始。
結語:今天先拍三個鏡頭,不要先蓋一間無人片廠
回到最值得記住的公式:AI 影片工作室 = 人的品味 + Agent 的重複能力。現在就建立資料夾,寫下 15 秒 brief 與三列 shots.csv,先跑一個 5 秒鏡頭的 cost estimate;當你能清楚說出為什麼保留 A、淘汰 B,Claude Code 才真正從聊天工具變成你的創作系統。
