【2026 最新】Claude Code AI 影片工作室:6 階段打造可重跑的生成流程(Higgsfield+Seedance 2.0)

最後更新: ·
Claude Code AI 影片工作室教學:Higgsfield、Seedance 2.0 與六階段生成流程

你已經會用 AI 生成一段漂亮畫面,接著很快會撞上真正的難題:十幾個鏡頭要怎麼維持同一種風格?失敗版本由誰重試?哪些片段該留下?最後又怎麼剪成一支能交付的影片?Claude Code AI 影片工作室要解的,正是把這些零散動作變成一條可重跑、可驗收的創作流程。

這篇專為第一次把 AI Agent 用在影片製作的創作者寫。你不必先成為工程師;我會用最白話的方式,帶你完成安裝、風格契約、三鏡頭試拍、人工選片與 FFmpeg 組片,並說清楚哪些工作能交給 Agent,哪些決定仍要留在人手上。

先說結論:Claude Code AI 影片工作室不是全自動導演

先記住這句公式:AI 影片工作室 = 人的品味 + Agent 的重複能力。人負責決定故事、風格、哪個鏡頭值得留下;Agent 負責讀取拍攝清單、呼叫模型、輪詢工作、整理版本與執行可重複的剪輯命令。

換句話說,Claude Code 不是突然變成會審美的導演,而是成為一位不怕重複工作的製片助理。真正的升級不是「一句 prompt 直接成片」,而是把每次生成都放進有輸入、有輸出、有人工批准點的迴圈。

Claude Code AI 影片工作室三層架構:人的品味、Agent 迴圈與生成剪輯工具
三層分工:人決定要留下什麼,Agent 把重複工作跑完,模型與 FFmpeg 負責真正產出檔案。

Claude Code AI 影片工作室是什麼?先看懂四個零件

  • Skills=「工作手冊」。把模型使用方式、提示詞規則與交付檢查寫成可重用的 SKILL.md
  • Subagents=「分組助理」。把彼此獨立的鏡頭族群交給不同 worker,讓研究、提示詞與狀態整理可以平行進行。Claude Code 的官方 subagents 文件也把平行研究與高輸出工作列為典型用途。
  • Bash=「真正動手的手」。Claude Code 透過本機終端機呼叫 Higgsfield CLI 與 FFmpeg;前提是工具已安裝、登入,而且權限已明確設定。
  • Manifest 與 log=「場記板」。每個鏡頭的起始幀、動作、秒數、狀態、job id 與入選檔案都寫進文字檔,下一次才能精準重跑。

這裡有一個很重要的校正:一般具名、非 fork 的自訂 subagent 會載入主 session 可見的 CLAUDE.md 階層,但不會自動拿到父對話、父 session 已讀過的檔案或父 session 已呼叫的 skill。若要保證每位 worker 一啟動就有同一套影片 skill,請在 agent 定義的 skills: 欄位明確預載。這與「所有東西自動繼承」差很多。

先選入口:Supercomputer 還是 Claude Code+CLI?

想先用聊天介面做片:Higgsfield Supercomputer 會把自然語言需求拆成計畫、選擇模型,並在渲染前顯示 credit 成本等你批准。官方目前也標示一個不耗 credits 的 LLM Free Mode;Free Mode 以外的文字請求仍可能依 prompt 複雜度與所選 LLM 扣 credits,圖片與影片生成則另行計費。適合不想先碰終端機、希望快速看懂整條流程的人。功能與計費方式可直接看官方 Supercomputer 頁面

想掌控每個檔案與每次重試:使用 Claude Code+Higgsfield CLI。你的專案資料夾就是片場,CLAUDE.md 寫工作規則,CSV/Markdown 寫 shot manifest,CLI 提交生成工作,FFmpeg 負責組片。本文接下來走這條路,因為它最能教會你可攜、可替換模型的製作方法。

Claude Code AI 影片工作室怎麼安裝?先跑這 5 行

先確認本機已有 Node.js、Claude Code 與 FFmpeg,再依 Higgsfield 官方 CLI官方 Skills 安裝指南執行:

npm i -g @higgsfield/cli
higgsfield auth login
npx skills add higgsfield-ai/skills
higgsfield model list --video --json
higgsfield model get seedance_2_0 --json

最後兩行不是裝飾。模型名稱、解析度、秒數與可接受的參考素材會變動;model list 告訴你現在真的能呼叫什麼,model get 則回傳該模型當下的參數 schema。不要拿另一個模型的 flags 硬套過來。

截至 2026 年 7 月 29 日,Higgsfield 的官方 schema 把 seedance_2_0 列為可用 job type,支援 --start-image--end-image、480p/720p/1080p/4K,以及 stdfast 模式;fast 只支援 480p/720p。Higgsfield 對 --duration 只標示整數、預設 5,因此執行前仍要讀 live schema;BytePlus 的現行 Seedance 2.0 模型文件則把影片長度定在 4~15 秒。ByteDance 在 Seedance 2.0 官方發布中也確認文字、圖片、影片與音訊參考,以及最長 15 秒多鏡頭音畫生成。下面的第一支作品只用 5 秒、1080p,先把變因降到最低。

先搭片場:資料夾、CLAUDE.md 與 Shot Manifest

在終端機建立一個乾淨專案:

mkdir -p ai-video-studio/{frames,clips,normalized,selects,logs}
cd ai-video-studio
touch brief.md style-contract.md shots.csv CLAUDE.md

CLAUDE.md 適合保存長期規則,但它是給模型看的指示,不是信用卡鎖或硬性併發限制。依照 Claude Code 的專案記憶文件,把穩定、反覆會用到的規則放在這裡;真正的工作數上限要由 queue、腳本或供應商端限制執行。

# AI Video Studio Rules
- 先讀 brief.md、style-contract.md、shots.csv。
- 未取得人工批准,不提交會消耗 credits 的生成工作。
- 第一輪每個 shot 最多 2 個候選。
- 每次重試只改一類變因:動作、運鏡、光線三選一。
- 執行前先讀 live model schema;不要猜 model id 或 flags。
- 每個 job 把 id、prompt、model、status、output 與 keep/reject 寫入 logs/jobs.jsonl。
- Subagent 必須使用專案相對路徑,完成後只回報摘要與檔案位置。

shots.csv 則是場記板。新手第一輪只做三個鏡頭:

shot_id,status,start_frame,motion_prompt,duration_seconds,resolution,selected_file
001,planned,frames/001.png,"低角度跟拍紙船進入積水,水面微波,暖光反射",5,1080p,
002,planned,frames/002.png,"側向平移,紙船穿過霓虹倒影,一道水花掠過船尾",5,1080p,
003,planned,frames/003.png,"緩慢抬升,紙船停在晨光邊緣,雨勢逐漸變小",5,1080p,

六階段實作:從一句故事到 15 秒 AI 短片

Claude Code AI 影片工作室六階段流程:brief、風格契約、靜幀、shot manifest、生成迴圈與文字化剪輯
六階段把「想法」拆成可批准的中間產物;任何一關出錯,都能回到那一關修正。

Stage 1:先寫 Brief,定義這支片不變的邊界

先別急著選模型。把題目寫成可驗收的任務:15 秒、9:16、三個鏡頭、主角是一艘紙船、雨夜走到晨光、沒有對白、配樂最後再加。再補上受眾、平台、交付檔名與候選上限。這些條件比「幫我做得電影感」更能讓 Agent 做對下一步。

Stage 2:把參考畫面蒸餾成「風格契約」

風格契約不是貼一位導演的名字,而是把可觀察元素寫出來:低機位、35mm 顆粒、雨後柏油反光、冷藍環境光、暖色窗光、淺景深、黑位微抬、動作克制。把同一段文字放進每個靜幀與影片 prompt,整組鏡頭才會朝同一個方向收斂。

參考圖只用你有權使用的素材,並把「角色身份、構圖、動作」分成三類控制。Seedance 官方也明說多主體一致性、文字渲染、複雜編輯與細節穩定仍有改善空間,音訊也可能偶發失真;所以一致性不是開關,而是逐步鎖住變因

Stage 3:先挑起始靜幀,再讓畫面動起來

Frame-first 是控制策略,不是鐵律。這次先生成三張起始幀,確認紙船外觀、雨夜色盤與構圖後才進影片;若你只是在發想,也可以先用 text-to-video 探方向。重點是不要同時更換人物、光線、鏡頭與動作,否則你不知道哪個改動真正有效。

Stage 4:每個鏡頭只給一個主要任務

圖片已經定義「看起來是什麼」,影片 prompt 主要描述「接下來發生什麼」。一個好用模板是:運鏡+主體動作+場內事件+速度/節奏。例如:低角度緩慢跟拍。紙船向前漂入積水中央;右側落下一滴大雨,波紋推動船身輕微轉向。動作連續、節奏克制。

Stage 5:先估 credits,再提交有界生成迴圈

第一個鏡頭先跑成本估算,不送出 job:

higgsfield generate cost seedance_2_0 \
  --prompt "low-angle slow tracking shot; the paper boat drifts into the puddle as one heavy raindrop creates a ripple that turns it slightly" \
  --start-image ./frames/001.png \
  --duration 5 \
  --resolution 1080p

人確認成本後,再把 cost 換成 create

higgsfield generate create seedance_2_0 \
  --prompt "low-angle slow tracking shot; the paper boat drifts into the puddle as one heavy raindrop creates a ripple that turns it slightly" \
  --start-image ./frames/001.png \
  --duration 5 \
  --resolution 1080p \
  --json

把回傳的 job id 寫進 logs/jobs.jsonl,再用 higgsfield generate get <job_id> --json 查狀態。手動測一個 job 時可加 --wait;批次流程則應分開 submit 與 poll,避免把整個 Agent 卡在一次長時間 Bash 呼叫。每輪最多兩個候選,人工標記 keep/reject 後才進下一鏡。

要增加 background subagents,先確保鏡頭互不依賴,並用確定性的 queue 控制同時提交數。不要只在 CLAUDE.md 寫「記得限流」;那是指示,不是 semaphore。實際可跑多少工作,仍由帳戶方案、供應商狀態與當下回應決定。

Stage 6:正規化、寫清單,用 FFmpeg 重建剪輯

FFmpeg 的 concat demuxer 讀的是檔案清單,不認得 shot manifest 裡的 keep/mute 狀態。先把入選片段統一成相同解析度、fps、像素格式與音訊 stream。下面以 720×1280、24fps、靜音底軌的 proof of concept 為例:

ffmpeg -i selects/001.mp4 \
  -f lavfi -i anullsrc=channel_layout=stereo:sample_rate=48000 \
  -t 5 -map 0:v:0 -map 1:a:0 \
  -vf "scale=720:1280:force_original_aspect_ratio=decrease,pad=720:1280:(ow-iw)/2:(oh-ih)/2,fps=24,format=yuv420p" \
  -c:v libx264 -crf 18 -preset medium \
  -c:a aac -b:a 192k -shortest normalized/001.mp4

三段都正規化後建立 clips.ffconcat

ffconcat version 1.0
file 'normalized/001.mp4'
file 'normalized/002.mp4'
file 'normalized/003.mp4'
ffmpeg -f concat -safe 0 -i clips.ffconcat \
  -c copy picture-lock.mp4

ffmpeg -i picture-lock.mp4 -stream_loop -1 -i score.wav \
  -map 0:v:0 -map 1:a:0 \
  -c:v copy -c:a aac -b:a 192k \
  -shortest -movflags +faststart master.mp4

這份文字清單讓同一版剪輯可重建。若要保留部分環境音,再用 FFmpeg 的 amix 官方濾鏡混入配樂;若片段規格不同,先正規化再 concat。完整語法可對照 FFmpeg concat 官方文件

6 個最容易讓 AI 片場失控的坑

  1. 一開始就做長片。先完成三鏡頭、15 秒 proof of concept,才能看懂風格、生成與剪輯哪一層出問題。
  2. 把「電影感」當完整規格。改寫成鏡頭、光線、色盤、材質、景深與節奏,模型才有可執行資訊。
  3. 每次重試改五件事。一次只改動作、運鏡或光線其中一類,log 才能告訴你哪個變因有效。
  4. 假設模型名稱與 flags 永遠不變。每次開案先跑 model listmodel get,再讓 Agent 建指令。
  5. 把 CLAUDE.md 當硬性限流器。把候選上限寫進規則是好事;信用額度與併發仍要由 cost check、queue 和人工批准真正控制。
  6. 以為關掉 session 仍會自動跑完。Claude Code 的 /loop 需要 session 保持開啟;要做可離線、可恢復的長時間流程,改用 Routines、Desktop 排程或 CI。官方行為可查排程與 /loop 文件

Claude Code AI 影片工作室常見問題

沒有程式背景,也能開始嗎?

可以。你主要用自然語言寫 brief 與審片;第一次仍要照著終端機指令安裝 CLI、登入並確認 FFmpeg。把第一個目標縮到三鏡頭,學習曲線會平很多。

一定要用 Higgsfield 嗎?

不一定。本文用 Higgsfield 示範,是因為官方 CLI 把多種圖片、影片與音訊 job 放在同一命令面;核心方法其實是 brief、風格契約、shot manifest、人工批准、log 與文字化剪輯,能移植到其他有穩定 API/CLI 的工具。

Supercomputer 和 CLI 可以一起用嗎?

可以。你可以先在 Supercomputer 用聊天介面探索製作計畫,再把需要精準檔案命名、批次狀態與可重跑剪輯的部分移到 Claude Code+CLI。兩者的價值分別是低門檻與高控制。

Seedance 2.0 一定要先放起始圖嗎?

不用。它支援 text-to-video;本文使用起始圖,是為了先鎖住紙船、構圖與色盤,再把 prompt 集中在動作與運鏡。發想階段可以先從文字生成,進入定稿再改成 reference-driven 流程。

可以把 15 秒直接生成成一個多鏡頭影片嗎?

可以嘗試。Seedance 2.0 官方支援最長 15 秒多鏡頭輸出;但若你要逐鏡批准、替換其中一段或明確記錄失敗原因,拆成三個 5 秒 shot 更容易管理。

Subagent 越多,影片就做得越快嗎?

不一定。只有互不依賴的工作才適合平行,例如不同鏡頭的提示詞草稿或狀態整理。影片供應商的併發、Claude Code 用量、權限與人工審片都可能成為瓶頸;先把單 job 流程跑穩,再增加 worker。

為什麼要存 JSONL log?

因為記憶不能靠感覺。把 prompt、模型、job id、結果檔、keep/reject 與修改變因寫成一行一筆,下一次開案時可要求 Claude 先讀取並彙整;沒有 log,就只剩「好像上一版比較好」。

最後一定要輸出 4K 嗎?

不用。解析度應由交付平台與素材品質決定。第一輪 proof of concept 用 720p 或 1080p 已足以判斷動作與節奏;若最終交付真的需要 4K,再依 live schema、編碼相容性與成本選擇原生生成或後段放大。

給 AI 創作者的 7 個重點

  • AI 影片工作室的核心不是模型數量,而是「人審美、Agent 跑迴圈」的清楚分工。
  • Skills 教流程,subagents 做平行分工,Bash 呼叫工具,manifest 與 log 保存狀態。
  • 先做三鏡頭、15 秒小片,確認整條 pipeline 再放大。
  • 風格契約要寫可觀察元素,不要只丟一個模糊形容詞。
  • 先查 live schema、先估 credits、人工批准後才提交付費生成。
  • CLAUDE.md 是指示層;queue、權限與供應商限制才是執行層。
  • FFmpeg 把入選片段正規化並用文字清單組片,版本才真的可重建。

📚 延伸閱讀

結語:今天先拍三個鏡頭,不要先蓋一間無人片廠

回到最值得記住的公式:AI 影片工作室 = 人的品味 + Agent 的重複能力。現在就建立資料夾,寫下 15 秒 brief 與三列 shots.csv,先跑一個 5 秒鏡頭的 cost estimate;當你能清楚說出為什麼保留 A、淘汰 B,Claude Code 才真正從聊天工具變成你的創作系統。

ALPHALAB 社群

有問題?來 Telegram 聊

和 Terry、編輯、其他網友一起討論這篇文章。提問、分享觀點,回覆更即時。

加入 Telegram 討論

📩 訂閱 AlphaLab 電子報

每週一封,第一時間收到新文章與投資觀察。

我們不會 spam,隨時可退訂。