跳到主要內容

Runway Solaris 深度解讀:介面不寫程式碼,畫面就是軟體?(2026)

最後更新: ·
Runway Solaris 官方介面視覺與畫面就是軟體的提問

2026 年 8 月 31 日,Runway 在官方研究頁發布〈Introducing Solaris〉,公開 Runway Solaris:一個不先產生傳統 HTML 或前端元件,而由世界模型隨互動逐幀合成畫面的研究預覽。這不是一般使用者已能直接購買的產品,而是一個正在邀請早期合作夥伴測試的新介面方向。

這篇文章先忠實拆解 Solaris 的運作方式,再核對 Runway 公布的兩組內部評測,最後回答真正重要的問題:如果畫面可以像世界一樣即時生成,軟體還需要程式碼、狀態與可測試的規則嗎?

Runway Introducing Solaris 官方研究頁的瀏覽器畫面
點圖開啟 Runway 的 Solaris 官方研究頁。圖/Runway

Solaris 真正改變的,是介面的執行方式

今天的生成式 UI,大多仍走「需求 → 程式碼 → 瀏覽器渲染」這條路。模型可以寫 React、HTML、CSS,也可以從截圖重建頁面;但最後執行的仍是預先定義的元件、事件與版面規則。Solaris 把最後一段換掉:使用者點擊、拖曳或輸入文字後,模型直接預測下一個畫面,連續產生出看似正在運作的介面。

“Every frame is synthesized as you interact”

中文:你每次互動時,每一幀都會被即時合成。

Runway,〈Introducing Solaris〉

這個差異不是「AI 寫程式碼更快」,而是畫面本身成為模型的輸出與執行表面。對虛擬試穿、可操控的教學場景、空間探索或有連續動畫的創作工具而言,開發者不用先替每一種視覺變化寫好狀態機;模型可以根據前一幀與操作歷史,生成下一個合理結果。這正是 Solaris 最有想像力的地方。

它如何運作:語言模型負責意圖,世界模型負責畫面

依 Runway 的描述,系統先以一張起始畫面建立介面。使用者的滑鼠、拖曳與文字輸入會成為條件;一個語言模型解讀要求、判斷場景應如何演進,再產生文字提示來引導 Solaris。世界模型則結合起始畫面、互動歷史與提示,自回歸地合成後續幀。Runway 表示它把 Gen-4.5 的能力調整到互動與即時生成,並以蒸餾方式把多步去噪壓縮到較快的模型。

“Because there’s no conversion step, there’s no loss”

中文:因為沒有轉換步驟,所以不會發生資訊損失。

Runway,〈Introducing Solaris〉

這句話很有力,但只能窄讀。Solaris 確實不必先把視覺設計翻成 DOM、元件樹或每個畫面的前端程式碼;然而整個系統仍有語言模型提示、起始幀、操作歷史與內部模型狀態。換句話說,它移除了傳統 UI 程式碼這一層表示,並沒有證明所有中介表示都已消失。

更精準的理解是:Runway Solaris 把介面的「視覺執行層」從確定性的程式,換成機率式的生成模型。資料庫、權限、交易、搜尋與工具呼叫仍可由可信後端處理;世界模型負責把結果變成能被看見與操控的動態場景。這種混合架構,比「像素全面取代程式碼」更接近可落地的產品。

Runway 的證據說了什麼,又沒說什麼?

截圖重建:畫面越自然,程式化重建越容易失真

第一組評測把畫面分成一般網頁、投影片、圖像設計與自然場景,再比較多個前沿模型從截圖產生程式化介面的結果。Runway 用 DINOv3、CLIP 與 SSIM 等視覺相似度指標主張:內容愈接近照片與自然場景,從單張截圖反推程式碼後的重建品質下降愈明顯。

Runway 公布的介面重建評測圖,依一般網頁、投影片、圖像設計與自然場景比較 DINOv3、CLIP 與 SSIM 相似度
Runway 公布的重建評測:三個視覺相似度指標都顯示,程式化重建在自然畫面上較弱。官方正文稱資料集共 30 個介面,圖表腳註卻寫每個內容區間、每個模型各 30 項,樣本口徑並不一致。圖/Runway

這組結果能支持一個較小的結論:讓模型從單張截圖反向工程資產與版面,確實會累積視覺誤差。但它還不能證明「程式碼天生無法保留畫面」。一個公平的程式化基準可以直接保留原始圖片,再用 DOM、Canvas、WebGL 或 scene graph 疊加互動;如果只評初始畫面的像素相似度,直接嵌入原圖甚至可以完全一致。

指標本身也有邊界。SSIM、DINOv3 與 CLIP 衡量的是畫面結構或特徵相似,不會告訴你按鈕能否完成任務、數字是否正確、焦點順序是否可用,或操作後的資料狀態是否一致。這比較像「看起來有多像」,不是完整的軟體品質測試。

人類偏好:方向值得注意,精確百分比不宜照單全收

第二組是 Runway 的內部偏好研究。公司自述有 250 名參與者、30 個互動案例,形成約 7,500 組比較,每組回答「是否遵循指令」與「行為是否自然」兩個問題。整體方向顯示,受試者約有六至七成更偏好 Solaris,而不是由 Claude Opus 5 產生的程式化版本。

Runway 內部人類偏好研究圖,比較 Solaris 與 Claude Opus 5 產生的程式化介面在指令遵循與自然行為上的偏好
Runway 內部偏好圖。官方正文與這張圖表對兩組精確比例各有 1 個百分點的出入,正文各組加總也只有 98%;本文因此只採用約略方向,不把精確百分比當成已獨立驗證的結果。圖/Runway

這裡有三個限制。第一,官方正文與圖表的精確比例互相矛盾。第二,在 2026 年 8 月 31 日的發布頁中,Runway 未交代受試者招募、盲測與隨機化方式、完整提示、逐題結果、信賴區間、基準程式碼或原始票數。第三,「更自然」是感知偏好,不等於文字、資料、權限與最終任務正確。這是一個值得追蹤的公司內部訊號,不是獨立研究已確認的產品勝負。

Solaris 不是憑空出現:世界模型正在走向可互動

把影像模型變成可操控環境,並不是 2026 年才出現的概念。Google DeepMind 在 2025 年公布的 Genie 3,已展示以文字提示生成 720p、24 fps、可持續數分鐘的互動世界。Runway 先以 GWM-1 探索通用世界模型,再把相同思路集中到介面:不只是生成一段影片,而是讓操作改變接下來的畫面。

另一條路線則保留可執行結構。2026 年的 gWorld 研究讓模型預測可執行網頁程式碼,再由瀏覽器渲染出畫面;作者把這種表示設計成同時保留精確文字、結構與可操作元件。兩條路線不是非黑即白:最可能先成熟的產品,會在「可驗證的結構」與「生成式視覺」之間動態分工。

像素不是狀態:真實軟體最難的五道邊界

同一張「付款成功」畫面,可能對應一筆已完成的交易,也可能只是模型生成了成功提示。畫面是應用狀態的一次投影,不是狀態本身。要把 Solaris 從精彩 demo 推進到可靠軟體,至少要跨過五道邊界:

  1. 正確文字:貨幣、日期、帳號、表格、游標、複製貼上與中日韓輸入,不能在幀與幀之間漂移。
  2. 可信狀態:訂單、權限、庫存與付款結果要由後端確認,不能只以「看起來成功」作為完成條件。
  3. 可重播與可測試:同一套操作要能記錄、重播、比較版本,並把錯誤定位到模型決策、工具呼叫或資料來源。
  4. 無障礙語義:W3C 的 Name, Role, Value 準則要求控制元件的名稱、角色、狀態與值可以由輔助技術判定;單張像素畫面本身不提供這些結構。
  5. 延遲與成本:「即時」要落到點擊後第一個正確畫面的 p50/p95 延遲、硬體、併發與每分鐘成本。Runway 的發布頁把高執行成本列為待解問題,仍需要實際服務數據才能判斷經濟性。

“a convincing wrong answer is worse than no answer.”

中文:一個看起來可信的錯誤答案,比沒有答案更糟。

Runway,〈Introducing Solaris〉

值得肯定的是,Runway 自己也把文字、信任與 grounding、長時段一致性、無障礙整合及執行成本列為開放問題。這讓 Solaris 更像一份誠實的研究議程,而不是宣告傳統前端已經結束。

AlphaLab 判讀:最可信的未來是混合式軟體

我認同的部分:在探索、連續動畫、直接操控與場景式互動中,生成模型確實可能比逐項手寫 interaction logic 更有表現力。沉浸式商品展示、遊戲化教學、視覺模擬、沒有精確文字要求的創意工具,以及訓練 GUI agent 時的環境多樣化,都是合理的早期場景。

我不接受的跳躍:目前證據沒有顯示程式碼已成為多餘的一層。Runway 的重建基準測到的是模型從截圖反向工程介面的困難;偏好研究測到的是受試者對展示案例的感受。兩者都還沒有測量交易正確性、長流程完成率、鍵盤與螢幕閱讀器、版本重播、安全邊界或每次互動成本。

最可能先落地的架構:資料、權限、交易、工具與 audit log 繼續保持結構化;無障礙樹與測試 oracle 也保留可程式判定的介面。世界模型負責其中最視覺、最開放、最難事先列舉的呈現層。這不是像素打敗程式碼,而是軟體把一部分「怎麼呈現」交給生成模型。

如果拿到早期測試資格,先問這七個問題

  1. 相同起始畫面與操作軌跡重播十次,最終狀態有多少次不同?
  2. 完整任務成功率是多少,而不只是單幀視覺相似或主觀偏好?
  3. 數字、表格、輸入法與 copy/paste 在長時段是否維持正確?
  4. 點擊到正確畫面的 p50、p95、p99 延遲,以及不同網路距離的抖動是多少?
  5. 每個 session-minute 的運算與頻寬成本,和傳統頁面相比如何?
  6. 權限、付款與來源標示是否位於模型不能偽造的可信層?
  7. 鍵盤、螢幕閱讀器、焦點順序、縮放與 reduced motion 是否有可驗證結果?

在這些答案出現前,Runway Solaris 最適合被看成一個值得小範圍試驗的研究預覽:先放進可丟棄、非關鍵、以場景探索為主的原型,用任務完成率與狀態一致性評估;不要先把它放到付款、身份、醫療或需要完整稽核的流程。

接著閱讀

左右滑動查看更多推薦

Solaris 最值得關注的,不是它是否讓前端工程師消失,而是它把「介面必須先被完整寫下來」從預設變成選項。下一步要看的不是更多精剪 demo,而是 Runway 能否公開可重播的長流程、端到端延遲、成本、無障礙與失敗案例;那才會決定這個新執行層能走多遠。

ALPHALAB 社群

有問題?來 Telegram 聊

和 Terry、編輯、其他網友一起討論這篇文章。提問、分享觀點,回覆更即時。

加入 Telegram 討論

📩 訂閱 AlphaLab 電子報

每週最多三封:一封 Weekly 週報與最多兩封關鍵 Alpha Signal。

我們不會 spam,隨時可退訂。