跳到主要內容

【2026 最新】Infinite-Parameter LLM 是什麼?新知寫進權重 vs RAG/長 Prompt

最後更新: ·
Infinite-Parameter LLM 教學封面:比較新知寫進權重、RAG 與長 Prompt

Infinite-Parameter LLM 聽起來像「把無限參數塞進硬碟」,其實剛好相反:它用一個有限大小的生成器,讀取即時資料後,按需組出可重用的低秩權重補丁。這篇適合已懂一點 RAG、卻還分不清「資料留在外面」和「資料改變模型計算」的新手。讀完你會看懂論文架構、跑過的玩具實驗,以及它何時可能比長 Prompt 或 RAG 值得。

先講結論:這是 2026 年 9 月的新預印本,不是已成熟的產品功能。它最有意思的地方,不是宣稱 Prompt 或 RAG 過時,而是提出第四個問題:當同一批新知會被反覆使用,能否先把它編譯成小型權重,再省掉每次重讀全文的成本?目前答案是「特定實驗中有潛力」,還不是「普遍更好」。

Infinite-Parameter LLM 是什麼?先拆掉「無限」的誤會

這個名稱來自 2026 年 9 月 16 日上傳的預印本 《Infinite-Parameter LLMs: Generating and Adapting Weights from Live Data》。作者不是讓模型儲存無限多個實體參數,而是保留一個凍結的 base network,再用小型 hypernetwork 從資料生成低秩更新。只要輸入資料可以一直變,理論上就能到達沒有預先列完的「有效權重」;硬碟上的模型與生成器仍然是有限的。

可以先記住一條式子:

有效權重 W(z) = 凍結權重 W₀ + 低秩補丁 B(z)A(z)ᵀ

其中 z 代表從資料得到的 code,AB 是生成器吐出的低秩因子。論文明確寫出 generated LoRA 的 rank 是 8;運算時不用真的組出完整矩陣,而是依序算 B(Aᵀx)。但別把其他數字當成已確認規格:文中一處寫 d_z=128,下一處又把扁平的 z 定義成足以容納完整 LoRA 參數的向量,兩者無法直接對上。

模組範圍也有同樣問題。目標論文描述 gate、up、down 前饋投影,卻又說沿用的 SHINE generator 幾乎不變;SHINE 官方程式同時產生 attention 與 MLP 的 LoRA。目標論文沒有附自己的程式或 checkpoint,因此目前無法從公開材料確定表格實驗到底套了哪些 projection。能確定的是 Qwen3-8B 底模與既有 SHINE generator 被凍結,另行訓練的是 selector。

四個零件,各自做什麼?

  1. Base network:原本會回答問題的 LLM,權重不動。
  2. Data-to-Weight encoder:把文件或對話壓成 code。論文會加入可學習的 memory tokens,蒐集多層 hidden states。
  3. Hypernetwork:拿 code 生成低秩因子,像是即席做出一片 adapter。
  4. Belief state:根據後續問題,更新「目前該選哪個 code」的機率,再於每層選 top-1 code。

最後一點很重要。論文談到連續 Gaussian belief 與更自由的 code 移動,但實際評估的是有限工作池上的 categorical posterior:先為每個 knowledge set 產生並快取一個 code/adapter,回答時每層選 top-1。池子新增到 K 個,快取儲存與每層比對也會跟著成長;固定的是 resident model 的 learned parameters,不是整套服務的所有狀態。

所以「Infinite」只能讀成作者的窄義命名:連續生成器可能產生未預先列完的有效權重配置。每個權重張量仍位於有限維空間,有限精度電腦也不是字面上的無限;論文更沒有證明無限知識、無限容量或無界增長。

它是把知識永久刻進底模嗎?

不是。底模 W₀ 保持不變,變的是執行時套上的有效權重。論文把更新節奏分成三層:contextual 是讀一次資料、做出本輪 adapter;per-turn 是每輪以新證據更新 belief;per-token 則想在生成每個 token 時,用攤銷過的 Bayesian filter 繼續調整。只有應用程式把 belief 或 code 保存下來,它才會跨回合甚至跨工作階段「記得」;這與永久改寫所有使用者共用的底模不同。

也因此,「持久記憶」不能只看數學式。你還要問 state 存在哪裡、保存多久、屬於哪位使用者、誰能覆寫,以及刪除請求能否真的清除。論文的實證重點仍是 categorical code 選擇與短篇作者設計對話;連續 Gaussian belief、自然長期使用與更長 horizon 都留待後續驗證。它雖以 Bayes 形式累乘 prior 與 evidence,但沒有 NLL、Brier、ECE 或 reliability curve,不能把 selector 分數直接叫作已校準的不確定性。

長 Prompt、RAG、LoRA 與生成權重,差在知識放哪裡?

最直白的判斷法,是問「每次回答前,模型要去哪裡拿這條新知?」

  • 長 Prompt:把原文直接塞進 context。修改快、可看到原文;但每輪可能重讀,資料一多還會遇到長度、位置與注意力稀釋。
  • RAG:文件留在外部索引,問題來時先檢索片段再放進 context。原始 RAG 論文稱它為 parametric 與 non-parametric memory 的結合;來源容易追、刪除與更新,但多一道檢索,找錯片段就可能答錯。想補底層概念,可先讀 Context Engineering 教學
  • 一般 LoRA:LoRA 凍結預訓練權重,再以梯度學出低秩分解並儲存、部署。適合受控的離線調整,不是看到一份新文件就自動生成。
  • Infinite-Parameter LLM:先把 live data 編成 code,再生成低秩權重;之後重複使用時,不必每次把完整資料送回 context。可是生成器與 selector 早就要訓練好,選錯 code 或寫入壞資料也會留下狀態。
長 Prompt、RAG 與生成權重三種記憶路徑比較圖
同一條新知,可以每次重讀、先檢索再重讀,或先編成低秩補丁;三者的更新與風險邊界不同。

所以它不是 RAG 的反義詞。實際系統很可能先用 RAG 或 selector 找到正確 code,再套用生成權重;外部知識庫負責可追溯,權重補丁負責把反覆計算「編譯」起來。這和 模型如何學習中熟悉的離線訓練,也不是同一個更新節奏。

完整走一次:新規則如何從文件變成權重?

假設客服系統今天新增規則:「A 方案取消期限改為 14 天」,而接下來一千次對話都可能用到。

  1. 長 Prompt 路徑:每一輪都附上整段規章,模型從 context 找到 14 天。
  2. RAG 路徑:每輪先搜尋知識庫,命中規章片段後再附給模型。
  3. 生成權重路徑:encoder 先把規章轉成 code;hypernetwork 生成小型低秩補丁;問題來時 selector 選中它,前饋層改用 W₀ + BAᵀ
  4. 規則改回 7 天:長 Prompt 換文字、RAG 換文件;生成權重則必須生成新 code、重新選擇,或可靠地回滾舊狀態。

這個例子也揭露核心交換:前兩者每次把證據帶到桌上,後者先把證據壓成會影響計算的狀態。壓縮可能省重讀成本,也會讓「模型為什麼這樣答」更難直接查看。

玩具實驗:把同一條 rank-1 修正重讀 1,000 次

為了只看「重讀」和「先編譯」的差別,我實際執行了一個固定 seed 的純 Python 玩具模擬:亂數種子 260918842、向量維度 128、64 條候選修正,選定其中一條 rank-1 修正,讓 1,000 個 query 重複使用。這不是 LLM,也不是論文重現;它刻意移除語言理解、訓練與真實檢索品質。

  • 長 Prompt:每次重新讀取 128 個修正值,總計 128,000 個外部值。
  • Oracle-key RAG:每次在 64 個 key 中找到正確項,再讀取修正;總計 64,000 次 key 比對與 128,000 個外部值。這裡故意使用完美 key,不代表真實 RAG 準確率。
  • Compiled rank-1:先讀 128 個值一次,之後 1,000 輪只套用已保存的低秩修正。

三條乾淨路徑的輸出最大誤差都是 0,因為我刻意讓它們計算同一個修正。這個結果只證明「重複外部讀取可以被一次編譯取代」,不證明生成權重比較聰明、比較快,也不等於 token 數或真實延遲。三條路徑仍各做了 1,000 次低秩 dot product。

再把已編譯修正的符號翻轉,前 25 個輸出的平均絕對位移變成 0.0985;回滾乾淨狀態後完全恢復。這才是更值得記住的結果:被編進狀態的錯誤會持續影響後續 query,因此 provenance、版本、隔離與可逆回滾不能等產品上線後才補。

論文真的證明了什麼?

作者以凍結的 Qwen3-8B 測試五個 QA 資料集,預設寫的是 150 個 held-out groups(除非另註)。在 3,000-token budget 下,data-to-weights 相較把資料放進 prompt:SQuAD 的 F1 是 51.8 對 85.3,明顯落後;HotpotQA、2Wiki、MuSiQue、MS MARCO 則分別是 60.4 對 58.7、58.1 對 55.5、45.3 對 40.9、48.0 對 33.6。正確結論是「作者報告四個資料集在該設定領先、一個大幅落後」,不是「全面擊敗 Prompt」;而前三個多跳資料集的差距只有 1.7、2.6、4.4 F1,文中沒有信賴區間可判斷不確定性。

另一組 routing 結果中,trained selector 的 top-1 accuracy 在四個資料集為 53.3%、62.1%、70.1%、53.0%;同表的「bge-small, untrained」dense retrieval 是 45.3%、52.2%、58.1%、40.9%。差距是 8.0~12.1 個百分點的 routing accuracy,不是回答 F1。這組比較沒有同等監督的 retriever/reranker,也沒有證明多跳 top-1 命中會等比例改善端到端答案,更不能外推成勝過所有 RAG 系統。

最需要降溫的是研究邊界:作者明說完整訓練細節不在範圍內,arXiv v1 的正文與原始檔也沒有附目標實作或 checkpoint 連結;跨回合圖只量 turn 1、3、6,是作者設計的對話,沒有樣本數、誤差棒或完整 prompt。既有 SHINE checkpoint 的 instruction-tuning collection 涵蓋這五個 benchmark family,而本文沒有公布 split ID、hash 或 family-level 排除,因此「held-out groups」不能外推成未見領域的 zero-shot 泛化。實驗只評估有限池的 categorical selector,對沒在 pool 內的新變化仍要先做新 code。讀者可把它視為一份有作者數據的架構提案,而不是已被獨立重現的產品規格。

Infinite-Parameter LLM 何時可能值得?

  • 一次性、短資料:先用 Prompt。最少元件,也最容易看見證據。
  • 資料多、常改、必須引用或刪除:先用 RAG。把知識留在外面,治理通常比較直觀。
  • 受控資料要反覆使用,而且 context 成本已被量到:生成權重才值得做原型;先要求版本化、來源追蹤、租戶隔離與一鍵回滾。
  • 要穩定改變風格或任務能力:考慮受控訓練的 LoRA,而不是假設任何 live data 都應直接寫進狀態。

若你正在做 AI Agent Harness,可以把生成權重想成新的 state backend,而不是整套系統:權限、觀測、評測、tool policy 與回滾仍要由 harness 管理。需要動手搭骨架時,再接著看 Agent Harness 實作教學

七個可證偽的驗收題

  1. 同一底模、同一證據與同一輸出評分下,真的勝過 Prompt 和強 RAG 嗎?
  2. 把生成、選擇、檢索、context 與低秩計算全算進去,p50/p95 延遲和成本如何?
  3. 遇到訓練分布外的新文件,能否生成有用 code,而非只記住既有 pool?
  4. 自然、多主題、長時間對話中,selector 會不會逐輪漂移或錯選?
  5. 同一份知識更新與刪除後,所有殘留狀態能否被定位並清乾淨?
  6. 對惡意文件、矛盾資料與跨租戶注入,影響範圍多大、多久可發現?PoisonedRAG 已顯示外部知識庫也有污染攻擊面,所以要比較兩邊,而不是只測其中一邊。
  7. 第三方能否用公開程式、固定 seed 與完整訓練設定重現表格?

常見問題

Infinite-Parameter LLM 真的有無限參數嗎?

沒有無限個實體參數。它指的是有限生成器能從持續到來的資料,產生沒有預先列完的有效權重補丁。

它會取代 RAG 嗎?

目前不會。RAG 的可引用、可刪除、可更新很有價值;生成權重更像重複使用時的編譯層,兩者也能組合。

它和 LoRA 最大差別是什麼?

一般 LoRA 先用梯度訓練並儲存 adapter;這篇方法由預先訓練好的 hypernetwork,依 live data 直接生成低秩因子。

生成時完全不用訓練嗎?

單次把資料轉成 code 是 forward pass,但 generator 與 selector 本身必須事先訓練;論文也沒有公開完整訓練細節。

為什麼不把所有資料都放長 Prompt?

短資料通常可以;當內容反覆使用、變長或被截斷時,重讀成本與注意力稀釋才會變成問題。

錯誤資料寫進權重後能刪除嗎?

概念上可切換或移除 code,但真實系統是否完整清除,取決於它如何保存 belief、cache 與版本;論文還沒有給產品級答案。

玩具實驗證明它更快嗎?

沒有。它只算抽象讀取與 dot product 次數,沒有量 GPU、token、網路或索引延遲。

現在適合拿來做正式產品嗎?

除非你有研究團隊與嚴格隔離環境,否則先做小型原型。正式產品仍應優先選可觀測、可回滾且有成熟工具鏈的方案。

新手先帶走這五件事

  1. 「Infinite」描述可生成的有效權重空間,不是無限儲存或無限知識。
  2. 這篇預印本的核心,是 live data → code → low-rank weight,而不是普通長 Prompt。
  3. 論文現階段真正測的是有限 code pool 的 categorical top-1 選擇。
  4. 反覆使用可能讓「先編譯」划算;一次性資料則常是 Prompt 最簡單。
  5. 任何持久狀態都必須連同來源、版本、隔離、刪除與回滾一起設計。

接著閱讀

左右滑動查看更多推薦

結語:先問重複使用,再決定要不要寫進權重

Infinite-Parameter LLM 最值得學的,不是一個誇張名字,而是一個系統設計問題:新知要每次帶進 context、從外部檢索,還是編成可重用狀態?如果資料只用一次,Prompt 很可能已經夠好;如果資料會常改又需要引用,RAG 更自然;只有當同一知識被大量重用,而且你能證明 context 成本是瓶頸時,生成權重才值得進下一輪原型。

實作前,把上面的七題做成固定評測,並先完成 reset、版本與 rollback。想繼續建立 AI 系統基本功,可從 AlphaLab AI 專區免費課程開始。

ALPHALAB 社群

有問題?來 Telegram 聊

和 Terry、編輯、其他網友一起討論這篇文章。提問、分享觀點,回覆更即時。

加入 Telegram 討論

📩 訂閱 AlphaLab 電子報

每週最多三封:一封 Weekly 週報與最多兩封關鍵 Alpha Signal。

我們不會 spam,隨時可退訂。