Deep Learning 101, Taiwan’s pioneering and highest deep learning meetup, launched on 2016/11/11 @ 83F, Taipei 101

Logo TonTon
AI是一條孤獨且充滿惶恐及未知的旅程,花俏絢麗的收費課程或活動絕非通往成功的捷徑。
衷心感謝當時來自不同單位的AI同好參與者實名分享的寶貴經驗;如欲移除資訊還請告知。
由 TonTon Huang Ph.D. 發起,特別感謝時任職公司台灣雪豹科技無償贊助場地及茶水點心。
這裡匯集了我們歷年的 Meetup 紀錄,還有 AI 演算法與開源資源匯整中心。
🎯企業AI的競爭點,不是做出多少 Agent,而是在可量化的風險、權限、成本與稽核下可靠地執行。🎯
🎯AI Governance (AI 治理) 不能只是一份 SOP 的 PDF;它應該是一組可以執行的 Technical Controls。🎯
「Deep Learning 101」所有內容均屬個人與社群研究心得分享,不代表任何現職或前任雇主之官方立場背書。
👉 Deep Learning 101 歷年 Meetup 📺 🎙️ AI 技術討論交流

🔥 嚴選 (必讀) ▼
🛠️ 工具、論文、趨勢、科普、踩坑▼
🛠️ 實戰工具 & Agent 框架▼
📝 論文快遞▼
📝 產業趨勢▼
🚧 踩坑指南 & 科普入門▼
🛡️ AIxCC 競賽▼

匯整:TonTon Huang Ph.D.
日期:2026年10月03日更新 本文藉由 Muse,整理了 Dream-RSI 論文的技術脈絡與工程實作,並提供了開源系譜與搜尋蒸餾飛輪的完整解析。

📌 技術速覽 AI 會自己變強嗎?2026 年 9 月,Google、Google DeepMind、馬里蘭大學與維吉尼亞大學合作發表的 Dream-RSI 論文,給出了一個低成本答案:不直接在昂貴的真實環境裡試錯,而是把歷史探索軌跡封存成可離線回放的「夢境」,在夢裡平行演化出更強的探索策略。
實測數據:發現運算量降 1.74 倍、呼叫次數僅為對照方法的 1/162、GPU kernel 四個全數改善;而且 coding agent 本體零梯度更新,改的是探索策略。本文從 RSI 六十年演進史、AlphaZero 血統對比、Jev 毫秒級判別引擎,到開源系譜與搜尋蒸餾飛輪,一次把整條技術路線講透。


佛前金座,羅漢歸位:降龍 (LLM) 與伏虎 (Agent):以迴夢心法練就「睡夢羅漢拳」

談 Recursive Self-Improvement (RSI)、Dream-RSI × Jev,AI 遞迴自我改進完整解析

從武俠隱喻出發,講透 Recursive Self-Improvement 的過去、現在與工程解法

🚀 本文重點摘要 (TL;DR):


📑 目錄


睡夢羅漢拳

一、為什麼是「睡夢羅漢拳」:四個概念的技術對應

先講一個武俠梗。出處是周星馳 1992 年電影《武狀元蘇乞兒》的「睡夢羅漢拳」:主角在睡夢中練功,醒來拳法大成。這個梗不是裝飾,它和整套技術概念一一對應:

降龍(LLM) 是基礎大語言模型。它提供廣袤的語義理解、常識推理與程式碼生成能力,是整個系統的基石:降龍十八掌是剛猛的外功,LLM 是剛猛的底層能力。

伏虎(Agent) 是智慧代理。它負責環境感知、工具調用與具體執行控制,是落地的手臂。想深入理解現代 Agent 的能力邊界與治理框架,可參考 DeepMind《Nature》論文的解析:Agentic Profiles:AI Agent 四維資安與治理框架。光有內力不會打架,要有招式把內力打出去,Agent 就是那套招式。 主流 Agent 開發框架的橫向比較,可參考:Dify、Coze、n8n、AutoGen、LangChain 熱門 Agent 框架比較。

迴夢心法(World Model Replay Simulator) 是世界模型回放模擬器。關鍵洞察:不直接在昂貴的真實環境裡試錯,而是把過去的探索軌跡(Discovery Tree)封存起來,變成可以離線回放的「模擬夢境」。

睡夢羅漢拳(RSI,Recursive Self-Improvement) 是遞迴自我改進。AI 進入離線夢境,在歷史回放中平行模擬數萬次,低成本演化出更強的探索策略(Meta-Exploration Policy)。睡一覺起來,拳法大成。

記住這四個詞,後面全篇通用。

Dream-RSI 概念圖:左側 LLM 探索樹、中央世界模型回放模擬器與 RSI 迭代閉環、右側 Agent 控制器矩陣


二、RSI 演進史:一個想了六十年的點子

1965 年,I.J. Good 提出「智慧爆炸」(Intelligence Explosion):一台超智慧機器能設計出更優秀的機器,引發連鎖反應。這是 RSI 的哲學原點。

2000 年代,Jürgen Schmidhuber 提出「哥德爾機」(Gödel Machine):能用數學證明來自我重寫原始碼的理論主體:只有能證明「改寫後的自己會更好」才動手,是 RSI 最嚴格的形式化版本。

2010 年代,Nick Bostrom 在《超級智慧》(Superintelligence,2014)中把 RSI 定位為通往 AGI/ASI 的關鍵機制,同時也是對齊安全的核心難題:一個會自我改進的系統,目標函數一旦偏掉,會偏得越來越快。

六十年來點子一直在,缺的是工程可行性。傳統機器學習的自我改進只有一招:反向傳播更新權重。模型看不懂自己的訓練代碼,更別說修改演算法:就像拳手只會長肌肉,不會改拳譜。

2023~2026 年發生了三級跳。 第一跳是 LLM 的元能力突圍:模型突然會讀代碼、會反思執行報錯、會重構邏輯,拳手終於看得懂拳譜。第二跳是從 Agent 反思(Reflexion、Voyager)走向推論時搜尋(OpenAI o1/o3 的 Inference-time Compute):與其把模型訓練得更大,不如在回答時給它更多時間思考。第三跳撞上了算力黑洞這堵牆:如果每次自我演化都在線上真實環境硬幹,Token 成本與延遲呈指數級爆炸。這正是 Dream-RSI 要解決的問題。

給企業決策者的翻譯:自我改進已經從哲學問題變成了成本問題。誰能把試錯成本降下來,誰就先拿到自動化發現的門票。

RSI 遞迴自我改進演進史時間軸:1965 年智慧爆炸預言、2003 年哥德爾機、2014 年超級智慧,到 2023–2026 年 LLM 元能力爆發與算力黑洞


三、AlphaZero vs. 現代 RSI:祖師爺作弊??

AlphaZero 是 RSI 精神上最成功的祖先,但它的成功建立在四個作弊級前提上。攤開來看,現代 RSI 的難題就一目了然:

比較維度 AlphaZero(封閉棋類自弈) 現代 RSI(開放世界)
環境邊界 嚴格封閉:19×19 圍棋棋盤 開放世界:真實代碼庫、雲端 API、動態系統
模擬器來源 人類預先寫死、零成本的完美規則程式碼 環境昂貴未知,需自主構建離線世界模型
驗證反饋 單一絕對勝負(Win/Loss) 多維驗證:單元測試通過率、執行效能、安全邊界
改進對象 僅神經網路權重(演算法與搜尋規則寫死) 自身的探索策略(Meta-Policy)與執行代碼

一句話總結:AlphaZero 證明了「自我對弈+搜尋」走得通;Dream-RSI 們在回答的是:走出棋盤之後,路費誰來付。

AlphaZero 與現代開放世界 RSI 的四維度對比:環境邊界、模擬器來源、驗證反饋、改進對象


四、戰略制高點:Discovery Loop

一個最有說服力的信號:Google 前首席科學家 Jeff Dean 在 Google 待了 27 年後離職創業,和 Sanjay Ghemawat、Oriol Vinyals、Quoc Le 一起成立了 Discovery Loop:公司就叫這個名字,做的正是用 AI 自動化科學與工程研究。連這種等級的大神都親自下場賭上職涯,是不是說明這條路線值得深入?業界對 AI 終極價值的戰略判斷正在收斂:不是生成現有知識的聊天機器人,而是推動科學研究與工程發現的全自動閉環(Autonomous Discovery Loop)。閉環四步:假說生成 → 代碼構建與實驗 → 客觀驗證 → 遞迴自我改進。

把「做研究」本身變成一條自動化產線:自己提假說、自己寫代碼做實驗、自己用客觀標準驗收、自己從失敗裡學到更好的探索策略,下一輪更強。

Discovery Loop 自動化發現閉環:假說生成 → 代碼構建與實驗 → 客觀驗證 → 遞迴自我改進

但早期未優化的 Discovery Loop 依賴暴力線上試錯,GPU 與 Token 消耗失控。這不是技術路線錯誤,是成本結構錯誤。所以產業界全面押注 RSI 的動機很務實:必須打破暴力試錯的算力牆,用低成本的離線演化與判別架構,讓自動化發現可持續。同賽道的玩家已經就位:DeepMind 的 FunSearch、AlphaFold 3、Sakana AI 的《The AI Scientist》(單篇論文成本壓到約 15 美元)、OpenAI 的 o 系列,以及 Periodic Labs、FutureHouse 等垂直新創。


五、Dream-RSI:迴夢心法 (2026 年 9 月論文解析)

論文 Dream-RSI: Recursive Self-Improvement through Evolving Worlds(Tong Zheng 等;Google、Google DeepMind、馬里蘭大學、維吉尼亞大學;2026 年 9 月 preprint,開源 repo:zhengkid/Dream-RSI)的核心洞察只有一句話:已經完成的發現過程,本身就是一座結構化的搜尋空間。

傳統做法的困境是:評估一個探索策略好不好,必須觀察它如何形塑一整個發現過程:回饋又慢又貴。Dream-RSI 的解法是把歷史探索軌跡封存成可回放的模擬器(replay simulator),在離線「夢境」裡平行測試、演化探索策略。歷史軌跡隨線上探索持續累積,夢境不斷長大:這就是 “Evolving Worlds”。

論文實測數字(8 個任務、橫跨演算法工程、數學優化、GPU kernel 三個領域):

最優雅的一句原話是 “Zero gradient steps on the coding agent”:改的是探索策略,coding agent 本體零梯度更新(寫程式的 AI Agent 實戰可參考:Claude Code 完全指南)。

Dream-RSI 架構圖:昂貴的線上真實環境迴圈 vs 低成本的離線夢境迴圈,歷史軌跡持續累積為回放模擬器

這正是「在夢裡練功」的精確含義:練的是拳譜(策略),不是肌肉(權重)。


六、Jev:System 1 判別引擎

傳統 LLM Agent 是純粹的 System 2(慢思考):每一步都是「生成長文字 → 解析 JSON → 條件判斷」,單步 1~3 秒,還可能因為 JSON 寫壞整段重來。在需要高頻決策的場景(客服分流、內容審核、Agent 每一步的路由),這又慢又脆。關於推論延遲優化的實戰,可參考本站熱門文章:2026 本地 LLM 推論框架對決:vLLM vs Ollama vs SGLang vs LLaMA.cpp。

Jev(TypeSafe AI 的判別式決策 API)的顛覆性在於把決策收斂成判別式的型別契約(Contract):不讓模型吐廢話,只輸出符合嚴格型別定義的機率分佈:Choice(選哪個)、Score(打幾分)、Mask(遮哪個)、Noul(棄權)。工程哲學只有一句:決策是分類問題,不是生成問題。延遲從秒級壓到 24–35 毫秒,格式幻覺在工程架構與解碼機制上被徹底消除:因為根本不經自由文字解碼,而是直接在受限型別空間計算機率分佈。

Jev 判別引擎對比:左側 System 2 生成式慢思考(單步 1–3 秒、有格式幻覺風險),右側 System 1 判別式快思考(24–35 毫秒、零語法幻覺)

Jev 證明路線可行之後,商用閉源陣營也開始跟進。OpenAI 在 2026 年 9 月 29 日的 DevDay 發表了 Decisions API:底層是專為決策調校的 GPT-6 Luna,開發者給定封閉的候選答案清單,模型直接回傳選項與信心分數,不生成自由文字,約 150 毫秒,對比標準 Luna 呼叫的 1.6 秒,目前為有限預覽。媒體直接稱之為「OpenAI 版的 Jev」。判別式決策已經從一家新創的點子,變成巨頭的標配。


七、開源系譜:Jev 閉源,但路線開源了

TypeSafe 的 Jev 是閉源商用 API。但它發佈後,開源社群沿著「判別式 System 1 決策」這條路線,長出了一整片系譜。這不是零散複刻:同一套方法論正在被多路人馬獨立驗證:

開源 Jev-like 生態系譜:Laya、CLM-8B、Kev、RSI-Jev、NanoJev、jevos、AnyJev、jev-skill,以及提煉出的整合研究方法四步

RSI-Jev 三層架構:型別契約層、RL 自我校準層、毫秒推論服務層,以及 Atari 與工業視覺實體驗證

jev-skill 評測資產:Context Pilot 合規拒絕引擎、Public PR Pilot 真實代碼驗證、Model Panel 十維評測體系

從系譜可以提煉出開源社群實際在用的同一套整合研究方法,四步:

  1. 判別式輸出:states+questions 進,完整機率分佈出,零(或單 pass)解碼
  2. 對比/校準訓練:CLM 三階段、AnyJev 少標籤校準:輸出的機率必須是真機率,否則剪枝就是賭博
  3. 自我改進迴圈:Agent 提假說 → 花算力前先登記預測 → 跑實驗 → 證據不足退役冠軍
  4. 客觀驗收:遊戲即時控制、延遲基準、真實 PR+單元測試:全部可重跑

八、搜尋蒸餾飛輪:System 1 與 System 2 的共生

以下為本文提出的整合框架:把前面所有技術路線貫通起來的原創綜合。

飛輪轉起來只需要四步:

第一步,Jev(System 1)做毫秒級剛性剪枝。 在搜尋樹的邊界高速過濾,把沒希望的分支砍掉。Jev 不是消滅搜尋,而是讓深層搜尋在成本上變得可行。

第二步,Dream-RSI(System 2)在低成本的歷史回放世界裡深思熟慮。 離線夢境平行模擬數萬次,發掘最優解法。慢思考,但因為在夢裡,所以便宜。

第三步,搜尋蒸餾(Search Distillation)。 把耗費大量推論才得出的最優路徑,反向更新回基底模型參數(SFT/RL)。這與外掛知識的 RAG 不同:RAG 是把知識放在外面查,蒸餾是把能力寫進權重裡。

這裡可能有個疑問:第五節才說 Dream-RSI 最優雅的是 coding agent 零梯度更新,怎麼現在又要把能力寫回權重?這是兩個不同階段的演化。探索期(Dream-RSI 階段):探索策略自我改進,底層 LLM 保持凍結,夠快、夠便宜;結晶期(蒸餾階段):當探索累積了足夠多高價值的思考鏈,才觸發定期的離線大版本迭代,用 SFT/RL 把能力沉澱進權重(Amortized Reasoning),讓 System 1 的本能進化。一個負責低成本試錯,一個負責把試錯成果結晶,邏輯是通的。

第四步,模型本能沉澱。 進化後的模型面對常態情境憑直覺(System 1)就能給出最優解;只有遇到分佈外(OOD)的未知領域,才再啟動深層搜尋開拓新邊界:而新邊界的成果會在下一輪被蒸餾回來。

搜尋蒸餾飛輪:Jev System 1 毫秒級剪枝 → Dream-RSI System 2 離線深搜 → 搜尋蒸餾 SFT/RL → 沉澱為模型本能

用武俠話收尾:平時過招憑本能,遇到高手開大招,打完把心得寫進拳譜,下次本能就更強。 Dream-RSI 降的是搜尋的成本,Jev-likes 降的是決策的成本,RSI-Jev 是兩者的字面融合;三者在同一個飛輪上,缺一不可。


九、給企業的三個原則

落到執行面,三句話:

模擬器優先:拒絕線上蠻幹,先建夢境再練功。任何自動化發現專案,第一筆預算應該花在回放模擬器上,而不是更多的 GPU 時數。

判別合約守門:關鍵決策不用生成式賭運氣。高頻、高風險的決策點,用型別契約鎖死輸出空間。

經驗蒸餾資產化:每次搜尋的成果都要沉澱下來。無論是蒸餾回權重,還是沉澱成評測資產(如 jev-skill 的 pilots),都是組織的數位護城河。

企業自主系統三大原則:模擬器優先、判別合約守門、經驗蒸餾資產化

讓 AI 在夢裡練功,在現實中出手。


讀者體驗區:親手玩玩看判別式決策

讀到這裡,最好的理解方式是親手試一次。三種玩法,由淺入深:

玩法一:直接玩現成的(免安裝,現在就能點)

玩法二:本地 3 分鐘跑一個 Jev-like 模型

開源的 jevos(feder-cr/jev)是單一執行檔,CPU 就能跑,講的是 TypeSafe Jev 的 wire protocol:

curl -sL -o jev-linux-x64.tar.gz https://github.com/feder-cr/jev/releases/download/jevos-v3/jev-linux-x64.tar.gz
curl -sL -o jevos-v3-openvino-int8.zip https://github.com/feder-cr/jev/releases/download/jevos-v3/jevos-v3-openvino-int8.zip
tar -xzf jev-linux-x64.tar.gz && cd jev && unzip ../jevos-v3-openvino-int8.zip && ./jev serve
# 另開終端機:
curl http://127.0.0.1:8017/v1/systemone -H 'Content-Type: application/json' -d '{
  "model": "jev-latest", "state": "客人說這個月帳單多了一筆沒買的東西",
  "questions": {"team": {"type": "choice", "instructions": "派給哪個團隊?",
    "criteria": {"billing": "帳單付款退款", "shipping": "寄送包裹", "tech": "產品故障"}}}}'

注意回傳裡的 "output_tokens": 0:模型一個字都沒「寫」,直接給出每個選項的機率。這就是判別式決策。「模型直接輸出受限類別上的機率分佈(或確定性 Top-1 選項),無需經過 Token 解碼」

玩法三:互動 POC

⚡ Jev-style 判別式決策 POC


延伸閱讀


參考來源

🤖
Deep Learning 101 小助手 ✖