Skip to content

Instantly share code, notes, and snippets.

@jenaiho
Created July 6, 2026 13:00
Show Gist options
  • Select an option

  • Save jenaiho/1447c0ff8aaa49b6936e68e9719a62d4 to your computer and use it in GitHub Desktop.

Select an option

Save jenaiho/1447c0ff8aaa49b6936e68e9719a62d4 to your computer and use it in GitHub Desktop.
Ornith 1.0:35B 自我進化模型擊敗雲端大模型 — Self-Scaffolding RL 深度解析

Ornith 1.0:35B 自我進化模型擊敗雲端大模型 — Self-Scaffolding RL 深度解析

wow.insight 頻道 | 13分24秒 | Ornith 1.0 評測


核心觀點

一個 35B 的本地模型,通過「自我構建腳手架強化學習」(Self-Scaffolding RL),在多項編程基準上擊敗了雲端大模型。397B 旗艦版甚至反超 Claude Opus 4.7。

這標誌著一個範式轉移:AI 編程工具不再需要依賴昂貴的雲端 API——一台 Mac Studio 就能零成本跑出碾壓級性能。


內容大綱

  1. Agentic 範式轉移:從「人類寫劇本」到「模型自己設計策略」
  2. Self-Scaffolding RL 核心機制解析
  3. 三層反作弊防禦(Anti-Reward-Hacking)
  4. 35B 為何是性價比最佳切入點
  5. Mac Studio 本地部署實測
  6. 397B 旗艦版 vs Claude Opus 4.7
  7. 人類級自我排錯能力展示
  8. 沙盒物理引擎與地牢遊戲實測

五點分析

1. Agentic 範式轉移:模型不再是工具,是指揮官

傳統 AI Agent 是「人類寫劇本(Prompt),模型照著演」。Ornith 1.0 透過 Self-Scaffolding RL,讓模型在訓練階段自己學會設計調用工具的策略——它不再是被動執行的工具,而是主動規劃的指揮官。這與傳統的 function-calling Agent 有本質區別。

2. Self-Scaffolding RL:AI 自己搭建學習階梯

這是 Ornith 最革命性的機制。在強化學習階段,模型自動生成「腳手架」(Scaffold)——即輔助性的中間步驟和子任務結構——來幫助自己解決更複雜的問題。它不是被教會技能,而是自己發明了學習技能的方法。這讓模型能在訓練中持續進化,不需要人類介入。

3. 三層反作弊機制:防止模型「刷分」

論文設計了三層 Anti-Reward-Hacking 防禦,防止模型在 RL 訓練中走捷徑(例如:記住答案、利用獎勵函數漏洞)。這解釋了為何 Ornith 的基準分數能真實反映能力——它不是「考試機器」,而是真正學會了解決問題。

4. 35B = 本地部署的黃金點

35B 參數正好卡在消費級硬體的極限內(Mac Studio 192GB 統一記憶體可以完整載入),而性能足以碾壓同級競品(如 Qwen 35B)。397B 旗艦版更在核心測試中反超閉源的 Claude Opus 4.7。對比雲端 API 按 token 付費,本地部署是零成本推論。

5. 人類級排錯:AI 會自己看 log 找 bug

實測中最驚人的展示:Ornith 35B 在遇到 Bug 時,會主動「打印終端日誌」來進行高階排錯——就像一個 senior developer 的 debug 流程。結合沙盒物理引擎和地牢遊戲測試,模型展現了驚人的空間推理和自我修復能力。


技術關鍵詞

概念 說明
Self-Scaffolding RL 模型在 RL 階段自動生成輔助學習結構
Anti-Reward-Hacking 三層防禦防止模型利用獎勵函數漏洞
Agentic Coding 模型自主規劃工具調用策略,非被動執行
Mac Studio 本地部署 35B 模型可在消費級硬體上零成本推論
397B 旗艦版 超越 Claude Opus 4.7 的開源模型

產業啟示

啟示 說明
雲端 API 的定價模式受威脅 本地 35B 已能匹敵雲端大模型
RL 自我進化是下一波方向 Self-Scaffolding 取代人類設計的訓練流程
35B 是開發者的新標準配置 性能與硬體成本的黃金交叉點
隱私與控制權回歸開發者 本地部署 = 零數據外洩 + 零 token 費用
開源正在追平閉源 397B 已反超 Claude Opus 4.7

金句

  • 「傳統 Agent 是人類寫劇本,模型照著演。真正的 Agentic 是模型自己設計策略。」
  • 「35B 是普通人性價比最高的切入點」
  • 「Mac Studio 零成本跑出碾壓級成績」
  • 「模型遇到 Bug 時會主動打印終端日誌來排錯——就像一個 senior developer」

來源:https://youtu.be/FZV5J50hNxQ 頻道:wow.insight

Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment