wow.insight 頻道 | 13分24秒 | Ornith 1.0 評測
一個 35B 的本地模型,通過「自我構建腳手架強化學習」(Self-Scaffolding RL),在多項編程基準上擊敗了雲端大模型。397B 旗艦版甚至反超 Claude Opus 4.7。
這標誌著一個範式轉移:AI 編程工具不再需要依賴昂貴的雲端 API——一台 Mac Studio 就能零成本跑出碾壓級性能。
- Agentic 範式轉移:從「人類寫劇本」到「模型自己設計策略」
- Self-Scaffolding RL 核心機制解析
- 三層反作弊防禦(Anti-Reward-Hacking)
- 35B 為何是性價比最佳切入點
- Mac Studio 本地部署實測
- 397B 旗艦版 vs Claude Opus 4.7
- 人類級自我排錯能力展示
- 沙盒物理引擎與地牢遊戲實測
傳統 AI Agent 是「人類寫劇本(Prompt),模型照著演」。Ornith 1.0 透過 Self-Scaffolding RL,讓模型在訓練階段自己學會設計調用工具的策略——它不再是被動執行的工具,而是主動規劃的指揮官。這與傳統的 function-calling Agent 有本質區別。
這是 Ornith 最革命性的機制。在強化學習階段,模型自動生成「腳手架」(Scaffold)——即輔助性的中間步驟和子任務結構——來幫助自己解決更複雜的問題。它不是被教會技能,而是自己發明了學習技能的方法。這讓模型能在訓練中持續進化,不需要人類介入。
論文設計了三層 Anti-Reward-Hacking 防禦,防止模型在 RL 訓練中走捷徑(例如:記住答案、利用獎勵函數漏洞)。這解釋了為何 Ornith 的基準分數能真實反映能力——它不是「考試機器」,而是真正學會了解決問題。
35B 參數正好卡在消費級硬體的極限內(Mac Studio 192GB 統一記憶體可以完整載入),而性能足以碾壓同級競品(如 Qwen 35B)。397B 旗艦版更在核心測試中反超閉源的 Claude Opus 4.7。對比雲端 API 按 token 付費,本地部署是零成本推論。
實測中最驚人的展示:Ornith 35B 在遇到 Bug 時,會主動「打印終端日誌」來進行高階排錯——就像一個 senior developer 的 debug 流程。結合沙盒物理引擎和地牢遊戲測試,模型展現了驚人的空間推理和自我修復能力。
| 概念 | 說明 |
|---|---|
| Self-Scaffolding RL | 模型在 RL 階段自動生成輔助學習結構 |
| Anti-Reward-Hacking | 三層防禦防止模型利用獎勵函數漏洞 |
| Agentic Coding | 模型自主規劃工具調用策略,非被動執行 |
| Mac Studio 本地部署 | 35B 模型可在消費級硬體上零成本推論 |
| 397B 旗艦版 | 超越 Claude Opus 4.7 的開源模型 |
| 啟示 | 說明 |
|---|---|
| 雲端 API 的定價模式受威脅 | 本地 35B 已能匹敵雲端大模型 |
| RL 自我進化是下一波方向 | Self-Scaffolding 取代人類設計的訓練流程 |
| 35B 是開發者的新標準配置 | 性能與硬體成本的黃金交叉點 |
| 隱私與控制權回歸開發者 | 本地部署 = 零數據外洩 + 零 token 費用 |
| 開源正在追平閉源 | 397B 已反超 Claude Opus 4.7 |
- 「傳統 Agent 是人類寫劇本,模型照著演。真正的 Agentic 是模型自己設計策略。」
- 「35B 是普通人性價比最高的切入點」
- 「Mac Studio 零成本跑出碾壓級成績」
- 「模型遇到 Bug 時會主動打印終端日誌來排錯——就像一個 senior developer」
來源:https://youtu.be/FZV5J50hNxQ 頻道:wow.insight