-
「沒有 Fable 5 也沒關係」:Sakana Fugu 用多模型編排打到前沿水準
Sakana AI 推出 Fugu —— 一個本身是 LLM 的編排器,學會把 GPT-5.5、Gemini 3.1 Pro、Claude Opus 4.8 路由、驗證、合成成一個系統,在 SWE-Bench Pro 上...
-
Arbor 拆解:同算力預算下,相對增益勝過 Claude Code 與 Codex 2.5× 的自主研究框架
人民大學與 Microsoft Research 的 Arbor,用「假設樹」把研究變成可累積、可剪枝的搜尋:常駐 Coordinator 維護樹、短命 Executor 在隔離 git worktree 跑實驗。六項任...
-
Stanford DeLM:拿掉中央 orchestrator,多代理推理成本砍半
Stanford 的 DeLM 不靠中央調度,讓代理各自認領任務、讀寫同一份「共享驗證脈絡」。論文回報 SWE-bench Verified 最高 +10.5 個百分點、每題成本砍半。本文拆解它的機制、數字前提與適用場景...