-
Devin Fusion 實戰:讓 Fable 5.1 規劃審查、SWE-2 動手實作,本機 coding agent 的設定、派工 prompt 與成本判讀
Cognition 把 Fusion 搬進 Devin CLI 與 Desktop:前沿模型當 lead 負責規劃與審查,較便宜的 sidekick 負責實作與測試,兩邊各自保有快取 context。這篇講清楚機制,並給...
-
換模型 review 不等於獨立審查:Claude 審 Codex 71.6%→89.7%,反過來 91.4%→82.8%
一篇 KDD'26 Agentic SE workshop 的控制實驗顯示,雙 agent 的「寫→審」流程是有方向性的:強模型審弱模型草稿能大幅拉高正確率,反過來則會把已經對的答案改壞。這篇拆解機制、附上論文原始 pr...