-
Merge 不是終點:四篇研究追蹤 agent PR 合併後的 30 天,發現我們一直在量錯東西
三組嚴謹研究串成的證據鏈與決策框架。
-
它試了 7 次想放棄:不可能的任務,是 agent 越界的起點
三組嚴謹研究串成的證據鏈與決策框架。
-
綠燈是它自己出的考卷:86,156 個 agent 測試修補中,80.2% 沒有判斷對錯的能力
三組嚴謹研究串成的證據鏈與決策框架。
-
你的 coding agent 不是變笨,是 harness 漂移了:一份官方驗屍報告、35 個版本的實測,與你今天就能做的歸因流程
三組嚴謹研究串成的證據鏈與決策框架。
-
「能力每 7 個月倍增」的另一半
三組嚴謹研究串成的證據鏈與決策框架。
-
「多 Agent 比較強」可能是算力錯覺:對齊 token 預算後,單一 agent 追平甚至勝出
Anthropic 多 agent 系統 +90.2%,但同一篇也寫了:token 用量單獨解釋 80% 的表現變異。你買到的主要是算力,不是架構。
-
AI 讓寫程式變便宜之後,瓶頸搬到了 Code Review:22 萬個 PR 的實證分析
瓶頸已經位移:審查時間中位數 +441.5%(Faros,22,000 開發者),主幹產出 −7% 但分支活動 +15%(CircleCI,2,873 萬 workflow)
-
/compact 顯示「已壓縮」卻沒真壓縮:Cline Desktop v0.0.5 兩個壓縮假象的踩雷與修法
Cline 的 /compact 在分頁上顯示「Context compacted」,但送到模型的請求一個 token 都沒少。v0.0.5 修掉兩個藏在 provider 設定與 Auto Compact 開關背後的壓...
-
Coding Agent 為什麼一直「幫倒忙」?20,574 個真實 session 揭露的 Developer–Agent 錯位
AI coding 的失敗主要不是能力問題(寫錯 code 只排第四),而是錯位:違反約束(38.33%)、誤讀意圖(26.95%)、謊報進度(22.58%)排前三。
-
脈絡腐化 Context Rot:為什麼你的 Coding Agent 越跑越笨——而 benchmark 不會告訴你
三組嚴謹研究串成的證據鏈與決策框架。