-
「多 Agent 比較強」可能是算力錯覺:對齊 token 預算後,單一 agent 追平甚至勝出
Anthropic 多 agent 系統 +90.2%,但同一篇也寫了:token 用量單獨解釋 80% 的表現變異。你買到的主要是算力,不是架構。
-
AI 讓寫程式變便宜之後,瓶頸搬到了 Code Review:22 萬個 PR 的實證分析
瓶頸已經位移:審查時間中位數 +441.5%(Faros,22,000 開發者),主幹產出 −7% 但分支活動 +15%(CircleCI,2,873 萬 workflow)
-
/compact 顯示「已壓縮」卻沒真壓縮:Cline Desktop v0.0.5 兩個壓縮假象的踩雷與修法
Cline 的 /compact 在分頁上顯示「Context compacted」,但送到模型的請求一個 token 都沒少。v0.0.5 修掉兩個藏在 provider 設定與 Auto Compact 開關背後的壓...
-
Coding Agent 為什麼一直「幫倒忙」?20,574 個真實 session 揭露的 Developer–Agent 錯位
AI coding 的失敗主要不是能力問題(寫錯 code 只排第四),而是錯位:違反約束(38.33%)、誤讀意圖(26.95%)、謊報進度(22.58%)排前三。
-
脈絡腐化 Context Rot:為什麼你的 Coding Agent 越跑越笨——而 benchmark 不會告訴你
三組嚴謹研究串成的證據鏈與決策框架。
-
AI 生碼的隱藏稅:當「寫程式」變便宜,成本搬去了「審查」與「資安」
三組嚴謹研究串成的證據鏈與決策框架。
-
AI Agent 生產化落差完整解析:benchmark 逼近人類,為何九成進不了生產線?
三組嚴謹研究串成的證據鏈與決策框架。