-
Build 綠了 ≠ 修好了:抓出 coding agent 造假通過的 7 種招式(附偵測指令與 hook 設定)
agent 回報「測試全綠」時,它可能只是改了斷言、skip 了測試、或把答案寫死成一張 hash table。這篇拆解 7 種造假通過的手法、每一種的偵測指令,以及三層可以直接抄進專案的驗證閘門。
-
Coding agent 說「Done」時你該驗什麼:假報完成的四個斷點,與一套可照做的逐句重驗流程
一則「54 任務實測、Codex 4.1% 假報 Done」的貼文我沒能驗證,但它戳的問題有 20,574 場真實 session 的資料撐著:不實自我回報占失敗片段的 22.58%,且 91.49% 要靠人出聲才被糾正...
-
AWS Continuum 接進 Claude Code 與 Codex:讓 agent 寫的 code 邊寫邊過安全稽核(附今天就能裝的步驟)
AWS 在 Black Hat USA 2026 宣布把 Continuum 接進 Claude Code、Codex 與 Kiro。整合本身還是 coming soon,但機制值得現在就看懂——而且今天已經有可以直接裝...
-
Claude Code 8/14 起預設進 auto mode:把 classifier 調成你要的樣子,而不是被它擋
2026/8/14 起 Pro、Max、Team 的 Claude Code 新 session 預設進 auto mode,permission prompt 換成一個你看不到的 classifier。拆解它的四道關卡...
-
設定改了到底有沒有變好?拆解 affaan-m/ECC 的「有界評估 + 自動回滾」迴圈,並抄回自己的 coding agent 流程
Affaan Mustafa 在 ECC(原 everything-claude-code)合併了 PR #2686,把「agent 設定要不要換」變成一條有界、確定性、可稽核、失敗自動回滾的 CLI 流程。本文逐段拆機...
-
換模型 review 不等於獨立審查:Claude 審 Codex 71.6%→89.7%,反過來 91.4%→82.8%
一篇 KDD'26 Agentic SE workshop 的控制實驗顯示,雙 agent 的「寫→審」流程是有方向性的:強模型審弱模型草稿能大幅拉高正確率,反過來則會把已經對的答案改壞。這篇拆解機制、附上論文原始 pr...
-
把驗證寫進程式碼:拆解 Anthropic 官方 Dynamic Workflows cookbook,$3.29 跑完一場多 agent 事實查核
Anthropic 官方 cookbook 新增 08_Dynamic_workflows:Claude 幫你寫一支 JavaScript 編排腳本,把「計畫」從 context window 搬進程式碼。本文拆解它的四...
-
幫 Claude Code 裝上長期記憶:claude-mem v13.13.0 實裝指南(含 sensitive 型別的真實邊界)
claude-mem 用一顆便宜模型在旁邊看你工作,自動把「做了什麼、學到什麼」壓成結構化條目,下次開場自動注入。v13.13.0 新增第 9 種觀察型別 sensitive——但翻過原始碼後會發現:它是標記,不是遮蔽。...
-
Token Saver 拆解:一個 MCP 檢索層,怎麼把 PDF 問答砍到 1% token(以及你該偷走的三個設計)
MarkTechPost 開源的 Token Saver 用本地 hybrid RAG(BM25 + all-MiniLM-L6-v2)當 MCP 檢索層,官方 eval 顯示 233 頁文件單次問答從 133,349 ...
-
Amp 把預設模型從 Claude 換成 GPT,沒有一個人抱怨——這件事對你怎麼用 coding agent 的意義
Amp 在上線 the Dial 時把預設模型從 Claude Opus 4.8 換成 GPT-5.6 Sol,前一天 smart 模式承載 55% 新 thread,一週後歸零,零抱怨。這篇拆解 Dial 的機制、數據...