coding-agents
8 篇文章
同模型換 harness,部分任務成本相差超過兩倍——Databricks 把帳單攤開了
Databricks 用自家數百萬行程式碼庫的日常任務測試 coding agent:同一模型、同一推理強度,只換 harness,部分案例的單題成本相差超過兩倍,品質維持不變;Pi 每輪送出的 context 約為比較對象的三分之一。模型與 harness 必須一起納入整體工程成本。
早上 Claude Code、下午 Codex:Agent 的經驗被切成三份
Letta 開源 trajectory,把 Claude Code、Codex、OpenClaw 等 harness 留下的工作紀錄,正規化成同一種寫給 agent 讀的格式;在抽樣到的紀錄上,token 數壓到原生的五分之一左右。跨 harness 學習的前提,是先替每個 harness 產出的經驗訂一種標準格式。
讓 Fable 自己決定——Simon Willison 的模型委派心法
Simon Willison 從 Claude Code 團隊的爐邊對談學到一招:與其給 Fable 詳細規則,不如讓它自己判斷。延伸應用:讓 Fable 自己決定什麼任務該丟給比較省的模型跑。
AI 寫 code 很少把專案搞爆,但九成爛攤子還是得你親手收
兩萬多場真實 coding agent 工作階段被攤開來看:多數失準的代價是時間和信任,不是不可逆的系統損害;但在看得到結局的那些收尾裡,91.49% 仍得使用者親手糾正。而且剩下的錯,越來越像違規和謊報進度。
Fable 5 為了修兩行 CSS,自己造了一整套瀏覽器測試工具鏈
Simon Willison 給 Fable 5 一張截圖和一行指令,要它修一個多餘的捲軸。Fable 自己啟動開發伺服器、搞定截圖的變通方案、注入 JS 觸發鍵盤快捷鍵、甚至手寫一個 CORS 伺服器來讀取瀏覽器內的 CSS 測量值——最後修好的是兩行 CSS,帳單卻是 12 美元。這個案例同時是 coding agent 能力的展示,也是沙箱安全問題的警鐘。
給「慢下來」三個字的深度辯護 — 遊戲老兵拆解 Coding Agent 正在毀掉你的 Codebase
Mario Zechner 在這篇文章裡,用很重的語氣批評 coding agent 被帶進 production 後的幾個連鎖問題:錯誤會複利、agent 不會自己學、架構複雜度失控、搜尋 recall 低。結論不是停用 agent,而是慢下來,把人類的判斷和紀律放回流程裡。
Coding Agents 與消失的心流:我們還在 Agent 的撥接時代
Awni Hannun 分享了他使用 coding agents 的感受:高延遲打斷了原本能長時間專注的 flow state,也讓人覺得我們還處在 agent 的撥接時代。
Karpathy 的 AI Psychosis:12 月起沒寫過一行 code,80% 交給 agent
Karpathy 在 No Priors podcast 分享自 12 月起 80% code 交給 agent,提出「AI psychosis」概念——給 agent 太多自主權會讓人失去對 output 的掌控感。他認為工程正經歷不可逆的 phase shift。