同模型換 harness,部分任務成本相差超過兩倍——Databricks 把帳單攤開了

Databricks 用自家數百萬行程式碼庫的日常任務測試 coding agent:同一模型、同一推理強度,只換 harness,部分案例的單題成本相差超過兩倍,品質維持不變;Pi 每輪送出的 context 約為比較對象的三分之一。模型與 harness 必須一起納入整體工程成本。

Fable 5 為了修兩行 CSS,自己造了一整套瀏覽器測試工具鏈

Simon Willison 給 Fable 5 一張截圖和一行指令,要它修一個多餘的捲軸。Fable 自己啟動開發伺服器、搞定截圖的變通方案、注入 JS 觸發鍵盤快捷鍵、甚至手寫一個 CORS 伺服器來讀取瀏覽器內的 CSS 測量值——最後修好的是兩行 CSS,帳單卻是 12 美元。這個案例同時是 coding agent 能力的展示,也是沙箱安全問題的警鐘。