同模型換 harness,部分任務成本相差超過兩倍——Databricks 把帳單攤開了

Databricks 用自家數百萬行程式碼庫的日常任務測試 coding agent:同一模型、同一推理強度,只換 harness,部分案例的單題成本相差超過兩倍,品質維持不變;Pi 每輪送出的 context 約為比較對象的三分之一。模型與 harness 必須一起納入整體工程成本。

一個人只跟一個 AI 講話,底下卻跑著一整支艦隊:這張 org chart 在示範怎麼幫任務分錢分工

Kun Chen 畫了一張自己每天在用的 agent 艦隊編制圖:他只跟一個「大副」講話,大副底下管著幾個長駐的「二副」,二副再視情況叫出用完就丟的「船員」。每個船員接到任務,系統會自動挑一個最划算的 model 去做——瑣事丟便宜的、日常工作交主力、圖像跟調查另外找專家。這篇順便講清楚一件事:gu-log 自己的翻譯 pipeline,走的是同一套邏輯。

Dan Koe 教你寫一份規格書,只是被部署的 agent 是你自己

一個靠百萬訂閱維生、整天罵演算法把人異化的網紅,奪回人生主導權的方法,是給自己寫一份規格書。把他那套人生整理術拆開來看,跟工程師現在拿來管 AI agent 的規格驅動開發是同一套東西——只是被部署、被每天校正回理想狀態的那隻 agent,是讀者本人。你以為你在管理人生,其實你在自架一隻管你的常駐程式。

40 萬場 Claude Code 對話的結論:贏家不是最會 coding 的人,是最懂行的人

Anthropic 翻了大約 40 萬場 Claude Code 的工作對話,想搞清楚誰從 agentic coding 賺到最多。結論反直覺:不是最會寫程式的人,是最懂自己在解什麼問題的人。在最嚴格的成功標準下,每個職業都咬著軟體工程師不放,差距落在 7 個百分點內;真正拉開差距的,是當下這題你到底懂不懂。

語音 Agent 的記憶,比想像中更難

語音 Agent 不能把文字 Agent 的記憶架構直接搬過來用。Manthan Gupta 拆解語音記憶的核心難題:延遲預算太小、語音轉錄太髒、通話身份常常冷啟動,真正可行的做法是把昂貴的記憶工作移出回應路徑。