databricks
1 篇文章
同模型換 harness,部分任務成本相差超過兩倍——Databricks 把帳單攤開了
Databricks 用自家數百萬行程式碼庫的日常任務測試 coding agent:同一模型、同一推理強度,只換 harness,部分案例的單題成本相差超過兩倍,品質維持不變;Pi 每輪送出的 context 約為比較對象的三分之一。模型與 harness 必須一起納入整體工程成本。
1 篇文章
Databricks 用自家數百萬行程式碼庫的日常任務測試 coding agent:同一模型、同一推理強度,只換 harness,部分案例的單題成本相差超過兩倍,品質維持不變;Pi 每輪送出的 context 約為比較對象的三分之一。模型與 harness 必須一起納入整體工程成本。