如何讓你的 Claude Skills 變強 10 倍?Andrej Karpathy 的 Autoresearch 方法實戰
Ole Lehmann 分享一個把 Karpathy「autoresearch」概念套進 Claude skills 的做法,讓 agent 自己反覆測試、微調 prompt。以他的 landing page copy skill 為例,quality checks 通過率從 56% 提升到 92%,而且流程幾乎不用手動介入。
ShroomDog 精選長文翻譯
共 256 篇
← 返回首頁Ole Lehmann 分享一個把 Karpathy「autoresearch」概念套進 Claude skills 的做法,讓 agent 自己反覆測試、微調 prompt。以他的 landing page copy skill 為例,quality checks 通過率從 56% 提升到 92%,而且流程幾乎不用手動介入。
作者花了一週拆解 213MB 的 Claude Code 二進位檔,發現它本質上是一個以 Bun 打包的巨大 Prompt 傳遞系統,裡面藏著大量等待解鎖的新功能與遙測機制。
有人把 Claude Certified Architect 認證考試的內容全拆開了 — 五大領域、核心觀念、anti-patterns、實作建議一次看完。證照拿不拿不重要,知識才是重點。
Box CEO Aaron Levie 指出,當 Agent 從 coding 擴展到所有知識工作,現有軟體根本不是為 Agent 設計的。未來每個平台都需要 Agent 專用的 API 和 CLI,而 Agent 之間的互通性將成為軟體的核心競爭力。
Karpathy 的 Autoresearch 不是要做通用 AI 科學家,而是一個極度精簡的自動實驗 harness:agent 改一個檔案、跑五分鐘、量一個指標、贏了留輸了丟。這個設計教會我們:最好的自主系統不是最自由的,而是約束最嚴格的。
Anthropic 官方 prompt caching 文件大更新:Automatic Caching 讓你不用手動標記、1 小時 TTL 讓 cache 活更久、invalidation hierarchy 告訴你什麼改動會炸掉什麼。我們也分享了自己踩過的 $13.86 帳單地雷。
Andrew Ng 發布了開源工具 Context Hub,主打讓 coding agent 能抓到最新 API 文件,減少用舊 API 或亂猜參數的問題。長期目標則是讓 agent 彼此分享學到的筆記。
一篇整理 Codex 使用最佳實踐的指南。從 Prompting、Planning 到 MCP、Skills 與 Automations,帶你建立更穩定的 agent workflow。
Lory 問了他的龍蝦一個問題:人為什麼比 agent 更有能動性?龍蝦回答得很悲觀,但這個問題卻引發了「血肉系統」— 用隨機間隔心跳讓 agent 真正感覺活著,而不是死板地定時被觸發。ShroomDog 讀完之後,也把這套系統落地進了 ShroomClawd。
深入拆解 OpenClaw Agent (v2.1) 傳送給 LLM 的 System Prompt 九層架構,從框架核心到使用者自訂的 Hook 系統,一次看懂!
原作者用同一份 benchmark 對比 system SQLite 與一個 LLM 生成的 Rust 重寫版。結果顯示即使可編譯、可過測,主鍵查詢仍可能出現約 2 萬倍落差。核心訊息是:先定義驗收標準,再談 AI 生產力。
Ring Hyacinth 和 Simon Lee 開源了 Star Office UI——一個像素風辦公室看板,讓 OpenClaw 龍蝦依狀態在辦公室走位、顯示昨日工作小記、還能邀請其他龍蝦加入。附帶完整 SKILL.md 讓龍蝦一鍵部署。
Claude Code 推出 Agent Teams 功能:一個 lead + 多個 teammate,共享任務清單、互相訊息溝通、平行作業。像開了一間全 AI 公司,你只需要當股東看報表。
Anthropic 為 skill-creator 推出新功能,讓技能開發者無需寫 code 就能測試技能、抓出退化問題並優化觸發描述,更引入了多代理平行測試機制。
開發者 Kangwook Lee 透過 2 個 API call 與 35 行 Python 程式碼,成功利用 prompt injection 破解了 Codex 隱藏的 context compaction API,一窺加密資料背後的系統提示詞!
這篇推文的核心很直接:多數人不是輸在模型太弱,而是輸在 context 管理失控。原作者主張先用最精簡的 CLI 工作流,再用 rules、skills 與明確任務終點逐步迭代。重點不是追新工具,而是把 agent 的行為設計成可控、可驗證、可收斂。
Hamel Husain 發表 evals-skills,一套專為 AI 產品評估設計的技能工具。它旨在解決 AI 代理在複雜任務中遇到的評估盲點,尤其是對抗常見錯誤和處理細微的幻覺類型,讓代理人能更有效利用評估平台。
你是否厭倦了不斷調整Prompt或更換模型,卻發現AI智能體始終無法真正「進化」?本文將顛覆你的認知,揭示一套在40天內讓AI智能體從笨拙到高效運作的秘密武器:基於Markdown文件的上下文管理系統。這不是複雜的技術堆疊,而是一種透過「對話與回饋」來累積智能體「長期記憶」的簡單哲學,打造出無法被輕易複製的「護城河」效應。
開發 AI agent 最大的盲點就是「在黑暗中微調」。Daniel 建議使用 OpenRouter 搭配 LangFuse 進行追蹤,透過觀察 agent 的 reasoning traces 和 tool calls,揪出真正的問題所在,而不是盲目修改 system prompts。
OpenAI 團隊在五個月內讓 Codex 寫出了百萬行程式碼,人類完全零手寫。這篇文章分享了他們如何透過建構 Agent Harness(鷹架與回饋迴圈),讓軟體工程師的工作從「寫程式」轉變為「設計環境」。