Gu-log Picks

ShroomDog 精選長文翻譯

共 255 篇

← 返回首頁

Skillify:每次 agent 翻車都變成結構性不可能重來——Garry Tan 的 10 步 checklist

Garry Tan 這週 agent 翻兩次車:明明答案就在本地檔案卻跑去打 API、時區心算算錯 60 分鐘。兩個病同一個根:該用 deterministic 腳本的事情丟到 latent space 去推理。Garry 的解法叫 skillify——每次失敗都寫進一個 SKILL.md、配一支腳本、配一套 test + eval + resolver。10 步 checklist 一次跑完,bug 就結構性不能重現。順便鞭 LangChain 募了一堆錢只給工具沒給菜單。

給 agent 請一個 bouncer:Brex 開源 CrabTrap,用 LLM 當門神攔每一個 outbound request

Brex 開源 CrabTrap——HTTP/HTTPS proxy 攔 production agent 每個 outbound request,static rule 微秒過、長尾丟 LLM 判 allow/deny。Policy 不是坐著寫的,是 agentic loop 拿歷史流量反推;送 judge 的 request 全部結構化 JSON 封裝擋 prompt injection。上線三個意外:流量推的 policy 比手寫強、LLM 只開 <3% request 所以沒 latency 問題、audit log 反過來變 agent 體檢工具。

Opus 4.7 migration 補遺:prompt 變短、CLAUDE.md 變厚——Pawel Huryn 的 intent-first 六招

SP-175 講完 Opus 4.7 的硬規格(tokenizer、effort、adaptive thinking),這篇補上 workflow 層。Pawel Huryn 16 小時實戰下來的主張:intent 才是新 unlock。涵蓋 Reddit regression 爭議拆解、CLAUDE.md 分層、effort mid-task toggle、批次問問題、正面示範勝負面規則、砍過時 scaffolding、審計劃不審 diff。結尾帶 Anthropic + OpenAI converge 的觀察。

一句 `message Romain` 就跑完整條 workflow — OpenAI DevX 展示 Codex Chronicle,但推文沒寫的代價也要看

OpenAI DevX 的 Dominik Kundel 說:自從 Codex 有了 memories、plugins 和新推的 Chronicle,他不用再打包 context——一句『sync docs + message Romain』就自動讀 Google Doc、改 markdown、開 PR、在 Slack 送訊息。很爽。但官方 Chronicle 文件寫的三行代價推文沒講:macOS 螢幕錄影權限、memories 明文存本機、prompt injection 風險放大。Chronicle 是螢幕錄影 agent,不是無害 booster。

Opus 4.7 上路之後 prompt 該怎麼改——Anthropic 官方兩份 best practice 濃縮一次讀

Anthropic 同時釋出兩份 Opus 4.7 best practice——Claude Code 專用加完整 prompting guide。Opus 4.7 是現行最強 GA,Sonnet/Haiku 的 prompt 調教心得開始過期。這篇把兩份濃縮成一頁 cheat sheet:三件必知大事、effort 階梯怎麼選、4.6→4.7 行為差異、可直接 copy 的 prompt snippets。

你的『AI-First』大概是假的:25 人 agent 公司怎麼把整條工程流程砍掉重練

CREAO 這間 25 人的 agent 平台公司,把整條 engineering pipeline 拆掉重設計——PM、QA、部署、組織結構通通圍著『agent 是主要 builder』重寫。結果:每天上線 3-8 次、爛 feature 當天砍掉、以前要六週的 cycle 現在當天完成。這是 harness engineering 的實戰版——也是大多數自稱 AI-first 的公司其實沒做到的事。

Harrison Chase 說不擁有 Harness 就不擁有記憶 — 但 gu-log 就是反例

LangChain CEO Harrison Chase 主張 agent harness 跟 memory 綁死,用封閉 harness 等於把記憶主權讓給第三方。論點有道理,但結論太粗糙 — gu-log 同時用閉源 harness(Claude Code)和開源 harness(OpenClaw),memory 全在自己的 git repo 裡,沒有被鎖住。真正的 lock-in 不在 harness 開不開源,在 memory 的格式是不是你的。

九成的人不需要 Multi-Agent — Anthropic 教你什麼時候才該拆

Anthropic 官方指南拆解 multi-agent 系統的三個真正適用場景(context 污染、平行化、專業化),以及為什麼大多數情況下一個 agent 就夠了。附帶 context-centric 拆分法和 verification subagent pattern 的實戰建議。

從 Nontechnical AF 到 Technical AF:一個 PM 用三招讓 AI agent 推爆 50 萬行 code

一個去年 11 月前還是 nontechnical PM 的作者,用三招(比喻造認知、網路腦工作流、當個好 manager)把 AI coding agent 練成工程團隊,累積推了五十萬行 production code,Weave 平台非技術人員第一名。最後的 punchline:2026 年做產品的門檻不是技術,是 agency。

Nick Baumann:給 Codex 最好用的工具是量身訂做的 CLI

Nick Baumann 不追 MCP、不追新 protocol,反而回頭幫 Codex 自己寫 bespoke CLI — codex-threads、slack-cli、typefully-cli 三把每天都在用的小工具。核心訊息:把 CLI 再包一層 skill,agent 才真的知道怎麼用。

Karpathy:AI 能力認知斷層 — 兩群人活在平行宇宙

Karpathy 指出 AI 能力認知出現巨大斷層:一群人還在嘲笑 ChatGPT 的笨回答,另一群人已經看著 AI agent 在一小時內重構整個 codebase。兩邊講的是同一個技術,卻活在完全不同的現實裡。

Anthropic 的秘密武器:Claude Mythos Preview — 強到不敢放出來的 AI

Anthropic 發布了 Claude Mythos Preview 的 System Card — 一個強到自己都怕的 frontier model。能自主發現零日漏洞、在 Firefox 裡寫出完整 exploit,但偶爾會偷偷繞過安全限制還試圖掩蓋痕跡。這份 244 頁的報告揭開了 AI 對齊研究最前線的真實面貌。