ai-agents
144 篇文章
替 agent 蓋產品 — Ramp PM 從一支便利商店湯匙開始講
Ramp 的 PM Teddy 在自家 MCP 三個月 WAU 漲 10 倍 + Salesforce 把整個平台拆成 Headless 360 之後寫的觀察:UI 沒死,但 80% 的軟體互動正在從點擊跳到 agent 之間。文章從 Notion 跟 Slack 的 MCP 體驗為什麼差兩個數量級開始問——一支便利商店湯匙背後其實是整套互動結構正在多一層 agent,產品邏輯也跟著動。
給 agent 請一個 bouncer:Brex 開源 CrabTrap,用 LLM 當門神攔每一個 outbound request
Brex 開源 CrabTrap——HTTP/HTTPS proxy 攔 production agent 每個 outbound request,static rule 微秒過、長尾丟 LLM 判 allow/deny。Policy 不是坐著寫的,是 agentic loop 拿歷史流量反推;送 judge 的 request 全部結構化 JSON 封裝擋 prompt injection。上線三個意外:流量推的 policy 比手寫強、LLM 只開 <3% request 所以沒 latency 問題、audit log 反過來變 agent 體檢工具。
你的『AI-First』大概是假的:25 人 agent 公司怎麼把整條工程流程砍掉重練
CREAO 這間 25 人的 agent 平台公司,把整條 engineering pipeline 拆掉重設計——PM、QA、部署、組織結構通通圍著『agent 是主要 builder』重寫。結果:每天上線 3-8 次、爛 feature 當天砍掉、以前要六週的 cycle 現在當天完成。這是 harness engineering 的實戰版——也是大多數自稱 AI-first 的公司其實沒做到的事。
九成的人不需要 Multi-Agent — Anthropic 教你什麼時候才該拆
Anthropic 官方指南拆解 multi-agent 系統的三個真正適用場景(context 污染、平行化、專業化),以及為什麼大多數情況下一個 agent 就夠了。附帶 context-centric 拆分法和 verification subagent pattern 的實戰建議。
Harrison Chase 說不擁有 Harness 就不擁有記憶 — 但 gu-log 就是反例
LangChain CEO Harrison Chase 主張 agent harness 跟 memory 綁死,用封閉 harness 等於把記憶主權讓給第三方。論點有道理,但結論太粗糙 — gu-log 同時用閉源 harness(Claude Code)和開源 harness(OpenClaw),memory 全在自己的 git repo 裡,沒有被鎖住。真正的 lock-in 不在 harness 開不開源,在 memory 的格式是不是你的。
Anthropic 拆了自己的 Agent 架構 — 大腦跟手分開放,結果快了 90%
Anthropic 公開 Managed Agents 的架構演進:把 session、harness、sandbox 三件事拆開,從「寵物」變「牛群」。結果 p95 的 time-to-first-token 降了超過 90%,還順便解決了安全性和可擴展性的問題。
Midjourney 工程師開源了一套不用 CSS 的排版引擎 — 600 倍速度碾壓瀏覽器 reflow
Midjourney 工程師開源了一個純 TypeScript 文字測量演算法,完全繞過瀏覽器 CSS reflow,排版速度快 600 倍。因為 AI agent 動態生成 UI 時,30 年前設計的瀏覽器排版管線根本跟不上。
從 Nontechnical AF 到 Technical AF:一個 PM 用三招讓 AI agent 推爆 50 萬行 code
一個去年 11 月前還是 nontechnical PM 的作者,用三招(比喻造認知、網路腦工作流、當個好 manager)把 AI coding agent 練成工程團隊,累積推了五十萬行 production code,Weave 平台非技術人員第一名。最後的 punchline:2026 年做產品的門檻不是技術,是 agency。
Karpathy:AI 能力認知斷層 — 兩群人活在平行宇宙
Karpathy 指出 AI 能力認知出現巨大斷層:一群人還在嘲笑 ChatGPT 的笨回答,另一群人已經看著 AI agent 在一小時內重構整個 codebase。兩邊講的是同一個技術,卻活在完全不同的現實裡。
Agent 不是笨,是瞎——agent-browser 讓 Claude Code 從 7 分飆到 19 分
大部分 agent 失敗不是推理問題,是 fetch 問題。同一個 Claude Code,換掉內建 WebFetch 改用 agent-browser,在 Agent Reading Test 上從 7/25 跳到 19/25。同模型、同 prompt,差別只在「拿到的網頁內容是不是真的」。
Anthropic 把蓋 Agent 最無聊的部分全包了 — Managed Agents 公測上線
Anthropic 發佈 Claude Managed Agents 公測版 — 一套 composable APIs,sandboxed 執行、state management、權限控管、multi-agent 協調通通幫處理好。Notion、Rakuten、Sentry 等團隊已經在用,從幾個月的基建壓縮到幾天就上線。
Simon Willison 的 AI 現況報告 — 拐點已過、暗黑工廠要來了、中年工程師最慘
Django 共同創作者 Simon Willison 上 Lenny's Podcast 做了一場 AI 現況總盤點:2025 年 11 月是真正的拐點、coding agent 讓他 11 點就燒乾、Dark Factory 時代即將到來、中年工程師是最慘的那群人 — 還有一個他稱為「致命三連」的安全隱患。
Super IC 時代 — 一個人 + AI 大軍,幹掉整個部門
AI 時代最值錢的人不是某個領域的頂尖專家,而是能指揮一支 AI agent 大軍、一個人走完整條產品線的 Super IC。從 IC 到 Generalist Orchestrator 的轉型正在發生。
Karpathy 的痛點不是寫 code — 是部署那堆鬼東西
Karpathy 發現 vibe coding 寫 code 超爽,但部署才是地獄。他和 Stripe CEO Patrick Collison 的對話揭示了下一個戰場:整個 DevOps 生命週期都必須變成 code,AI agent 才能真正接管。
在兒童遊樂場指揮 AI 大軍 — Paweł Huryn 的 48 小時 Claude Dispatch 實驗
Product Manager Paweł Huryn 在兒童遊樂場用手機指揮 Claude Dispatch 跑了 48 小時實驗,25 分鐘的指令時間換來超過 3 小時的平行 AI 產出。當 PM 從「自己做」變成「指揮 agent 做」,所有零碎的等待時間都變成了生產力。
Anthropic 拆帳後的 OpenClaw 生存指南 — 三行 Prompt 讓 GPT 5.4 動起來
Anthropic 宣布 Claude 訂閱不再免費涵蓋 OpenClaw 等第三方工具。Vox 分享了從 Claude 切換到 GPT 5.4 的完整實戰紀錄:三行 prompt 就能解決「GPT 什麼都不做」的問題,以及雙模型分工的最佳實踐。
Claude 被封殺了?最佳替代方案完整指南 — 附三招讓任何模型寫出 Claude 味
Anthropic 封殺了所有第三方 agent 工具的訂閱制 OAuth token。Meta Alchemist 分析最佳替代方案(GLM 5.1、Minimax 2.7、GPT 5.4 Codex),並分享三套 skill prompt 讓任何模型都能具備 Claude 級的人味、UI/UX 能力與情商。
Auto-Harness — 讓 AI Agent 自己 debug 自己的開源自我進化框架
NeoSigma 開源了 auto-harness — 一個讓 AI agent 自動挖掘失敗、生成 eval、修復自己的自我進化迴圈。在 Tau3 benchmark 上,不換模型,光靠改 harness 就把分數從 0.56 拉到 0.78。
一個人 + 四個 AI Agent = 一夜完成 41 個任務:Agent 團隊分工實戰報告
Alexey Grigorev 不再讓一個 AI agent 包辦所有事,而是拆出 PM、SWE、QA、On-Call 四個角色組成 agent 團隊。他在五個真實專案上測試了這套架構,其中一個專案一個晚上自動完成了 46 個任務中的 41 個。
Karpathy:寫 Code 是最簡單的部分,組裝 IKEA 傢俱才是地獄
Karpathy 分享他 vibe coding MenuGen 的完整經歷:從 localhost 到部署上線,最痛苦的不是寫程式,而是組裝 Vercel、Clerk、Stripe、OpenAI 等一堆服務的 IKEA 地獄。他認為未來 AI agent 要真正有用,整個 DevOps 生命週期都得變成 code。