Agent 失控之后:日志、评测与可恢复执行
BUILDING
01 / OBSERVE→02 / JUDGE→03 / BUILD→04 / REVIEW
TRACKS / 01—04
不是知识分类,而是四条持续推进的工作线。每一篇记录,都要留下判断或做出东西。
FIELD NOTES
结论会变,过程保留。按时间查看我最近正在思考和动手解决的问题。
世界杯季,顺手用 Codex 搓了两个小游戏,已经挂到博客的 Games Lab 上了。两个都接了后端积分钱包,玩完会进全员排行榜——不是单机自嗨,是真能跟别人比的那种。 守门员反应力测试 5 个点球,每球随机…
↗来源:「厂内 AI 实践学习档案」2026-04-19 ~ 2026-05-11 | 30+ 篇实践案例提炼 整理人:hongxinbo | 整理时间:2026-05-11 一、最高频共识:AI 质量上限定律…
↗来源:《Learn Harness Engineering》sanbuphy 著(共127页)| 整理时间:2026-05-11 核心结论: Agent 效果不好,不一定是模型的问题,很可能是你的 Harnes…
↗来源:抖音@老傅1024 视频解析 | 整理时间:2026-05-11 核心结论: RAG 不会消亡,而是在进化。 问题的来源 上下文窗口狂飙:4K → 128K → 200万 token(Kimi),很多人自…
↗来源:抖音@老傅1024 视频解析 | 整理时间:2026-05-11 核心来源:Anthropic 工程博客《Demystifying Evals for AI Agents》 为什么"感觉它还行"不够用?…
↗事情是这样的 2026 年 1 月 10 日,一款叫「死了么」的 App 登顶 App Store 付费榜。 产品本身简单到有点寒酸:只有一个页面,中间一个签到按钮。填好用户名和紧急联系人的邮箱,连续两天没签到…
↗OPEN LOOPS
这里公开未完成的问题。只有经历过实践、形成自己的判断,才会从 OPEN LOOP 变成正式记录。
BUILDING
COLLECTING
DRAFTING
MAPPING
OPERATOR