TRACK 01 / AI SYSTEMS

AI 做成系统

Agent、RAG、Eval 与 Prompt。不追概念热闹,只记录系统怎样变得可靠。

06 LOGS · ACTIVE

厂内 AI 实践精华:30+ 案例的 15 个核心知识点

来源:「厂内 AI 实践学习档案」2026-04-19 ~ 2026-05-11 | 30+ 篇实践案例提炼 整理人:hongxinbo | 整理时间:2026-05-11 一、最高频共识:AI 质量上限定律 AI 生成的质量上限 = 人的规约/设计文档的质量上限,与模型能力无关。 这是出现频率最高(8+ 次)的核心结论,被以下实践反复印证: Spec-Driven 四层规约:「两天两万行代码只出一个 bug」的底层密码 Design Token:有 Token,AI Dem…

2026年5月11日 · 3 分钟

Harness Engineering:让 AI Agent 可靠工作的完整方法论

来源:《Learn Harness Engineering》sanbuphy 著(共127页)| 整理时间:2026-05-11 核心结论: Agent 效果不好,不一定是模型的问题,很可能是你的 Harness 不够好。 一、核心概念:什么是 Harness Engineering? 关键公式 Agent = Model + Harness Harness = 模型权重之外的一切工程基础设施,包括: 指令文件(AGENTS.md / CLAUDE.md) 工具访问权限 运行…

2026年5月11日 · 3 分钟

假如 LLM 无限上下文了,RAG 还有意义吗?

来源:抖音@老傅1024 视频解析 | 整理时间:2026-05-11 核心结论: RAG 不会消亡,而是在进化。 问题的来源 上下文窗口狂飙:4K → 128K → 200万 token(Kimi),很多人自然推论——直接把所有知识塞进去不就好了?还要 RAG 干嘛? 这个想法错在三个层面。 RAG 依然有意义的 5 个理由 ① 成本:全量投喂烧钱 每轮对话都把全量文档重新喂一遍,token 消耗是指数级的。RAG 只取最相关的 top-k 片段,成本差 10~100 倍。…

2026年5月11日 · 1 分钟

Agent 评测到底怎么做?告别「感觉它还行」

来源:抖音@老傅1024 视频解析 | 整理时间:2026-05-11 核心来源:Anthropic 工程博客《Demystifying Evals for AI Agents》 为什么"感觉它还行"不够用? 典型的痛点路径:改了个 Prompt → 手动跑几个 case → 感觉没问题 → 上线 → 用户反馈"变蠢了" → 无法定位是这次改动还是本来就有问题 → 修一个 Bug → 可能引入新 Bug → 永远在"救火" 没有评测 = 盲飞 。根本无法区分"模型随机噪声"还…

2026年5月11日 · 1 分钟

从零构建 AI Agent:架构设计与实践总结

What is an AI Agent? 先说清楚定义。我理解的 Agent 不是一个更聪明的 chatbot,而是 能自主规划、使用工具、完成复杂任务的 AI 系统 。 核心区别: Chatbot Agent 交互模式 一问一答 接受目标,自主执行 工具使用 无 可调用 API、搜索、代码执行等 记忆 仅当前对话 短期 + 长期记忆 规划能力 无 任务分解、步骤编排 Agent Architecture: The Big Picture 经过在贴吧 Agent 社区项目中的…

2026年3月15日 · 2 分钟

Prompt Engineering 实战指南:从 Zero-Shot 到 Multi-Agent

为什么 Prompt Engineering 依然重要? 有人说 Prompt Engineering 是过渡期产物,模型越来越强就不需要了。我不完全同意。 模型确实在进步,但 prompt 本质上是人和 AI 之间的 protocol 。就像 API 设计不会因为后端变强就不重要一样,prompt 设计关乎的是"如何精确表达意图"——这个需求永远存在。 Core Patterns 1. Zero-Shot:直接了当 最简单的方式,直接告诉模型你要什么: 你是一个专业的文案编…

2026年2月28日 · 1 分钟
S
Symbol's AI
在线 · GLM-5
你好!我是博主的 AI 分身,可以和你聊聊 AI 产品、大模型应用,或者随便聊聊~