这是一篇交互式图解,覆盖 RAG 面试高频知识点:向量是什么、文本如何变成向量、向量检索原理、主流向量数据库选型(pgvector / Milvus / Chroma)、RAG 完整链路,以及 Embedding 调优三问。
如果上方无法加载,可以直接访问 独立页面。
手册 1 蒸馏的是别人的实践——42 篇一线文章、十条共识、三个 Playbook。这一篇写我自己:token 怎么花、前端怎么抽卡、后端守什么底线、skill 做什么类型。写完拿手册 1 逐条对照,看哪些地方我无意中做对了,哪些地方确实欠账。
1. Token 的驾驭:三份订阅 + 中转站 + 自建网关我的模型开销结构是这样的:
渠道
内容
成本
火山 plan
国模订阅...
蒸馏自 blog-collector 采集的 42 篇一线实践文章(Anthropic、GitHub、martinfowler.com、Addy Osmani、Sean Goedecke、Armin Ronacher、宝玉、crossoverJie、Pragmatic Engineer 等,2025-2026)。
每条实践都标注验证方式:作者原文给了验收信号的照抄,原文没给的如实标注——没...
说明:本文是完整研究笔记。此前发过精简对比版《解剖三个开源 Harness Agent》,这篇是它背后的全部底稿:按主题重组的一手结论,含目录可跳转。
用途:把与 AI 关于三大开源 harness agent(Codex / OpenCode / grok-build)的多轮讨论,从零散问答重组为按主题的完整复习材料。用于个人复习、面试讲稿、以及”个人 Agent...
一句话总纲:2019 年至今 LLM 架构没有革命,只有围绕一个矛盾的持续工程优化——上下文越来越长(推理模型、Agent 都在囤 token),而注意力计算和 KV cache 的成本随长度膨胀。几乎所有架构改动都是在”省这笔钱”和”别把模型搞笨”之间找平衡。
一张图看懂现代 LLM 架构主干人话结论:把 GPT-2 拿来,换掉 7 个零件,就得到 2025-2026 年任何一个主流开...
一句话总纲:Agent = 模型 + Harness。模型是引擎,Harness 是整辆车——方向盘(提示词)、变速箱(工具调用)、刹车(权限与沙箱)、后视镜(记忆与转写)。你造个人 Agent,本质上是在造车,不是在造引擎。
先把术语钉死(来自 HuggingFace 的 agent 术语表,这套定义能省掉大量鸡同鸭讲):
术语
是什么
类比
Model
文本进文...
一句话总纲:行业层面,中美差距在收窄、竞争在”铁幕化”;评测层面,公开 benchmark 正在集体失效;个人层面,赢家不是拥有最强模型的人,而是最会搭配”够用的模型 + 一手信源 + 可复用工作流”的人。
中美 AI 竞争的真实图景结论:差距存在(约 3-6 个月),但”差距有多大”本身是个多维问题——模型分数、用户体感、顶级用法、商业模式、地缘约束,每个维度答案都不一样。
差距的多...
一句话总纲:架构看收益、接口守规范、排障讲证据链、安全不信肉眼、表达先讲 Why。这些东西在 LLM 时代不但没贬值,反而更值钱——Agent 生成代码的速度越快,对人的”判断力”要求就越高。
一、耗子叔的架构原则(含因果解读)出处:陈皓《我做系统架构的一些原则》(2021-12)。原文 11 条,这里按”取舍逻辑”重组为四组。
1.1 先问收益,再谈技术结论:架构只有三种收益——让团...
“发一个任务下去,很多子任务并行处理”——看起来像一群 Agent 在协作。拆开 Claude Code、Codex、grok-build 的实现,真相朴素得多。
真相一:多智能体 = 编排,不是实现派生子代理就是封装一条提示词 + 选择上下文策略(完整 fork / 截取 / 不给),子代理本体可以是任何现成的 Agent:另一个进程里的 CLI(grok h...
Agent 能执行 shell、能写文件,安全体系不是可选项。三个开源实现的权限设计惊人一致,可以总结成一个漏斗。
规则层:三元组 + findLast每条规则是 (操作类型, 匹配模式, 动作),动作只有三种:allow 放行、ask 问人、deny 拒绝。求值规则是 findLast——后写的规则覆盖先写的(OpenCode 的做法),于是配置可以这样表达:
bash * ...