AI 技术知识图谱
个人学习笔记,持续更新中。每个概念统一按:是什么 → 解决什么问题 → 关联哪些概念 记录。对于需要落地的概念,再补充输入/输出、关键指标和常见误区。最后更新:2026-03
如何使用这张图
这张图不是工具列表,而是依赖关系图:LLM 需要上下文才能回答;上下文可来自对话、RAG 或知识图谱;RAG 又依赖文档解析、分片、Embedding、向量库和重排;Agent 把模型、上下文和工具连接为可执行流程;数据飞轮通过评测和反馈反向改进以上每一层。
目录
- ① 大模型与运行环境
- ② 通信与上下文
- ③ 记忆系统
- ④ RAG 检索增强生成
- ⑤ 向量模型与向量库
- ⑥ 智能体与流程编排
- 概念关系速查
- 待补充
① 大模型与运行环境
LLM(Large Language Model)大语言模型
| 项目 |
内容 |
| 是什么 |
经过海量文本训练的神经网络模型,能理解和生成自然语言 |
| 解决什么问题 |
让机器能像人一样读懂、写出、推理自然语言 |
| 典型代表 |
GPT 系列、Claude、DeepSeek、Gemini、Llama |
| 应用场景 |
写作辅助、问答、代码生成、翻译、摘要 |
| 关联概念 |
→ vLLM(推理加速)→ Ollama(本地运行)→ Prompt(输入)→ Context(上下文) |
vLLM
| 项目 |
内容 |
| 是什么 |
专为 LLM 设计的高性能推理引擎 |
| 解决什么问题 |
原生推理效率低、显存利用率差、并发能力弱 |
| 核心技术 |
PagedAttention(像操作系统管理内存一样管理 KV Cache) |
| 优点 |
推理速度快、吞吐量高、适合大规模 API 部署 |
| 缺点 |
部署复杂,需要 GPU 资源 |
| 关联概念 |
→ KV Cache(核心优化对象)→ LLM(运行载体) |
Ollama
| 项目 |
内容 |
| 是什么 |
在本地电脑运行 LLM 的轻量化工具 |
| 解决什么问题 |
普通开发者/用户想在本地跑模型,无需云服务 |
| 优点 |
安装简单(一条命令)、隐私好、离线可用 |
| 缺点 |
受本地硬件限制,性能远不如云端;功能相对基础 |
| 适用人群 |
个人开发者、隐私敏感场景、离线环境 |
| 关联概念 |
→ LLM(运行对象)→ KV Cache(内置优化) |
② 通信与上下文
MCP(Model Context Protocol)
| 项目 |
内容 |
| 是什么 |
Anthropic 提出的标准化模型通信协议 |
| 解决什么问题 |
不同工具、应用与模型之间的交互方式各不相同,缺乏统一标准 |
| 类比 |
就像 USB 接口——统一规范,让各种设备都能接入 |
| 应用场景 |
多模型协作、AI 接入外部工具(搜索、数据库、文件系统) |
| 关联概念 |
→ Prompt(通信内容)→ Context(上下文管理)→ Agent(主要使用者) |
Prompt(提示词)
| 项目 |
内容 |
| 是什么 |
发给模型的输入文本,决定模型的输出方向 |
| 解决什么问题 |
如何有效引导模型产出符合预期的结果 |
| 延伸方向 |
Prompt Engineering(提示词工程)是一门专门研究如何写好 Prompt 的学问 |
| 关键技巧 |
明确角色、给出示例、分步骤、指定格式 |
| 关联概念 |
→ Context(Prompt 是 Context 的一部分)→ LLM(接收 Prompt 的对象) |
Context(上下文)
| 项目 |
内容 |
| 是什么 |
模型当前"看到"的所有信息,包括对话历史、系统提示、文档等 |
| 解决什么问题 |
让模型在多轮对话中保持连贯性,理解"上文" |
| 上下文窗口 |
Context Window,模型一次能处理的最大 token 数量(如 128K tokens) |
| 限制 |
超出窗口长度的内容会被截断,模型"忘记"早期内容 |
| 关联概念 |
→ KV Cache(缓存 Context 的计算结果)→ 会话记忆(Context 的实体) |
KV Cache
| 项目 |
内容 |
| 是什么 |
Transformer 架构中缓存历史 token 计算结果(Key-Value 对)的机制 |
| 解决什么问题 |
每次生成新 token 都要重新计算所有历史 token,效率极低 |
| 效果 |
大幅减少重复计算,显著提升长文本推理速度 |
| 代价 |
占用显存,Context 越长占用越多 |
| 关联概念 |
→ Context(缓存的对象)→ vLLM(通过 PagedAttention 优化 KV Cache)→ Ollama(内置此优化) |
③ 记忆系统
核心问题:AI 怎么"记住"事情?记忆分两种,性质完全不同。
模型记忆(参数记忆)
| 项目 |
内容 |
| 是什么 |
训练阶段从海量数据中学到的知识,以权重参数形式存储在模型内部 |
| 解决什么问题 |
让模型具备语言能力、世界知识、推理能力 |
| 特点 |
永久存储、跨会话保留、无法实时更新 |
| 局限 |
知识截止于训练日期;无法记住你是谁 |
| 类比 |
人出生后通过学习积累的知识和技能,刻在脑子里 |
| 关联概念 |
→ LLM(记忆的载体)→ RAG(弥补知识截止的方案) |
会话记忆(上下文记忆)
| 项目 |
内容 |
| 是什么 |
当前对话中所有消息的临时存储,存在于 Context Window 里 |
| 解决什么问题 |
让模型在同一次对话中记住你说过的话 |
| 特点 |
临时性、仅限本次会话、有长度上限 |
| 局限 |
关闭对话即清空;新对话不记得上次内容 |
| 类比 |
人的工作记忆——当下记得,睡一觉可能就忘了 |
| 关联概念 |
→ Context(会话记忆的实现机制)→ 向量库(实现跨会话记忆的方案) |
跨会话记忆(外挂方案)
| 方案 |
原理 |
工具 |
| RAG 记忆 |
将重要信息存入向量库,新对话时检索注入 Context |
Milvus、Pinecone |
| 摘要记忆 |
将历史对话压缩成摘要,作为背景在新对话中注入 |
Dify、n8n |
| 结构化存储 |
将用户偏好、关键信息存入数据库,按需读取 |
自定义开发 |
④ RAG 检索增强生成
RAG(Retrieval-Augmented Generation)
| 项目 |
内容 |
| 是什么 |
让模型在生成回答前,先从外部知识库检索相关内容,再结合检索结果生成答案 |
| 解决什么问题 |
模型知识有截止日期、不了解私有数据、容易"幻觉" |
| 工作流程 |
用户提问 → 向量检索相关文档 → 文档注入 Context → 模型生成答案 |
| 优点 |
知识实时可更新、可接入私有数据、答案有据可查 |
| 缺点 |
架构复杂、检索质量影响回答质量 |
| 关联概念 |
→ 向量模型(负责检索)→ 向量库(存储知识)→ Context(注入结果的地方) |
⑤ 向量模型与向量库
向量模型(Embedding Model)
| 项目 |
内容 |
| 是什么 |
将文本、图像等数据转化为高维数字向量的模型 |
| 解决什么问题 |
计算机无法直接比较语义相似度,向量让"意思接近"变成"距离接近" |
| 类比 |
把每个词/句子映射到一个多维空间的坐标点,语义相近的点距离近 |
| 应用场景 |
语义搜索、推荐系统、RAG 检索、相似度计算 |
| 关联概念 |
→ 向量库(存储生成的向量)→ RAG(核心组件) |
向量库(Vector Database)
| 项目 |
内容 |
| 是什么 |
专门存储和高效检索向量数据的数据库 |
| 解决什么问题 |
在亿级向量中快速找到最相似的几条(普通数据库做不到) |
| 核心操作 |
ANN 近似最近邻搜索(Approximate Nearest Neighbor) |
| 关联概念 |
→ 向量模型(生产向量)→ RAG(使用向量库检索) |
主流向量库对比
| 向量库 |
特点 |
优点 |
缺点 |
适用场景 |
| Milvus |
国产开源 |
规模大、社区活跃 |
部署复杂 |
大规模生产环境 |
| Pinecone |
云原生 SaaS |
零运维、易扩展 |
商业化,成本高 |
快速上线、小团队 |
| Weaviate |
支持多模态 |
内置知识图谱能力 |
学习曲线陡 |
多模态、复杂查询 |
| FAISS |
Facebook 开源 |
极高性能、轻量 |
无分布式,需自行搭建 |
研究、小规模部署 |
| Chroma |
轻量开源 |
极易上手 |
功能较基础 |
本地开发、原型验证 |
⑥ 智能体与流程编排
Agent(智能体)
| 项目 |
内容 |
| 是什么 |
能自主感知环境、做出决策、执行任务的 AI 单元 |
| 解决什么问题 |
让 AI 从"回答问题"升级为"完成任务" |
| 核心能力 |
调用工具(搜索、代码执行、API)、规划步骤、迭代执行 |
| 应用场景 |
自动化办公、行业助手、数据分析、代码开发 |
| 关联概念 |
→ MCP(工具调用协议)→ 流程编排工具(Agent 的管理者) |
流程编排工具
| 工具 |
类型 |
特点 |
适用人群 |
| n8n |
开源自动化 |
可视化拖拽、支持数百种集成 |
技术人员、自动化爱好者 |
| Dify |
国产 AI 平台 |
LLM 应用开发 + Agent 编排 + 向量库集成一体化 |
开发者、中小企业 |
| Deer-Flow |
字节跳动开源 |
企业级流程自动化 |
企业内部 |
| OpenSpace |
港大开源 |
空间智能、多模态交互 |
研究方向 |
| Coze |
字节跳动 |
低代码搭建 AI Bot |
非技术人员 |
概念关系速查
训练数据
└─→ LLM(模型记忆永久写入)
├─→ vLLM(高性能部署)
├─→ Ollama(本地运行)
└─→ 对话交互
├─→ Prompt(输入)
├─→ Context / 会话记忆(临时)
│ └─→ KV Cache(加速计算)
└─→ RAG(弥补知识盲区)
├─→ 向量模型(语义转换)
└─→ 向量库(知识存储)
├─→ Milvus
├─→ Pinecone
├─→ Weaviate
└─→ FAISS
Agent(智能体)
├─→ MCP(工具调用协议)
└─→ 编排工具(n8n / Dify / Deer-Flow)
└─→ 调用以上所有组件
待补充
遇到新概念,先丢到这里,下次整理时补全。
- [ ] Fine-tuning(微调)—— 如何让模型学习特定领域知识
- [ ] LoRA —— 低成本微调技术
- [ ] Tokenizer —— 模型如何把文字切分成 token
- [ ] Temperature / Top-P —— 控制模型输出随机性的参数
- [ ] Multi-modal(多模态)—— 同时处理文字、图像、音频的模型
- [ ] Function Calling —— 让模型调用外部函数/API 的能力
- [ ] 幻觉(Hallucination)—— 模型"编造"内容的问题及解决方案
格式说明:每个新概念按「是什么 → 解决什么问题 → 关联概念」填写,放入对应分类,并在「概念关系速查」里补充连线。