跳转至

AI 技术知识图谱

个人学习笔记,持续更新中。每个概念统一按:是什么 → 解决什么问题 → 关联哪些概念 记录。对于需要落地的概念,再补充输入/输出、关键指标和常见误区。最后更新:2026-03

如何使用这张图

这张图不是工具列表,而是依赖关系图:LLM 需要上下文才能回答;上下文可来自对话、RAG 或知识图谱;RAG 又依赖文档解析、分片、Embedding、向量库和重排;Agent 把模型、上下文和工具连接为可执行流程;数据飞轮通过评测和反馈反向改进以上每一层。


目录

  • ① 大模型与运行环境
  • ② 通信与上下文
  • ③ 记忆系统
  • ④ RAG 检索增强生成
  • ⑤ 向量模型与向量库
  • ⑥ 智能体与流程编排
  • 概念关系速查
  • 待补充

① 大模型与运行环境

LLM(Large Language Model)大语言模型

项目 内容
是什么 经过海量文本训练的神经网络模型,能理解和生成自然语言
解决什么问题 让机器能像人一样读懂、写出、推理自然语言
典型代表 GPT 系列、Claude、DeepSeek、Gemini、Llama
应用场景 写作辅助、问答、代码生成、翻译、摘要
关联概念 → vLLM(推理加速)→ Ollama(本地运行)→ Prompt(输入)→ Context(上下文)

vLLM

项目 内容
是什么 专为 LLM 设计的高性能推理引擎
解决什么问题 原生推理效率低、显存利用率差、并发能力弱
核心技术 PagedAttention(像操作系统管理内存一样管理 KV Cache)
优点 推理速度快、吞吐量高、适合大规模 API 部署
缺点 部署复杂,需要 GPU 资源
关联概念 → KV Cache(核心优化对象)→ LLM(运行载体)

Ollama

项目 内容
是什么 在本地电脑运行 LLM 的轻量化工具
解决什么问题 普通开发者/用户想在本地跑模型,无需云服务
优点 安装简单(一条命令)、隐私好、离线可用
缺点 受本地硬件限制,性能远不如云端;功能相对基础
适用人群 个人开发者、隐私敏感场景、离线环境
关联概念 → LLM(运行对象)→ KV Cache(内置优化)

② 通信与上下文

MCP(Model Context Protocol)

项目 内容
是什么 Anthropic 提出的标准化模型通信协议
解决什么问题 不同工具、应用与模型之间的交互方式各不相同,缺乏统一标准
类比 就像 USB 接口——统一规范,让各种设备都能接入
应用场景 多模型协作、AI 接入外部工具(搜索、数据库、文件系统)
关联概念 → Prompt(通信内容)→ Context(上下文管理)→ Agent(主要使用者)

Prompt(提示词)

项目 内容
是什么 发给模型的输入文本,决定模型的输出方向
解决什么问题 如何有效引导模型产出符合预期的结果
延伸方向 Prompt Engineering(提示词工程)是一门专门研究如何写好 Prompt 的学问
关键技巧 明确角色、给出示例、分步骤、指定格式
关联概念 → Context(Prompt 是 Context 的一部分)→ LLM(接收 Prompt 的对象)

Context(上下文)

项目 内容
是什么 模型当前"看到"的所有信息,包括对话历史、系统提示、文档等
解决什么问题 让模型在多轮对话中保持连贯性,理解"上文"
上下文窗口 Context Window,模型一次能处理的最大 token 数量(如 128K tokens)
限制 超出窗口长度的内容会被截断,模型"忘记"早期内容
关联概念 → KV Cache(缓存 Context 的计算结果)→ 会话记忆(Context 的实体)

KV Cache

项目 内容
是什么 Transformer 架构中缓存历史 token 计算结果(Key-Value 对)的机制
解决什么问题 每次生成新 token 都要重新计算所有历史 token,效率极低
效果 大幅减少重复计算,显著提升长文本推理速度
代价 占用显存,Context 越长占用越多
关联概念 → Context(缓存的对象)→ vLLM(通过 PagedAttention 优化 KV Cache)→ Ollama(内置此优化)

③ 记忆系统

核心问题:AI 怎么"记住"事情?记忆分两种,性质完全不同。

模型记忆(参数记忆)

项目 内容
是什么 训练阶段从海量数据中学到的知识,以权重参数形式存储在模型内部
解决什么问题 让模型具备语言能力、世界知识、推理能力
特点 永久存储、跨会话保留、无法实时更新
局限 知识截止于训练日期;无法记住你是谁
类比 人出生后通过学习积累的知识和技能,刻在脑子里
关联概念 → LLM(记忆的载体)→ RAG(弥补知识截止的方案)

会话记忆(上下文记忆)

项目 内容
是什么 当前对话中所有消息的临时存储,存在于 Context Window 里
解决什么问题 让模型在同一次对话中记住你说过的话
特点 临时性、仅限本次会话、有长度上限
局限 关闭对话即清空;新对话不记得上次内容
类比 人的工作记忆——当下记得,睡一觉可能就忘了
关联概念 → Context(会话记忆的实现机制)→ 向量库(实现跨会话记忆的方案)

跨会话记忆(外挂方案)

方案 原理 工具
RAG 记忆 将重要信息存入向量库,新对话时检索注入 Context Milvus、Pinecone
摘要记忆 将历史对话压缩成摘要,作为背景在新对话中注入 Dify、n8n
结构化存储 将用户偏好、关键信息存入数据库,按需读取 自定义开发

④ RAG 检索增强生成

RAG(Retrieval-Augmented Generation)

项目 内容
是什么 让模型在生成回答前,先从外部知识库检索相关内容,再结合检索结果生成答案
解决什么问题 模型知识有截止日期、不了解私有数据、容易"幻觉"
工作流程 用户提问 → 向量检索相关文档 → 文档注入 Context → 模型生成答案
优点 知识实时可更新、可接入私有数据、答案有据可查
缺点 架构复杂、检索质量影响回答质量
关联概念 → 向量模型(负责检索)→ 向量库(存储知识)→ Context(注入结果的地方)

⑤ 向量模型与向量库

向量模型(Embedding Model)

项目 内容
是什么 将文本、图像等数据转化为高维数字向量的模型
解决什么问题 计算机无法直接比较语义相似度,向量让"意思接近"变成"距离接近"
类比 把每个词/句子映射到一个多维空间的坐标点,语义相近的点距离近
应用场景 语义搜索、推荐系统、RAG 检索、相似度计算
关联概念 → 向量库(存储生成的向量)→ RAG(核心组件)

向量库(Vector Database)

项目 内容
是什么 专门存储和高效检索向量数据的数据库
解决什么问题 在亿级向量中快速找到最相似的几条(普通数据库做不到)
核心操作 ANN 近似最近邻搜索(Approximate Nearest Neighbor)
关联概念 → 向量模型(生产向量)→ RAG(使用向量库检索)

主流向量库对比

向量库 特点 优点 缺点 适用场景
Milvus 国产开源 规模大、社区活跃 部署复杂 大规模生产环境
Pinecone 云原生 SaaS 零运维、易扩展 商业化,成本高 快速上线、小团队
Weaviate 支持多模态 内置知识图谱能力 学习曲线陡 多模态、复杂查询
FAISS Facebook 开源 极高性能、轻量 无分布式,需自行搭建 研究、小规模部署
Chroma 轻量开源 极易上手 功能较基础 本地开发、原型验证

⑥ 智能体与流程编排

Agent(智能体)

项目 内容
是什么 能自主感知环境、做出决策、执行任务的 AI 单元
解决什么问题 让 AI 从"回答问题"升级为"完成任务"
核心能力 调用工具(搜索、代码执行、API)、规划步骤、迭代执行
应用场景 自动化办公、行业助手、数据分析、代码开发
关联概念 → MCP(工具调用协议)→ 流程编排工具(Agent 的管理者)

流程编排工具

工具 类型 特点 适用人群
n8n 开源自动化 可视化拖拽、支持数百种集成 技术人员、自动化爱好者
Dify 国产 AI 平台 LLM 应用开发 + Agent 编排 + 向量库集成一体化 开发者、中小企业
Deer-Flow 字节跳动开源 企业级流程自动化 企业内部
OpenSpace 港大开源 空间智能、多模态交互 研究方向
Coze 字节跳动 低代码搭建 AI Bot 非技术人员

概念关系速查

训练数据
└─→ LLM(模型记忆永久写入)
      ├─→ vLLM(高性能部署)
      ├─→ Ollama(本地运行)
      └─→ 对话交互
            ├─→ Prompt(输入)
            ├─→ Context / 会话记忆(临时)
            │     └─→ KV Cache(加速计算)
            └─→ RAG(弥补知识盲区)
                  ├─→ 向量模型(语义转换)
                  └─→ 向量库(知识存储)
                        ├─→ Milvus
                        ├─→ Pinecone
                        ├─→ Weaviate
                        └─→ FAISS

Agent(智能体)
├─→ MCP(工具调用协议)
└─→ 编排工具(n8n / Dify / Deer-Flow)
      └─→ 调用以上所有组件


待补充

遇到新概念,先丢到这里,下次整理时补全。

  • [ ] Fine-tuning(微调)—— 如何让模型学习特定领域知识
  • [ ] LoRA —— 低成本微调技术
  • [ ] Tokenizer —— 模型如何把文字切分成 token
  • [ ] Temperature / Top-P —— 控制模型输出随机性的参数
  • [ ] Multi-modal(多模态)—— 同时处理文字、图像、音频的模型
  • [ ] Function Calling —— 让模型调用外部函数/API 的能力
  • [ ] 幻觉(Hallucination)—— 模型"编造"内容的问题及解决方案

格式说明:每个新概念按「是什么 → 解决什么问题 → 关联概念」填写,放入对应分类,并在「概念关系速查」里补充连线。