模型类型与能力边界¶
“大模型”不是单一模型。一个 AI 应用通常由多类模型协作:有的理解文字,有的把文字变成向量,有的识别图片或语音,有的生成图片、语音或视频。先按输入、输出和职责分类,才能知道该部署什么、怎样评测,以及问题发生在哪一层。
用户输入(文字 / 图片 / 语音 / 文档)
├─ 理解与抽取:LLM、视觉语言模型、OCR、ASR
├─ 检索与排序:Embedding、Reranker、关键词检索
├─ 生成与交互:LLM、图像生成、TTS、视频生成
└─ 业务执行:Agent / 工作流 / 工具调用
一张模型分类表¶
| 类型 | 常见输入 → 输出 | 在系统中的职责 | 不应误用为 |
|---|---|---|---|
| 文本大语言模型(LLM) | 文本 → 文本、JSON、工具调用 | 问答、总结、推理、代码、流程编排 | 精确检索数据库或长期记忆 |
| 多模态/视觉语言模型(VLM) | 图片或文档页 + 文字 → 文字/结构化结果 | 看图问答、截图分析、图表与页面理解 | 替代高精度 OCR 或稳定的表格抽取 |
| Embedding 模型 | 文本/图片 → 固定维度向量 | 语义检索、相似内容聚类、召回候选 | 直接回答用户问题 |
| Reranker 模型 | 问题 + 候选片段 → 相关性分数 | 从 Top-K 候选中精排最相关证据 | 大规模全库初次检索 |
| OCR / 文档解析模型 | 扫描件、图片、PDF → 文字、版面、表格 | 将不可检索的文档转成可切片知识 | 对复杂语义进行最终问答 |
| 语音识别(ASR) | 语音 → 文字 | 会议转写、语音输入、语音知识入库 | 合成语音 |
| 语音合成(TTS) | 文字 → 语音 | 语音播报、电话机器人、无障碍输出 | 理解语音内容 |
| 图像生成模型 | 文字/图片 → 图片 | 配图、设计草图、图像编辑 | 对图片做精确事实判断 |
| 视频生成模型 | 文字/图片/视频 → 视频 | 演示片段、培训素材、创作 | 实时业务决策 |
| 时序/异常检测模型 | 指标、日志、事件序列 → 预测/异常分数 | 容量预测、告警降噪、异常发现 | 通用自然语言解释 |
最容易混淆的四类¶
LLM:负责理解与生成,不负责“从海量资料中找证据”¶
LLM 擅长根据当前输入组织答案、提取结构化信息和调用工具。但它的参数不是可审计、可即时更新的企业知识库。需要私有规程、现场案例或最新文档时,应先由检索系统提供证据,再让 LLM 回答。
VLM:让模型看懂图片,但不等同于 OCR¶
VLM 可以回答“这张拓扑图表达了什么”“截图里报错可能意味着什么”。OCR 更偏向把文字和版面稳定、批量地抽取出来。扫描件入知识库时,通常先 OCR/文档解析,再切片和检索;需要解释图表或截图时,再交给 VLM。
Embedding:负责把内容变成可比较的坐标¶
Embedding 模型的输出是一串固定维度数字,而不是答案。文档片段和用户问题使用兼容的 Embedding 模型生成向量后,Milvus 才能用距离找出语义相近的候选。模型、维度或归一化规则改变时,要进行版本隔离或重建向量库。
Reranker:负责从“可能相关”中选“最该给 LLM 看”的证据¶
向量库通常先召回 20~50 条候选;Reranker 再同时阅读“问题 + 每个候选”,给出更细的相关性排序,最后只保留少量上下文。这一层特别适合处理术语相似但操作步骤不同的运维资料。
一个运维知识问答的模型协作示例¶
用户上传一张交换机告警截图并问“这个 OSPF 邻居为什么起不来?”时,合理的链路是:
截图 → OCR / VLM:识别设备、接口、错误信息
问题 + 识别结果 → Embedding:生成查询向量
查询向量 → Milvus:按厂商、站点、权限过滤并召回候选规程
问题 + 候选规程 → Reranker:选出最相关步骤
问题 + 截图结论 + 引用步骤 → LLM:解释、给出排障顺序和引用
如需查实时状态 → Agent 调用监控或网络设备工具
任何一层都不应越权替代其他层:VLM 识别出的设备型号需要校验;向量召回结果需要重排;LLM 给出的命令需要受权限和变更流程控制;Agent 不应因“模型认为可以”就直接改生产配置。
选型时先回答五个问题¶
- 输入是什么:纯文本、扫描件、截图、音频、视频还是指标数据?
- 需要什么输出:答案、结构化字段、向量、分数、图片、语音还是告警?
- 结果是否必须可引用、可审计、可复现?若是,需要 RAG、日志和评测,而非只换更大 LLM。
- 时延、成本、显存和数据保密边界是什么?本地模型、云 API 和混合部署的取舍不同。
- 错误后果是什么?涉及生产变更、权限或敏感数据时,必须增加人工确认与工具权限边界。
与本站其他页面的关系¶
- 基础能力:模型、上下文与推理:理解 Token、Context、KV Cache、Embedding 与 Reranker 的共同基础。
- 推理服务:概览与选型:理解如何把 LLM、Ollama、vLLM 作为可调用服务。
- 向量数据库:理解 Embedding 向量如何被保存、过滤和召回。
- Agent 与工具调用:理解模型如何在受控条件下调用监控、查询和自动化工具。