跳转至

模型类型与能力边界

“大模型”不是单一模型。一个 AI 应用通常由多类模型协作:有的理解文字,有的把文字变成向量,有的识别图片或语音,有的生成图片、语音或视频。先按输入、输出和职责分类,才能知道该部署什么、怎样评测,以及问题发生在哪一层。

用户输入(文字 / 图片 / 语音 / 文档)
  ├─ 理解与抽取:LLM、视觉语言模型、OCR、ASR
  ├─ 检索与排序:Embedding、Reranker、关键词检索
  ├─ 生成与交互:LLM、图像生成、TTS、视频生成
  └─ 业务执行:Agent / 工作流 / 工具调用

一张模型分类表

类型 常见输入 → 输出 在系统中的职责 不应误用为
文本大语言模型(LLM) 文本 → 文本、JSON、工具调用 问答、总结、推理、代码、流程编排 精确检索数据库或长期记忆
多模态/视觉语言模型(VLM) 图片或文档页 + 文字 → 文字/结构化结果 看图问答、截图分析、图表与页面理解 替代高精度 OCR 或稳定的表格抽取
Embedding 模型 文本/图片 → 固定维度向量 语义检索、相似内容聚类、召回候选 直接回答用户问题
Reranker 模型 问题 + 候选片段 → 相关性分数 从 Top-K 候选中精排最相关证据 大规模全库初次检索
OCR / 文档解析模型 扫描件、图片、PDF → 文字、版面、表格 将不可检索的文档转成可切片知识 对复杂语义进行最终问答
语音识别(ASR) 语音 → 文字 会议转写、语音输入、语音知识入库 合成语音
语音合成(TTS) 文字 → 语音 语音播报、电话机器人、无障碍输出 理解语音内容
图像生成模型 文字/图片 → 图片 配图、设计草图、图像编辑 对图片做精确事实判断
视频生成模型 文字/图片/视频 → 视频 演示片段、培训素材、创作 实时业务决策
时序/异常检测模型 指标、日志、事件序列 → 预测/异常分数 容量预测、告警降噪、异常发现 通用自然语言解释

最容易混淆的四类

LLM:负责理解与生成,不负责“从海量资料中找证据”

LLM 擅长根据当前输入组织答案、提取结构化信息和调用工具。但它的参数不是可审计、可即时更新的企业知识库。需要私有规程、现场案例或最新文档时,应先由检索系统提供证据,再让 LLM 回答。

VLM:让模型看懂图片,但不等同于 OCR

VLM 可以回答“这张拓扑图表达了什么”“截图里报错可能意味着什么”。OCR 更偏向把文字和版面稳定、批量地抽取出来。扫描件入知识库时,通常先 OCR/文档解析,再切片和检索;需要解释图表或截图时,再交给 VLM。

Embedding:负责把内容变成可比较的坐标

Embedding 模型的输出是一串固定维度数字,而不是答案。文档片段和用户问题使用兼容的 Embedding 模型生成向量后,Milvus 才能用距离找出语义相近的候选。模型、维度或归一化规则改变时,要进行版本隔离或重建向量库。

Reranker:负责从“可能相关”中选“最该给 LLM 看”的证据

向量库通常先召回 20~50 条候选;Reranker 再同时阅读“问题 + 每个候选”,给出更细的相关性排序,最后只保留少量上下文。这一层特别适合处理术语相似但操作步骤不同的运维资料。

一个运维知识问答的模型协作示例

用户上传一张交换机告警截图并问“这个 OSPF 邻居为什么起不来?”时,合理的链路是:

截图 → OCR / VLM:识别设备、接口、错误信息
问题 + 识别结果 → Embedding:生成查询向量
查询向量 → Milvus:按厂商、站点、权限过滤并召回候选规程
问题 + 候选规程 → Reranker:选出最相关步骤
问题 + 截图结论 + 引用步骤 → LLM:解释、给出排障顺序和引用
如需查实时状态 → Agent 调用监控或网络设备工具

任何一层都不应越权替代其他层:VLM 识别出的设备型号需要校验;向量召回结果需要重排;LLM 给出的命令需要受权限和变更流程控制;Agent 不应因“模型认为可以”就直接改生产配置。

选型时先回答五个问题

  1. 输入是什么:纯文本、扫描件、截图、音频、视频还是指标数据?
  2. 需要什么输出:答案、结构化字段、向量、分数、图片、语音还是告警?
  3. 结果是否必须可引用、可审计、可复现?若是,需要 RAG、日志和评测,而非只换更大 LLM。
  4. 时延、成本、显存和数据保密边界是什么?本地模型、云 API 和混合部署的取舍不同。
  5. 错误后果是什么?涉及生产变更、权限或敏感数据时,必须增加人工确认与工具权限边界。

与本站其他页面的关系