跳转至

模型与推理

阅读顺序:模型类型部署方式与选型vLLM 原理、部署与调优 / Ollama。部署方式页建立层次,具体引擎页解释启动与参数取舍。

模型选择、部署和调用基础设施。这里关注的不是“模型会不会回答”,而是如何以可控成本稳定提供 API,并观测质量、延迟、吞吐与资源。

角色分工

多个模型服务需要统一入口时,继续阅读 Higress AI 网关与高可用,了解路由、限流、流式响应与故障切换。

组件 作用
Chat/Generation 模型 根据提示词生成内容,用于问答、总结、抽取和 Agent。
Embedding 模型 将文本转为向量,用于语义检索、聚类和相似度匹配。
Reranker 模型 对初步检索结果重排,提高最终上下文的相关性。
推理引擎 加载模型、管理显存、批处理请求并提供 API,例如 vLLM。

选型先问四件事

  1. 任务需要中文、代码、多模态、工具调用还是长文本能力?
  2. 可用 GPU 的型号、显存、数量和 CPU/网络条件是什么?
  3. 目标是低延迟交互、高吞吐批量,还是两者兼顾?
  4. 是否允许把请求发送到外部服务;数据、模型和许可证是否合规?

量化可降低显存占用,但可能影响质量、吞吐或特定任务表现。先用真实问题集对比基础模型和量化模型,再决定部署版本。

推理服务的基础指标

  • 首 token 延迟(TTFT):用户等待模型开始回答的时间。
  • 输出速度:通常用 tokens/s 衡量。
  • 吞吐:单位时间完成的请求或 token 数。
  • 排队时间、GPU 显存、KV Cache 使用率、错误率和请求长度分布。

推理服务通常通过 OpenAI 兼容 API 对接应用;vLLM 具备 OpenAI 兼容服务、连续批处理、PagedAttention、前缀缓存和多种并行方式。vLLM 官方概览

Ollama 与 vLLM:按场景选,不是二选一

维度 Ollama vLLM
主要目标 快速在个人电脑、开发机或轻量服务器运行/管理模型。 在 GPU 服务器上提供高吞吐、并发推理 API。
上手方式 ollama pull/run,模型管理和 Modelfile 简洁。 需要更多 GPU、模型、并行和服务参数规划。
适合场景 本地开发、原型验证、个人助手、少量并发、离线实验。 内部平台、RAG 服务、较高并发、共享模型 API、压测优化。
重点优化 模型是否完全放入 GPU、上下文、并发、模型常驻时间。 KV Cache、连续批处理、上下文长度、批量、并行、量化与多副本。

两者可以共存:开发人员用 Ollama 快速验证模型与提示词,平台服务用 vLLM 承接线上并发。选择依据是实际负载和运维要求,而不是模型名称。