模型与推理¶
阅读顺序:模型类型 → 部署方式与选型 → vLLM 原理、部署与调优 / Ollama。部署方式页建立层次,具体引擎页解释启动与参数取舍。
模型选择、部署和调用基础设施。这里关注的不是“模型会不会回答”,而是如何以可控成本稳定提供 API,并观测质量、延迟、吞吐与资源。
角色分工¶
多个模型服务需要统一入口时,继续阅读 Higress AI 网关与高可用,了解路由、限流、流式响应与故障切换。
| 组件 | 作用 |
|---|---|
| Chat/Generation 模型 | 根据提示词生成内容,用于问答、总结、抽取和 Agent。 |
| Embedding 模型 | 将文本转为向量,用于语义检索、聚类和相似度匹配。 |
| Reranker 模型 | 对初步检索结果重排,提高最终上下文的相关性。 |
| 推理引擎 | 加载模型、管理显存、批处理请求并提供 API,例如 vLLM。 |
选型先问四件事¶
- 任务需要中文、代码、多模态、工具调用还是长文本能力?
- 可用 GPU 的型号、显存、数量和 CPU/网络条件是什么?
- 目标是低延迟交互、高吞吐批量,还是两者兼顾?
- 是否允许把请求发送到外部服务;数据、模型和许可证是否合规?
量化可降低显存占用,但可能影响质量、吞吐或特定任务表现。先用真实问题集对比基础模型和量化模型,再决定部署版本。
推理服务的基础指标¶
- 首 token 延迟(TTFT):用户等待模型开始回答的时间。
- 输出速度:通常用 tokens/s 衡量。
- 吞吐:单位时间完成的请求或 token 数。
- 排队时间、GPU 显存、KV Cache 使用率、错误率和请求长度分布。
推理服务通常通过 OpenAI 兼容 API 对接应用;vLLM 具备 OpenAI 兼容服务、连续批处理、PagedAttention、前缀缓存和多种并行方式。vLLM 官方概览
Ollama 与 vLLM:按场景选,不是二选一¶
| 维度 | Ollama | vLLM |
|---|---|---|
| 主要目标 | 快速在个人电脑、开发机或轻量服务器运行/管理模型。 | 在 GPU 服务器上提供高吞吐、并发推理 API。 |
| 上手方式 | ollama pull/run,模型管理和 Modelfile 简洁。 |
需要更多 GPU、模型、并行和服务参数规划。 |
| 适合场景 | 本地开发、原型验证、个人助手、少量并发、离线实验。 | 内部平台、RAG 服务、较高并发、共享模型 API、压测优化。 |
| 重点优化 | 模型是否完全放入 GPU、上下文、并发、模型常驻时间。 | KV Cache、连续批处理、上下文长度、批量、并行、量化与多副本。 |
两者可以共存:开发人员用 Ollama 快速验证模型与提示词,平台服务用 vLLM 承接线上并发。选择依据是实际负载和运维要求,而不是模型名称。