模型平台
2026/6/17大约 4 分钟模型平台开源模型本地部署
模型平台与本地运行
模型平台解决的是“从哪里找到模型、如何可信地获取、怎样运行与评估”的问题。模型下载量或榜单名次不等于适合生产:许可证、模型卡、显存、推理框架和数据处理方式同样重要。
平台怎么分
| 类型 | 代表 | 适合什么 |
|---|---|---|
| 模型社区与托管 | Hugging Face、ModelScope | 找模型、读模型卡、下载权重、托管推理 |
| 本地运行器 | Ollama、LM Studio | 本机开发、演示、离线试验 |
| 推理服务框架 | vLLM、SGLang、TGI | 把模型变成高并发 API |
| 云模型目录 | Bedrock、Vertex AI、Azure AI Foundry | 企业按云治理使用多个模型 |
Hugging Face
- 官方入口:Hugging Face Hub
- 核心价值:模型、数据集、Spaces、模型卡与社区生态最完整。
- 适合:研究、模型评估、下载开源权重、使用 Transformers / Diffusers。
- 使用建议:先看模型卡的许可证、推荐硬件、已知限制和训练数据说明;固定 revision 或 commit,避免生产环境被上游更新悄悄改变。
ModelScope(魔搭)
- 官方入口:ModelScope
- 核心价值:面向中文开发者的模型、数据集与推理服务生态,获取国内模型更方便。
- 适合:中文任务、国内网络环境、希望使用社区案例快速验证的开发者。
- 使用建议:仍需逐个核对权重许可证和商用条款;“可下载”不等于“可用于任何商业产品”。
Ollama
- 官方入口:Ollama
- 核心价值:用简单命令在本机拉取并运行量化模型,提供本地 API。
- 适合:个人开发、离线原型、小型团队的本地测试。
- 使用建议:它是运行器而不是高并发生产集群;评估并发、显存回收、模型预热与观测需求后,再决定是否进入生产。
LM Studio
- 官方入口:LM Studio
- 核心价值:桌面化模型管理、图形化调参、本地兼容 API。
- 适合:非运维背景的开发者体验模型、演示和小规模本地验证。
- 使用建议:用于模型试用很高效;将可复现实验参数、Prompt 和模型版本记录下来,再迁移到服务端框架。
vLLM 与 SGLang
- 官方入口:vLLM · SGLang
- 核心价值:为 GPU 推理提供连续批处理、KV Cache 管理、OpenAI 兼容接口等服务能力。
- 适合:自托管模型、需要并发和吞吐的线上服务。
- 使用建议:先压测 TTFT、tokens/s、P95 延迟、显存占用与失败重试;不同模型、量化格式和工具调用模式的表现差异很大。
选模型的正确顺序
- 定义任务:问答、抽取、代码、多模态、翻译还是 Agent。
- 用自有样本建立小型评测集,比较质量、幻觉、安全和格式稳定性。
- 核对许可证、数据处理和部署地区。
- 计算端到端成本:不只包括 token 或 GPU,也包括检索、缓存、人工审核和运维。
- 再决定使用托管 API、云目录还是自托管。
常见误区
- 只按参数量选模型:任务指令遵循、语言覆盖和推理配置常常更关键。
- 忽略上下文窗口的实际可用性:长上下文要在自己的文档和问题上测召回与准确性。
- 把量化当作无损:量化等级、硬件与任务类型都会影响结果。
- 未固定版本:模型、Tokenizer、推理引擎都应写入部署清单。
模型卡阅读清单
| 项目 | 为什么重要 |
|---|---|
| License | 决定能否商用、再分发、微调和提供 SaaS |
| 模型类型 | Base、Instruct、Reasoning、Embedding、Reranker 的用途不同 |
| 上下文与语言 | 标称窗口不等于目标语言和文档上的有效召回 |
| 硬件建议 | 参数量之外还要考虑精度、KV Cache、并发和上下文长度 |
| 安全限制 | 内容安全、偏见、幻觉和工具使用风险是否已说明 |
本地运行的硬件估算
粗略估算只用于排除明显不可能的方案:权重显存约等于参数量 × 每参数字节数;还要额外留出运行时、KV Cache 和并发空间。量化可以明显降低权重占用,但长上下文与并发会迅速吃掉显存。部署前用实际提示长度和并发压测,而不是只看“某模型能否加载”。
自托管上线流程
- 锁定模型权重、Tokenizer、量化格式与推理镜像。
- 建立 OpenAI 兼容或内部统一 API,并将密钥、限流和日志置于模型服务之外。
- 预热常用模型,设置队列、最大请求长度、并发上限和 OOM 保护。
- 用基准任务测吞吐、首 token 时间、尾延迟、显存和质量回归。
- 准备滚动升级、模型回滚和容量扩展方案。
