MiniCPM-o 4.5已合并至vLLM-Omni,支持端到端全模态推理
vLLM-Omni集成MiniCPM-o 4.5(9B参数),实现文本/图像/音频/视频输入、文本+语音输出的端到端全模态服务,首版支持单工非流式推理,复用流式双工功能即将推出。
查看原文vLLM-Omni 正式集成 MiniCPM-o 4.5,9B 参数模型首次实现文本/图像/音频/视频四模态输入加语音输出,填补了开源社区在小参数全模态推理服务化方面的空白。对需要本地部署多模态能力的开发者来说,门槛显著降低。
产品是什么
这次是 MiniCPM-o 4.5(9B 参数)模型被合并进 vLLM-Omni 分支,成为首个可在 vLLM 生态内提供端到端全模态推理的开源模型组合。输入端支持文本、图片、音频、视频四模态,输出端除了常规文本,还包含语音合成(TTS)能力——这在同参数量级的开源模型中较为少见。
vLLM-Omni 是 vLLM 项目组孵化的多模态扩展方向,相比主分支的 vLLM,它需要额外处理音频编解码、视频帧采样等非文本模态的数据预处理与后处理流水线。
解决什么问题
在此之前,如果你想用 MiniCPM-o 系列模型做服务化部署,主要依赖 HuggingFace Transformers 或 Ollama。这两种方案的吞吐量和延迟在高并发场景下通常不如 vLLM 原生实现。而将模型集成进 vLLM-Omni 后,开发者可以复用 PagedAttention 内存管理、Tensor Parallelism 分布式推理等 vLLM 的核心性能优化,降低多模态服务的部署成本。
当前能力边界
需要注意的是,首版发布的是单工(simplex)非流式
继续阅读深度解读 + 编辑加注
下方还有 3-5 段深度分析 + Vincent 编辑加注 + 可点击信源,仅 Pro 会员可见
¥99 / 季 · 每周 1 篇深度研报 · 飞书+微信群双通道
已是 Pro 但仍被提示?联系反馈
- vLLM-Omni 合并 MiniCPM-o 4.5 公告 · 2026-06-02
- MiniCPM-o 系列模型技术报告 · 2026-04
- vLLM-Omni GitHub 仓库 · 2026-05