如何在 Windows 上原生运行 vLLM
一位开发者创建了“vllm-windows-build”这个开源项目,让 vLLM 能够在 Windows 10/11 上原生执行,并支持 CUDA,无需通过 WSL 或 Docker。该项目提供补丁、预构建的 wheel 文件和安装程序脚本,目前选项支持 Triton for Windows 3.7.1 和多种 NVIDIA RTX 系列 GPU。
vllm-windows-build 项目解决了开发人员在 Windows 上运行 vLLM 的特定技术难题。尽管 vLLM 官方支持 Linux,但这项举措旨在提供直接的 Windows 体验,包括实际的 CUDA 内核利用和 OpenAI 兼容服务器。这可以简化主要在 Windows 环境中操作的开发人员的工作流程,潜在地减少与虚拟化或容器化解决方案相关的开销。
该项目提供不同的构建选项,其中 v0.27.1 为默认版本。此版本包含适用于 SM 7.5、8.6、8.9 和 12.0 的内核,涵盖 RTX 20/30/40/50 系列 GPU,以及 FlashAttention 2 和可选的 CPU/文件系统提示 KV 卸载。尽管存在 Python 3.14 构建版本,但它使用 CPU TorchAudio wheel,这意味着 GPU 音频处理和音频模型服务未经验证,因此 0.27.1 是核心模型推断更经证实的选择。
安装设计为简单直接,带有便携式脚本,可下载必要的组件,如 Python、PyTorch 和 vLLM wheel 文件,无需预先安装 Visual Studio 或 CUDA Toolkit。捆绑的启动器提供一个 OpenAI 兼容的 HTTP 服务器,可实现基本的模型交互并支持从特定格式解析工具调用,这对于与 AI 应用程序集成可能很有用。
分享这篇文章
相关文章
6 则
阿里巴巴主席蔡崇信:开源人工智能是欧洲实现科技独立的唯一途径

Elon Musk 就 Starlink 印度发布延迟问题加剧对 Ambani 的抨击

Kurt Campbell 谈美国对华焦点、印太四方安全对话、人工智能风险

Paul Stenhouse:Starlink 采取行动成为全面移动服务提供商,Anthropic 禁止滥用 Clause,Apple 宣布“Welcome Home”活动

MegaCryptoPolis 游戏玩法大革新:城市管理交由 AI 代理负责

