GMAsia
    AI 新闻·2026年10月9日·来源: Hackernoon

    如何在 Windows 上原生运行 vLLM

    一位开发者创建了“vllm-windows-build”这个开源项目,让 vLLM 能够在 Windows 10/11 上原生执行,并支持 CUDA,无需通过 WSL 或 Docker。该项目提供补丁、预构建的 wheel 文件和安装程序脚本,目前选项支持 Triton for Windows 3.7.1 和多种 NVIDIA RTX 系列 GPU。

    Nexa 摘要

    vllm-windows-build 项目解决了开发人员在 Windows 上运行 vLLM 的特定技术难题。尽管 vLLM 官方支持 Linux,但这项举措旨在提供直接的 Windows 体验,包括实际的 CUDA 内核利用和 OpenAI 兼容服务器。这可以简化主要在 Windows 环境中操作的开发人员的工作流程,潜在地减少与虚拟化或容器化解决方案相关的开销。

    该项目提供不同的构建选项,其中 v0.27.1 为默认版本。此版本包含适用于 SM 7.5、8.6、8.9 和 12.0 的内核,涵盖 RTX 20/30/40/50 系列 GPU,以及 FlashAttention 2 和可选的 CPU/文件系统提示 KV 卸载。尽管存在 Python 3.14 构建版本,但它使用 CPU TorchAudio wheel,这意味着 GPU 音频处理和音频模型服务未经验证,因此 0.27.1 是核心模型推断更经证实的选择。

    安装设计为简单直接,带有便携式脚本,可下载必要的组件,如 Python、PyTorch 和 vLLM wheel 文件,无需预先安装 Visual Studio 或 CUDA Toolkit。捆绑的启动器提供一个 OpenAI 兼容的 HTTP 服务器,可实现基本的模型交互并支持从特定格式解析工具调用,这对于与 AI 应用程序集成可能很有用。

    分享这篇文章

    深入了解
    原文报道: Hackernoon我们不转载全文, 阅读原文 →

    相关文章

    6 则