GMAsia
    AI 新聞·2026年10月9日·來源: Hackernoon

    如何在 Windows 上原生運行 vLLM

    一位開發者創建了「vllm-windows-build」這個開源專案,讓 vLLM 能夠在 Windows 10/11 上原生執行,並支援 CUDA,無需透過 WSL 或 Docker。該專案提供修補程式、預建的 wheel 檔案和安裝程式腳本,目前選項支援 Triton for Windows 3.7.1 和多種 NVIDIA RTX 系列 GPU。

    Nexa 摘要

    vllm-windows-build 專案解決了開發人員在 Windows 上運行 vLLM 的特定技術難題。儘管 vLLM 官方支援 Linux,但這項舉措旨在提供直接的 Windows 體驗,包括實際的 CUDA 核心利用和 OpenAI 相容伺服器。這可以簡化主要在 Windows 環境中操作的開發人員的工作流程,潛在地減少與虛擬化或容器化解決方案相關的開銷。

    該專案提供不同的建置選項,其中 v0.27.1 為預設版本。此版本包含適用於 SM 7.5、8.6、8.9 和 12.0 的核心,涵蓋 RTX 20/30/40/50 系列 GPU,以及 FlashAttention 2 和可選的 CPU/檔案系統提示 KV 卸載。儘管存在 Python 3.14 建置版本,但它使用 CPU TorchAudio wheel,這意味著 GPU 音訊處理和音訊模型服務未經驗證,因此 0.27.1 是核心模型推斷更經證實的選擇。

    安裝設計為簡單直接,帶有可攜式腳本,可下載必要的組件,如 Python、PyTorch 和 vLLM wheel 檔案,無需預先安裝 Visual Studio 或 CUDA Toolkit。捆綁的啟動器提供一個 OpenAI 相容的 HTTP 伺服器,可實現基本的模型互動並支援從特定格式解析工具呼叫,這對於與 AI 應用程式整合可能很有用。

    分享這篇文章

    延伸閱讀
    原文報道: Hackernoon我們不轉載全文, 閱讀原文 →

    相關文章

    6 則