如何在 Windows 上原生運行 vLLM
一位開發者創建了「vllm-windows-build」這個開源專案,讓 vLLM 能夠在 Windows 10/11 上原生執行,並支援 CUDA,無需透過 WSL 或 Docker。該專案提供修補程式、預建的 wheel 檔案和安裝程式腳本,目前選項支援 Triton for Windows 3.7.1 和多種 NVIDIA RTX 系列 GPU。
vllm-windows-build 專案解決了開發人員在 Windows 上運行 vLLM 的特定技術難題。儘管 vLLM 官方支援 Linux,但這項舉措旨在提供直接的 Windows 體驗,包括實際的 CUDA 核心利用和 OpenAI 相容伺服器。這可以簡化主要在 Windows 環境中操作的開發人員的工作流程,潛在地減少與虛擬化或容器化解決方案相關的開銷。
該專案提供不同的建置選項,其中 v0.27.1 為預設版本。此版本包含適用於 SM 7.5、8.6、8.9 和 12.0 的核心,涵蓋 RTX 20/30/40/50 系列 GPU,以及 FlashAttention 2 和可選的 CPU/檔案系統提示 KV 卸載。儘管存在 Python 3.14 建置版本,但它使用 CPU TorchAudio wheel,這意味著 GPU 音訊處理和音訊模型服務未經驗證,因此 0.27.1 是核心模型推斷更經證實的選擇。
安裝設計為簡單直接,帶有可攜式腳本,可下載必要的組件,如 Python、PyTorch 和 vLLM wheel 檔案,無需預先安裝 Visual Studio 或 CUDA Toolkit。捆綁的啟動器提供一個 OpenAI 相容的 HTTP 伺服器,可實現基本的模型互動並支援從特定格式解析工具呼叫,這對於與 AI 應用程式整合可能很有用。
分享這篇文章
相關文章
6 則
阿里巴巴主席蔡崇信:開源人工智能是歐洲實現科技獨立的唯一途徑

Elon Musk 就 Starlink 印度發佈延遲問題加劇對 Ambani 的抨擊

Kurt Campbell 談美國對華焦點、印太四方安全對話、人工智能風險

Paul Stenhouse:Starlink 採取行動成為全面流動服務供應商,Anthropic 禁止濫用 Clause,Apple 宣佈「Welcome Home」活動

MegaCryptoPolis 遊戲玩法大革新:城市管理交由 AI 代理負責

