インデックスへスキップ

vLLM

vLLM Project

オープンソースAIプラットフォーム 第 2 位

現代の LLM サービスを支えるオープンソース推論エンジン。PagedAttention が最先端のスループットを実現し、OpenAI 互換 API と幅広いモデル対応で自分の GPU 上で動きます。

プロダクトプレビュー

vllm.ai
vLLM のプレビュー

詳細レビュー

vLLM はオープン LLM サービスの静かなデフォルトです。KV キャッシュを OS が RAM を扱うように管理する PagedAttention は、登場時にスループットを段階的に引き上げ、今も他エンジンが追う基準です。自分のハードウェアで OpenAI 互換サーバーを起動し、既存の OpenAI SDK を向け直せば、同じアプリケーションコードが Llama・Qwen・Mistral など数百のアーキテクチャをサービスします。

プロダクトではなくインフラです。GPU・キャパシティ計画・運用は持ち込み前提。それでもコンティニュアスバッチング、テンソル並列、量子化対応、「vLLM 互換」エンドポイントを多数のクラウドが提供する状況を考えれば、セルフホストで最も後悔しない選択であり、業界全体のトークン単価が下がり続ける理由でもあります。

長所 / 短所

長所

  • 最高水準のスループットとメモリ効率
  • 既存コードへそのまま差し込める OpenAI 互換
  • モデル・ハードウェア対応が広大
  • 無料・OSS・コミュニティ検証済み

短所

  • GPU・スケール・運用は自己負担
  • GUI なし — API ファーストのインフラ
  • 最適性能はモデル別チューニングが必要

こんな人におすすめ

01

プライバシー・コスト目的のオープンモデル自ホスト

02

保有 GPU での大規模バッチ推論

03

社内 LLM ゲートウェイの基盤

04

再現可能なスタックでの研究提供

総評

実規模でオープンモデルを提供するなら、vLLM を使うかどうかではなく、どうチューニングするかが問いです。

主な機能

PagedAttention による高スループット
OpenAI 互換サーバー
コンティニュアスバッチング
幅広いモデル対応
マルチ GPU と量子化

タグ

推論オープンソースセルフホスト

vLLM と代替ツールの比較

よくある質問

vLLM とは?

vLLM は vLLM Project が開発したAIプラットフォームツールです。同社は 2023 年に設立され、本社はオープンソースコミュニティにあります。現代の LLM サービスを支えるオープンソース推論エンジン。PagedAttention が最先端のスループットを実現し、OpenAI 互換 API と幅広いモデル対応で自分の GPU 上で動きます。

vLLM は無料ですか?

はい——vLLM は無料で利用できます。

vLLM はオープンソースですか?

はい——vLLM はオープンソースです。ソースコードは https://github.com/vllm-project/vllm で公開されています。

vLLM のおすすめの代替ツールは?

注目のAIプラットフォーム代替ツールには Hugging Face、Replicate、Ollama などがあります。カテゴリーページで全 4 件のツールをご覧ください。

このページは役に立ちましたか?

公式サイトへソースを見る

基本情報

料金
無料
評価
4.8 (3,100 件のレビュー) 評価の説明
プラットフォーム
Self-hostedAPI
設立年
2023
本社
オープンソースコミュニティ
最終検証日
2026-09-08