本文へ

Qwen3.8-27Bとは?性能・必要VRAM・ローカル実行・商用利用を解説

公開日 2026年8月15日|Qwen3.8-27Bの導入を検討する開発者・AI担当者向け

Qwen3.8-27Bは、Qwenチームが公開した270億パラメータの高密度(dense)モデルです。テキストだけでなく画像・動画を標準で扱い、コーディング、調査、専門業務、長時間のエージェント実行を一つのモデルで担えるよう設計されています。ネイティブのコンテキスト長は262,144トークンで、公式にはYaRNによって最大100万トークンまで拡張可能とされています。ライセンスはApache 2.0です。

結論からいえば、Qwen3.8-27Bは「小型PCで気軽に動かすモデル」より、1台の大容量GPUや複数GPU、またはGPUクラウドで本格運用するモデルです。4bit量子化なら24GB級の環境も検討できますが、長いコンテキストや画像・動画を扱う実運用では余裕のあるメモリ構成が必要です。

Qwen3.8-27Bの基本スペック

項目 公式仕様
モデル形式 Vision Encoder付きCausal Language Model
パラメータ数 27B(dense)
層数 64層
隠れ次元 5,120
コンテキスト長 262,144トークン(ネイティブ)、最大1,000,000トークンへ拡張可能
入力 テキスト、画像、動画
推論制御 reasoning_effort = xhigh / medium / low
ライセンス Apache License 2.0

仕様の一次情報は Hugging Faceの公式モデルカードconfig.json で確認できます。

Qwen3.8-27Bの主な特徴

1. 画像・動画を扱えるネイティブVLM

Qwen3.8-27Bは、テキストモデルに後付けの画像アダプターを載せた構成ではなく、Vision Encoderを含むマルチモーダルモデルです。図表、文書、STEM問題、実世界の画像に加え、長時間動画の理解も想定されています。画像付きの社内文書検索、画面操作エージェント、動画レビューなど、テキスト専用LLMでは分割しがちな処理を一本化しやすいのが強みです。

2. 262Kの長文脈と最大1Mへの拡張

ネイティブで262,144トークンを扱えるため、大規模なコードベース、長い契約書、複数資料をまたぐ調査に向きます。100万トークンはYaRNによる拡張であり、標準状態の保証値と同じではありません。長文脈化するとKVキャッシュと計算量も増えるため、「最大値を設定できること」と「低コストで常用できること」は分けて判断してください。

3. ThinkingとInstructをリクエストごとに切り替え

Thinkingモードは既定で有効です。複雑な計画や調査では reasoning_effort=xhigh、速度と品質のバランスには medium、軽い応答には low を選べます。直接回答が欲しい場合はThinking自体を無効化できます。過去ターンの思考コンテキストを保持する preserve_thinking も既定で有効なため、長時間エージェントで判断の一貫性を保ちやすい設計です。

性能は?公式ベンチマークの読み方

公式モデルカードでは、前世代のQwen3.6-27Bに対し、SWE-bench Proが61.7対53.5、LiveCodeBench v6が90.3対83.9、OSWorld-Verifiedが84.3対63.9、WebArena-Verifiedが64.8対48.8と報告されています。文書理解のOmniDocBench 1.5は91.1です。特にコーディングだけでなく、PC操作やブラウザー操作を含むエージェント用途の改善が目立ちます。

ただし、これらは公式評価であり、すべてが第三者による再現結果ではありません。SWE-bench Proなどは特定のハーネス、温度、256Kコンテキストで評価されています。自社データ、利用言語、ツール構成、応答時間を含む小規模な受け入れ試験を行ってから採用するのが安全です。

Qwen3.8-27Bに必要なVRAMの目安

精度・量子化 重みだけの概算 実運用の目安
BF16 / FP16 約54GB 80GB級GPU、または複数GPUを推奨
8bit 約27GB 32〜48GB以上。長文脈ではさらに必要
4bit 約13.5GB 24GB以上が現実的な出発点

概算は27Bパラメータに1パラメータあたりの保存ビット数を掛けた理論値です。実際にはVision Encoder、KVキャッシュ、ランタイムの作業領域、量子化メタデータが加わります。262Kコンテキストや動画を使う場合、表の下限だけを見てGPUを選ばないでください。スループットを求める本番配信では、モデルが載るかではなく、必要な同時実行数と応答時間を満たすかで決めます。

ローカル実行と本番配信

公式は、API利用を最も簡単な導入方法として案内し、自己ホストでは最新版のSGLang、vLLM、TokenSpeedを推奨しています。公開直後の新アーキテクチャは古い推論エンジンで読み込めないことがあるため、各エンジンのQwen3.8-27B専用レシピを使ってください。

Macや一般的な24GB GPUで試す場合は4bit量子化が候補ですが、公式の配布物、変換ツールの対応状況、チャットテンプレート、画像・動画入力の互換性を確認する必要があります。テキスト生成だけ動いても、Thinking制御やVision入力まで同じとは限りません。

商用利用はできる?

モデルリポジトリはApache License 2.0で公開されており、ライセンス条件を守れば商用利用、改変、再配布が可能です。著作権表示とライセンス文の保持、変更点の明示、商標を別途確認することが基本です。モデル出力の利用可否や個人情報・著作権・業界規制への適合は用途ごとに判断してください。

Qwen3.8-27Bが向いている用途

  • 開発エージェント — 大規模コードとツール操作をまたぐ修正・調査
  • 文書・図表解析 — PDF、表、チャート、画面キャプチャを含む業務文書
  • ブラウザー/PC操作 — 画面認識と長い手順を組み合わせるエージェント
  • 長時間の調査 — 多数の資料と途中経過を保持するリサーチワークフロー
  • 動画理解 — 長時間映像の検索、要約、監査補助

一方、単純な分類や短いチャット、16GB以下の端末での常用、最小レイテンシが最優先の処理には、より小さいモデルの方が費用対効果に優れます。27Bを選ぶ理由が「新しいから」だけなら、まず小型モデルとのA/B評価を行うべきです。

よくある質問

Qwen3.8-27Bは日本語に対応していますか?

日本語を含む多言語入力は扱えますが、公式モデルカードは日本語だけの品質指標を提示していません。敬語、固有名詞、社内文書、OCRを含む自社タスクで評価してください。

Qwen3.8-27BはノートPCで動きますか?

量子化と対応ランタイムが揃えば動作する可能性はありますが、27BのVLMなのでメモリと速度の制約が大きくなります。快適な実用を目的にするなら24GB以上の統合メモリ/VRAMを出発点とし、長文脈や動画はGPUサーバーを検討してください。

Qwen3.8-27BとQwen3.6-27Bの違いは?

同じ27Bクラスでも、Qwen3.8はコーディング、専門業務、調査、長時間エージェント、Vision理解を強化しています。公式評価では、特にOSWorld-VerifiedやWebArena-Verifiedなど操作系タスクの伸びが大きく報告されています。

murakumo.cloudですぐ使えますか?

はい。OpenAI互換APIではモデルID qwen3.8-27b を指定して利用できます。murakumo.cloudではQ4_K_M量子化とBF16画像projectorを配信し、現在のコンテキスト上限は安定運用のため32,768トークンです。利用方法と検証状態は APIドキュメント配信モデルAPI を確認してください。

まとめ

Qwen3.8-27Bは、27B denseの扱いやすい規模に、262K長文脈、画像・動画理解、Thinking制御、エージェント性能をまとめた高機能なオープンウェイトモデルです。強みを引き出すには十分なVRAMと新しい推論エンジンが必要です。導入時は、公式ベンチマークだけで決めず、自社の日本語データ、最大コンテキスト、Vision入力、同時実行数を含む評価を行ってください。

本記事は2026年8月15日時点の公式モデルカードと設定ファイルを基にしています。VRAMは重みだけの理論値から見積もった目安で、実際の必要量は推論エンジン、量子化、入力画像・動画、コンテキスト長、同時実行数で増減します。murakumo.cloudの最新配信モデルはGET /api/v1/modelsで確認してください。