# Gemma 4 26B を win-GPU(RTX3080/10GB) で実機検証 → 採用見送り(NO-GO)
> Issue yoshida-jun/claude-base#95 の実測結果。元ネタ: [[Gemma 4 26B ローカル10並列エージェント(X学習 2026-06-18)]](@shodaiiiiii)
## 実測環境
- win (100.68.221.74) / RTX3080 **VRAM 10GB** / RAM 31.8GB / Ollama 0.30.7
- `ollama pull gemma4:26b`(16.75GB・取得成功)
## 実測値(同一プロンプト・num_predict=200)
| 項目 | gemma4:26b | gemma4:12b(現行) |
|------|-----------|------------------|
| GPU/CPU配置(`ollama ps`) | **62%CPU / 38%GPU** | **100% GPU** |
| 生成速度 | **22.2 tok/s** | **56.4 tok/s** |
| プロンプト処理 | 17.5 tok/s | — |
| 初回ロード | 73.3s | 31.1s |
| 2並列アグリゲート | 16.4 tok/s | — |
| 4並列アグリゲート | 20.0 tok/s(**単発を超えない=頭打ち**) | — |
## 結論: 採用見送り(NO-GO)
- **VRAM 10GB に 18GB(実効)の26Bは乗り切らず62%がCPUオフロード** → CPUがボトルネック化し22.2 tok/sに低下
- **12B(100%GPU)の方が2.5倍速い(56.4 tok/s)**。26Bを使う速度的メリットがRTX3080では無い
- **並列の旨味が出ない**: CPUオフロード状態では2/4並列でもアグリゲートが単発を超えない。10並列は空きRAM不足(検証時5.3GB)で確実にスワップ死 → 試行せず(無駄なリスク回避)
- 投稿の「100+tok/s・10並列」は **26Bを全VRAMに乗せられる上位GPU環境(24GB+級)前提**。RTX3080(10GB)では再現不可
## fusion_local.py への反映方針
- **`resolve_google()` の 26B 格上げは見送り**。現状の `gemma4:12b`(win-GPU・100%GPU・56tok/s) を Google系パネルとして維持が最適
- 26B採用の再評価GO条件: **VRAM 24GB+ のGPU**(RTX3090/4090/A5000等)を win or 別ホストに用意できた時のみ
- gemma4:26b のモデルは取得済みで残置(将来GPU増強時に即評価可能・ディスク480GB空きで負担小)
## 教訓(instinct)
- ローカルLLMの「Xでバズった100+tok/s」は**投稿者のGPU VRAMに全乗せできた前提**。VRAMにモデルが収まるか(`ollama ps`の%GPU)を最初に見れば速度は事前予測できる
- VRAM 10GB級では **12B(8GB)が100%GPUで乗る上限**。それ以上は量子化してもCPUオフロードで急減速
## 関連
- [[multi-model-routing]] fusion_local.py / win-GPU動的フォールバック
- [[feedback-no-chinese-apis]](26Bもqwen系も…26Bは非中華で問題なし・速度都合で見送り)
Gemma 4 26B win-GPU実機検証 結果(NO-GO・2026-06-18)