量子化

AI・機械学習

INT8・INT4量子化で精度はどう変わる?FashionMNIST 1万枚でfake quantization

実験日: 2026-08-24環境: RTX 5070 Ti / WSL2 / PyTorch 2.13.0+cu130量子化はmodelを小さく高速にできる手法として紹介されます。しかし「4 bitならFP32の1/8」という容量計算だけ...
AI・機械学習

Q4とQ8はどちらを選ぶ?Gemma 3 4Bを容量・VRAM・速度・96回答で比較

実験日: 2026-08-24GPU: RTX 5070 Ti 16GB / WSL2 / Ollama 0.32.15同じ4Bモデルでも、OllamaにはQ4、Q8、FP16など複数の量子化variantがあります。数字が大きいQ8を選べ...
AI・機械学習

VRAM 16GBでローカルLLMは何Bまで動く?Ollamaの4B・8B・12Bを実測

実験日: 2026-08-24GPU: NVIDIA GeForce RTX 5070 Ti 16GB / WSL2 Ubuntu / Ollama 0.32.15「VRAM 16GBなら何BのLLMまで動かせるのか」を、モデルファイルの容...