AI・機械学習 INT8・INT4量子化で精度はどう変わる?FashionMNIST 1万枚でfake quantization 実験日: 2026-08-24環境: RTX 5070 Ti / WSL2 / PyTorch 2.13.0+cu130量子化はmodelを小さく高速にできる手法として紹介されます。しかし「4 bitならFP32の1/8」という容量計算だけ... 2026.08.24 AI・機械学習
AI・機械学習 Q4とQ8はどちらを選ぶ?Gemma 3 4Bを容量・VRAM・速度・96回答で比較 実験日: 2026-08-24GPU: RTX 5070 Ti 16GB / WSL2 / Ollama 0.32.15同じ4Bモデルでも、OllamaにはQ4、Q8、FP16など複数の量子化variantがあります。数字が大きいQ8を選べ... 2026.08.24 AI・機械学習
AI・機械学習 VRAM 16GBでローカルLLMは何Bまで動く?Ollamaの4B・8B・12Bを実測 実験日: 2026-08-24GPU: NVIDIA GeForce RTX 5070 Ti 16GB / WSL2 Ubuntu / Ollama 0.32.15「VRAM 16GBなら何BのLLMまで動かせるのか」を、モデルファイルの容... 2026.08.24 AI・機械学習