VRAM

AI・機械学習

Ollamaのcontext 4K・8K・16Kで何が変わる?長文検索・待ち時間・VRAMを実測

GPU: RTX 5070 Ti 16GB / WSL2 / Ollama 0.32.15Model: Gemma 3 4B Q4_K_MGemma 3 4Bに長い架空の研究ログを渡し、その中へ埋めた文字列を探させました。Ollamaのコン...
AI・機械学習

Q4とQ8はどちらを選ぶ?Gemma 3 4Bを容量・VRAM・速度・96回答で比較

GPU: RTX 5070 Ti 16GB / WSL2 / Ollama 0.32.15Gemma 3 4BのQ4_K_MとQ8_0を、同じPCで動かして比べました。Q8にするとGPU使用量が約1.5 GiB増え、生成速度は180.6から...
AI・機械学習

VRAM 16GBでローカルLLMは何Bまで動く?Ollamaの4B・8B・12Bを実測

GPU: NVIDIA GeForce RTX 5070 Ti 16GB / WSL2 Ubuntu / Ollama 0.32.15RTX 5070 Tiの16 GBで、Gemma 3 4B、Qwen 3 8B、Gemma 3 12Bを動...
AI・機械学習

batch sizeは大きいほど速い?RTX 5070 Tiでthroughput・VRAM・CUDA OOMまで実測

PyTorch 2.13.0+cu130GPU: RTX 5070 Ti 16 GB / WSL2 Ubuntu 26.04FashionMNISTのCNNで、一度に学習させる画像の枚数を32枚から8192枚まで増やしました。速くなったのは...