yuyuyu

English

Is PyTorch waiting for data? Comparing DataLoader workers with torch.profiler

Increasing DataLoader workers made this FashionMNIST training loop faster. I used torch.profiler to see where the time w...
English

ONNX INT8 quantization made this CNN smaller—but slower on the CPU

I converted a FashionMNIST CNN to INT8 with ONNX Runtime and ran it on the CPU. The model file became about 72% smaller,...
English

HOG + SVM versus a small CNN on FashionMNIST: accuracy, runtime and different mistakes

HOG features with a linear SVM reached 88.85% accuracy on FashionMNIST, ahead of 87.00% for a small CNN trained for thre...
AI・機械学習

ONNXのCNNを実際にINT8量子化したら速くなる?精度・容量・CPU推論を比較

English version重みを丸める実験に続いて、今度はONNX RuntimeでINT8のモデルを作り、CPUで実行しました。ファイルは約72%小さくなりましたが、推論は試した3種類のバッチサイズすべてで遅くなりました。正解率は86...
AI・機械学習

PyTorch学習が遅いのはDataLoaderかGPUか?profilerで待ち時間を切り分ける

English versionDataLoaderの並列数を変えると学習が速くなったので、torch.profilerで処理の内訳を見ました。画像に切り抜きと回転を加えた条件では、num_workers=0の学習ループは次の画像群を受け取る...
AI・機械学習

NV-Tesseractは株価を当てられる?ソニー・トヨタなど5銘柄とUSD/JPYで検証

実験機: Core i7-14700F、RTX 5070 Ti 16 GB、RAM 32 GB環境: Windows 11、WSL 2、Ubuntu 26.04 LTS、Python 3.12.14、PyTorch 2.12.1+cu130...
AI・機械学習

NV-TesseractはWSL2+RTX 5070 Tiで動く?時系列予測と異常検知を実測

実験機: Core i7-14700F、RTX 5070 Ti 16 GB、RAM 32 GB環境: Windows 11、WSL 2、Ubuntu 26.04 LTS、Python 3.12.14、PyTorch 2.12.1+cu130...
AI・機械学習

RTX 5070 Tiでローカル画像生成:SD-Turboを1・2・4・8 stepで実測

環境: RTX 5070 Ti 16GB / WSL2 / PyTorch 2.13.0+cu130 / Diffusers 0.40.0SD-TurboをRTX 5070 Tiで動かしました。512×512画像の生成は、読み込みとウォーム...
AI・機械学習

INT8・INT4量子化で精度はどう変わる?FashionMNIST 1万枚でfake quantization

環境: RTX 5070 Ti / WSL2 / PyTorch 2.13.0+cu130FashionMNISTのCNNの重みをINT8・INT4相当に丸め、予測がどれくらい変わるか調べました。INT4では、層全体を同じ縮尺で丸めると正解...
AI・機械学習

PyTorchをONNXへ変換して本当に同じ?FashionMNIST 1万枚と速度を実測

環境: RTX 5070 Ti / WSL2 / PyTorch 2.13.0+cu130 / ONNX 1.22.0 / ONNX Runtime 1.29.0FashionMNISTのCNNをONNXへ変換し、PyTorchとONNX ...