Heaps do lie:vLLMメモリーリークの調査
Mistral AIはMedium 3.1のPrefill/Decode分離配置でvLLMのメモリーリークを調査した。システムメモリーが毎分400MB増え、数時間で不足する。グラフコンパイルを有効化しNIXLでKVCacheを送るdecode側だけに現れた。Heaptrackではヒープが安定しており、問題はヒープ外にあった。
Mistral AIはMedium 3.1のPrefill/Decode分離配置でvLLMのメモリーリークを調査した。システムメモリーが毎分400MB増え、数時間で不足する。グラフコンパイルを有効化しNIXLでKVCacheを送るdecode側だけに現れた。Heaptrackではヒープが安定しており、問題はヒープ外にあった。
MistralはLoRAでPixtral-12Bを微調整し、Aerial Image Dataset(AID)の衛星画像分類で未調整の基準を大きく上回り、幻覚による無効な分類名を減らした。Mistralの微調整APIかLaPlateforme UIを使い、大規模なハイパーパラメーター調整は不要だ。学習8000、テスト2000に分割した。
Mistralはjudge LLMがgenerator LLMの回答を数値、二値、定性的尺度で採点し、評価データの加重平均を取るRAG評価を提案した。