Hugging Face Blog·· 2026-07-06
PRX第4部:データ戦略
PRX Part 4: Our Data Strategy
AI による要約
Hugging FaceはPRXシリーズ第4部でデータ戦略を詳述した。公開・内部データを混ぜ、VLMで画像の長い説明を再生成し、ストリーミング学習用に変換する。Lanceで構築・選別、MDSでストリーミング学習を行う。Qwen3-VLへの変更後は学習中に文字のlatentを計算し、実測の処理量低下は約3~4%で、30日の学習が約1日延びる。
入選の記録
基準 60公式・一次情報1 回目 342 回目 34
入選せず二回の合計 68 < 基準の 2 倍 120
- 情報源の区分
- 公式・一次情報、この区分の基準は 60 点
- 予備審査
- 通過:详述AI模型PRX数据策略与训练
採点はモデルが同じ基準で独立に二回行い、満点は 100。二回の合計が基準の 2 倍に届いたものだけが入選します。基準は情報源の区分ごとに決めています。
情報源:Hugging Face Blog · huggingface.co