Google Research、RLを拡散モデルに編み込むRetrieve-for-Trainで検索クエリー展開を高速化
Google ResearchはRetrieve-for-Trainを提案した。オフライン強化学習で報酬に沿うクエリー展開を見つけ、教師信号に変えて53.9Mの拡散検索器へ蒸留する。推論時は1回の非自己回帰でクエリーを展開し、CoT推論トークンを生成しない。
Google ResearchはRetrieve-for-Trainを提案した。オフライン強化学習で報酬に沿うクエリー展開を見つけ、教師信号に変えて53.9Mの拡散検索器へ蒸留する。推論時は1回の非自己回帰でクエリーを展開し、CoT推論トークンを生成しない。
GoogleとCornellはGPT-4o、Perplexity、Claude 3.5、Gemini Advanced Pro 1.5、NotebookLM、独自RAGに高温超伝導の専門問題67問を解かせた。12人の国際専門家がバランス、網羅性、簡潔性、証拠、画像の関連性、定性的意見の6指標で盲検評価した。研究はPNASに掲載された。