Bypassing inference bottlenecks: Accelerating complex AI search with Retrieve-for-Train
Google Research proposed Retrieve-for-Train, using offline reinforcement learning to find reward-aligned query fan-out and compile it into supervision, then distilling it into a 53.9M-parameter diffusion retriever. At inference, it performs one non-autoregressive query fan-out without generating CoT reasoning tokens.