绕过推理瓶颈:Retrieve-for-Train 加速复杂 AI 搜索
Google Research的Retrieve-for-Train将查询扇出蒸馏为53.9M扩散检索器,单次推理免去思考token。框架以集合级奖励对Gemma3-4B与Qwen3-4B做离线RL微调,并由冻结模型合成无需人工标注的监督数据。扩散检索器以一次非自回归前向,把查询嵌入直接映射为完整目标嵌入集合。
Google Research的Retrieve-for-Train将查询扇出蒸馏为53.9M扩散检索器,单次推理免去思考token。框架以集合级奖励对Gemma3-4B与Qwen3-4B做离线RL微调,并由冻结模型合成无需人工标注的监督数据。扩散检索器以一次非自回归前向,把查询嵌入直接映射为完整目标嵌入集合。