绕过推理瓶颈:Retrieve-for-Train 加速复杂 AI 搜索
Google Research的Retrieve-for-Train将查询扇出蒸馏为53.9M扩散检索器,单次推理免去思考token。框架以集合级奖励对Gemma3-4B与Qwen3-4B做离线RL微调,并由冻结模型合成无需人工标注的监督数据。扩散检索器以一次非自回归前向,把查询嵌入直接映射为完整目标嵌入集合。
Google Research的Retrieve-for-Train将查询扇出蒸馏为53.9M扩散检索器,单次推理免去思考token。框架以集合级奖励对Gemma3-4B与Qwen3-4B做离线RL微调,并由冻结模型合成无需人工标注的监督数据。扩散检索器以一次非自回归前向,把查询嵌入直接映射为完整目标嵌入集合。
Sentence Transformers v6.0 的 MultiVectorEncoder 可用于训练和微调 ColBERT 式多向量嵌入模型。
推荐理由:原文整理了用领域问答对微调多向量检索模型的训练组件,并比较无监督检查点与成品检查点在医学数据上的适应差异。
Hugging Face 说明如何用 Jobs、Storage Buckets 和 Inference Endpoints 支撑 Papers with Code 的混合搜索:离线批量生成论文向量,在线只嵌入查询,端点冷启动或异常时回退全文检索。
Mistral推出Agentic Search,让模型通过search、open、navigate、read和grep五个工具,在现有索引上多步查找、打开并核对长文档与多来源信息。
推荐理由:Mistral把一次取块改成可导航核对的多步检索,使FinanceBench正确率从26.7%升至86%并降低延迟与token。
Sentence Transformers v6.0 新增 MultiVectorEncoder,以 ColBERT 式晚交互为每个 token 保留向量,并用 MaxSim 为查询与文档打分。
推荐理由:这篇官方教程把多向量晚交互和单向量嵌入的质量与索引成本放在一起比较,并写清编码、打分、检索重排和压缩索引的具体做法。
Mistral 发布 Mistral OCR 4,在提取文本之外返回边界框、类型化块分类和行内置信度,支持 10 个语系共 170 种语言,并可在单个容器中完全自托管。
推荐理由:官方说明 Mistral OCR 4 在文本之外返回边界框、块分类和置信度,并公布人工评测胜率与基准分数,便于评估其进入检索和自托管流水线的条件。
Mistral AI 今日以公开预览发布开源 Search Toolkit,把数据接入、检索和评测统一为面向 AI 应用的生产级搜索管线。检索支持 BM25 稀疏检索、稠密嵌入检索和混合配置,评测内置召回率、精确率、MRR 与 NDCG,可在自有测试集上对比配置。框架可在云端、本地或边缘运行;CMA CGM 将其与 Voxtral 配合处理三个音频来源,并在 15 秒内端到端返回预警。
推荐理由:它把文档接入、混合检索和内置评测收进同一开源框架,便于团队在自有数据上单独比较检索配置并衡量质量。
Google 扩展 Search、Gemini、Chrome、Pixel 与 Cloud 的内容透明度与核验工具,帮助用户了解网上内容如何被创建和编辑。
推荐理由:Google 把 SynthID 与内容凭证核验扩到搜索、浏览器和手机,并在云端提供检测接口,方便分辨模型生成内容与相机拍摄原片。
Google DeepMind 发布 Gemini 3.5 模型家族,并开放 Gemini 3.5 Flash,使其成为全球 Gemini 应用和 Google 搜索 AI Mode 的默认模型,同时进入 Google Antigravity、Gemini API 及企业平台。
推荐理由:3.5 Flash已同时向用户、开发者和企业开放,智能体与编码基准超过Gemini 3.1 Pro,可比较其速度和落地范围。