OpenAI 迈向前沿 AI 训练的安全论证
OpenAI 提出面向前沿 AI 训练安全论证的早期指南,覆盖技术防护措施、运营实践和错位事件调查。
OpenAI 提出面向前沿 AI 训练安全论证的早期指南,覆盖技术防护措施、运营实践和错位事件调查。
Amazon EKS结合EFA与DeepEP扩展MoE强化学习训练,吞吐量提升40%。该方案面向RLHF与GRPO,协调rollout生成和策略训练,并由DeepEP优化EFA上的Expert Parallelism通信。MoE更稀疏后训练更受跨节点通信而非计算制约,还需同时平衡加速器算力、内存与网络带宽。
Cloudera 与 Mistral 合作,将模型接入其混合数据平台,支持在私有云、公有云、本地和完全隔离环境中受控运行推理。企业可在受控环境用大量专有数据训练定制模型,并保有数据与所得智能的所有权。Mistral 将主权 AI 带到该平台 30 exabytes 客户自管数据上,模型可基于开放权重适配并拥有。
Google DeepMind与Google Research发布WeatherNext 3,可每小时生成最高5公里分辨率的全球天气预报。相较25公里网格、6小时更新的WeatherNext 2,新模型的全球天气画面约锐利5倍;中期预报早期时效的CRPS相对IMERG最高改善60%,相对MRMS为30%,相对雨量计为10%。
推荐理由:WeatherNext 3将WeatherNext 2的25公里、6小时改为5公里与每小时更新,并接入Search、Gemini和Maps。
作者用TRL与OpenEnv复现Surya Narreddi的思路,训练编码模型编写JavaScript,经p5.brush绘制水彩,并在Hugging Face公开参考池、RL环境、训练脚本和模型。
用TRL的GRPO以约500条样本和100步微调LFM2.5-350M,IFStruct通过率从22.6%升至29.7%。JSON通过率从18.0%升至31.9%,顶层裸列表从16.6%升至29.7%,YAML从27.2%到27.5%几乎不变,仍低于Qwen3.5-2B的33.15%。
Google 的 MAPL-EMIT 用深度学习处理 EMIT 高光谱数据,自动检测并定位全球甲烷点源。专家标注羽流召回率达84%,信噪比高于匹配滤波增强方法,训练数据为3.6 million条合成羽流。全球羽流数据库已放上Earth Engine,训练模型与合成羽流在Kaggle,推理库在Github。
Google Research 推出时间序列基础模型 TimesFM-3,参数量为 330 million,预训练数据超过 1 万亿个时间点,可在单次前向中零样本联合预测多条序列。
Google Research 在 Google Earth AI 中介绍实验性行星预测引擎 PPE,可根据自然语言查询自动完成地理空间数据发现、整理、训练、评估并生成报告,把含人工数据工程的建模时间从数周缩到数分钟。
Sentence Transformers v6.0 的 MultiVectorEncoder 可用于训练和微调 ColBERT 式多向量嵌入模型。
推荐理由:原文整理了用领域问答对微调多向量检索模型的训练组件,并比较无监督检查点与成品检查点在医学数据上的适应差异。
Granite 4.2从Granite-4.1基座出发,经监督微调和多阶段GRPO强化学习,得到3B、8B、30B三款稠密仅解码器推理模型。监督微调约用7.2 million条样本(约100B token,其中约65B可训练);基座则以约15T token分五阶段从零预训练,并把上下文扩到512K。
推荐理由:技术文按监督微调、GRPO与分阶段课程写清Granite 4.2的训练路径,并写明只有8B和30B做真实环境里的智能体训练。
Google Research 提出知识画像,发现前沿大语言模型的许多事实错误是召回失败,而不是事实未被编码。基于 2,150 条维基事实的 WikiProfile 显示,Gemini-3-Pro 和 GPT-5 已编码 95–98% 的事实,但仍有 26–34% 无法直接召回,开启思考后失败比例为 11–12%。
推荐理由:用知识画像同时衡量事实的编码和召回后,前沿模型的事实性短板更集中于已经写入参数却难以稳定取出的知识。
Mistral 以 Apache 2.0 发布 3B 开源权重多模态安全分类器 Shieldstral,把内容审核做成推理时可用自然语言政策作答的二分类问答。请求包含评估说明、是否类问题和待审内容,模型只读取 yes 与 no 的 logits,经 softmax 得到连续安全分数,同一接口覆盖提示、回复、提示与回复组合以及图像。
微软研究院构建 Echoverse,用十个深度领域世界和两个能力世界训练计算机使用智能体。在全部十二个世界上训练后,Qwen3.5-9B 的平均分从 36.5% 升至 67.1%,距 GPT-5.4 的 80.7% 约十四个百分点。
Google Research 提出大型传感器基础模型 SensorFM,用五百万名同意参与者超过一万亿分钟的无标签多模态可穿戴信号学习可复用生理表征。
Mistral 发布 8B 模型 Robostral Navigate,仅凭单目 RGB 相机和自然语言指令让机器人自主导航,在 R2R-CE 验证集未见环境达到 76.6% 成功率。
Google Research 推出零样本表格基础模型 TabFM,一次前向即可对未见过的表做分类和回归,无需逐表训练、调参和特征工程。它把整张表当作统一提示,用行列交替注意力、行压缩和 Transformer 做上下文学习,全部基于数亿个结构因果模型合成的数据集预训练。
推荐理由:把表格预测改写成上下文学习之后,读者可以对照传统树模型流程判断单次前向能否省掉调参和特征工程。