跳到正文

全部动态

今日 4 条
8月12日周三
  1. Google Research60

    Google Research 指出前沿大语言模型事实性瓶颈在于召回而非编码

    Google Research 提出知识画像,发现前沿大语言模型的许多事实错误是召回失败,而不是事实未被编码。基于 2,150 条维基事实的 WikiProfile 显示,Gemini-3-Pro 和 GPT-5 已编码 95–98% 的事实,但仍有 26–34% 无法直接召回,开启思考后失败比例为 11–12%。

    推荐理由:用知识画像同时衡量事实的编码和召回后,前沿模型的事实性短板更集中于已经写入参数却难以稳定取出的知识。

  2. Google Research67

    Google Research 推进 AMIE 实时视频问诊,模拟研究中与全科医生评分相当

    Google Research 展示基于 Gemini 与 Project Astra 的 AMIE(Video),在100个情景、300次模拟实时视频问诊中,被20名全科医生评为在病史采集、诊断准确性、处置适当性和沟通质量上与10名视频问诊全科医生相当。

    推荐理由:随机研究把AMIE视频版、纯文本版和全科医生放在同一评分框架下,从而呈现视听观察和虚拟查体的评分差异以及演员模拟边界。

8月11日周二
8月10日周一
8月6日周四
  1. Google DeepMind71

    Google DeepMind 的 WeatherNext 实现气旋预报突破,三天精度相当于以往两天

    Google DeepMind 的 WeatherNext 在 Nature 论文中显示,气旋路径、强度和风场的三天预报平均达到以往模型两天的水平。该模型用近 20TB 全球大气数据与 IBTrACS 中近 5000 场历史风暴联合训练,今年把集合规模扩至 1000 个成员,可在 TPU 上不到一分钟生成 15 天预报。

    推荐理由:三天气旋预报达到以往模型两天的水平,并开源 WeatherNext 2 与气旋模型,预报流程因此多出约一天可准备的时间。

8月4日周二
  1. Mistral AI54

    Mistral 发布 3B 开源多模态安全分类器 Shieldstral

    Mistral 以 Apache 2.0 发布 3B 开源权重多模态安全分类器 Shieldstral,把内容审核做成推理时可用自然语言政策作答的二分类问答。请求包含评估说明、是否类问题和待审内容,模型只读取 yes 与 no 的 logits,经 softmax 得到连续安全分数,同一接口覆盖提示、回复、提示与回复组合以及图像。

  2. Microsoft Research60

    微软研究院发布开源框架 Orchard,约 3B 模型在 SWE-bench Verified 达 69.7%

    微软研究院发布开源框架 Orchard,用 Kubernetes 环境服务 Orchard Env 在 Codex、OpenClaw、ZeroClaw 等真实框架中训练软件工程、网页与助手智能体。

    推荐理由:微软研究院的 Orchard 用可复用环境让智能体在真实部署框架中训练,约 3B 激活参数的开放模型因而在 SWE-bench Verified 上达到 69.7% 并在价值模型重排后升至 73.0%。

7月31日周五
7月30日周四
  1. Google DeepMind63

    Google DeepMind 发布 Gemini Robotics ER 2,强化视频理解、任务编排与多机器人协作

    Google DeepMind 今天发布 Gemini Robotics ER 2,将其作为机器人的高层具身推理模型,用于对话、理解物理世界和多步规划,再把运动执行交给下层视觉语言动作模型。

    推荐理由:新模型相对 ER 1.6 补上了连续视频中的进度判断与多机协作能力,开发者可把它接到下层动作模型来编排多步实体任务。

7月28日周二
  1. Google DeepMind69

    Gemini Robotics 2 为机器人带来全身控制、灵巧操作与多机协作

    Google DeepMind 推出 Gemini Robotics 2,把视觉和语言输入转成电机控制,让完整人形机器人和双臂机器人完成从脚到指尖的全身动作与灵巧操作。

    推荐理由:这次更新把原先的桌面上半身操作扩展到全身协调、灵巧操作和多机协作,并说明端侧模型可用数小时数据适配新机体。

7月23日周四
  1. Google Research68

    Google Research分享SymptomAI日常症状评估对话研究结果

    Google Research让13917人随机使用五种Gemini Flash 2.0 SymptomAI智能体做症状问诊和鉴别诊断。三名委员会认证临床医生盲评后,在超过50%的案例中更偏好SymptomAI的鉴别诊断,也更常判定其top-5结果包含参与者两周后报告的就医诊断;各主动追问策略均显著优于不追问的基础模型。

    推荐理由:13917人的随机研究显示,临床专家在超过50%的案例里更偏好SymptomAI的鉴别诊断,主动追问也优于不追问的基础对话。

7月22日周三
7月21日周二
7月17日周五
7月16日周四
  1. Hugging Face Blog84

    Hugging Face 披露 2026 年 7 月生产基础设施遭自主智能体入侵

    Hugging Face 本周侦测并处置了生产基础设施中由自主 AI 智能体端到端发动的入侵,对方未经授权接触了有限内部数据集和若干服务凭证;尚未发现面向用户的公开模型、数据集或 Spaces 被篡改,容器镜像与已发布软件包经验证干净,合作方或客户数据是否受影响仍在评估。

    推荐理由:这次事件给出的可迁移做法是事先在自有基础设施备好可用模型,以免托管服务护栏阻断取证或导致攻击数据与凭证外流。

7月15日周三
  1. Hugging Face Blog52

    Hume 推出 Real World VoiceEQ,衡量语音 AI 的真实人类交互质量

    Hume 发布 Real World VoiceEQ,用超过 100 万次人工评分,在 15 个以上维度和 60 多项指标上评估 40 多个专有与开源语音模型。评测覆盖自动语音识别、文字转语音、语音到语音和语音理解,目前包含 785,000 条 TTS 评分与 48,000 条 STS 评分。文字转语音中没有任何系统配置在八个能力组全部进入前五,噪声背景下的转写字错率约为音乐背景的四倍。

7月10日周五
  1. Hugging Face Blog61

    PyTorch Profiling 第三篇:如何从轨迹看懂注意力实现

    Hugging Face 的 PyTorch Profiling 系列第三篇,在 NVIDIA A100-SXM4-80GB 上用 profiler 对照了手写因果注意力和 SDPA 的 math、efficient、flash、cudnn 后端。

    推荐理由:把朴素注意力和 SDPA 四个后端放进同一套 profiler 轨迹后,可以看出融合如何避免中间分数矩阵写入显存,以及 flash 很低的占用率为何仍可能更快。

7月9日周四
7月8日周三
  1. Hugging Face Blog58

    transformers的vLLM建模后端达到原生推理速度

    transformers的vLLM建模后端现已在许多LLM架构上达到或超过手写vLLM实现的速度,模型作者可直接复用transformers代码获得高速推理。对比覆盖Qwen3-4B单GPU、Qwen3-32B的双GPU张量并行,以及Qwen3-235B-A22B-FP8在同一8×H100节点上的数据并行加专家并行,该后端吞吐均达到或超过原生实现。

7月7日周二
7月3日周五
  1. Google DeepMind50

    Google DeepMind与A24宣布研究合作,Google已投资A24

    Google DeepMind与A24今天宣布以研究为重点的同类首个合作,帮助艺术家开发新工作流和技术,Google并对A24作出投资。双方将开展跨越多个项目的深度研发,把创新放进创作过程,由A24电影人帮助塑造技术并拓展叙事可能,同时向DeepMind提供艺术家反馈。合作初期聚焦连接前沿技术与下一代娱乐,具体目标、技术产出和创作里程碑将随时间演变。

7月2日周四
7月1日周三
6月30日周二
  1. Google Research62

    Google Research 推出零样本表格基础模型 TabFM

    Google Research 推出零样本表格基础模型 TabFM,一次前向即可对未见过的表做分类和回归,无需逐表训练、调参和特征工程。它把整张表当作统一提示,用行列交替注意力、行压缩和 Transformer 做上下文学习,全部基于数亿个结构因果模型合成的数据集预训练。

    推荐理由:把表格预测改写成上下文学习之后,读者可以对照传统树模型流程判断单次前向能否省掉调参和特征工程。

6月25日周四
  1. Google Research54

    推理如何解锁大语言模型中的参数知识

    Google Research发现,开启推理能让模型召回简单单跳问题上关闭推理时几乎无法得到的事实,机制是计算缓冲和factual priming。对Gemini-2.5 Flash、Pro与Qwen3-32B,等长重复Let me think已明显好于关闭推理,但始终不能完全赶上自然轨迹;相关事实即使在推理关闭时也能挽回大部分增益。

  2. Google DeepMind72

    Gemini 3.5 Flash 内置计算机使用以构建跨平台智能体

    计算机使用现已成为 Gemini 3.5 Flash 的内置工具,开发者可构建在浏览器、移动端和桌面中观察、推理并执行操作的自定义智能体。

    推荐理由:原先独立的Gemini 2.5计算机使用模型已并入Gemini 3.5 Flash,开发者可据此构建跨端长程自动化智能体,并选用操作确认与注入拦截。

6月23日周二
  1. Mistral AI65

    Mistral 发布 OCR 4,支持边界框、块分类与 170 种语言

    Mistral 发布 Mistral OCR 4,在提取文本之外返回边界框、类型化块分类和行内置信度,支持 10 个语系共 170 种语言,并可在单个容器中完全自托管。

    推荐理由:官方说明 Mistral OCR 4 在文本之外返回边界框、块分类和置信度,并公布人工评测胜率与基准分数,便于评估其进入检索和自托管流水线的条件。

6月13日周六