跳到正文

全部动态

今日 0 条
8月25日周二
  1. Hugging Face Blog68

    IBM Granite 4.2推理模型如何构建

    Granite 4.2从Granite-4.1基座出发,经监督微调和多阶段GRPO强化学习,得到3B、8B、30B三款稠密仅解码器推理模型。监督微调约用7.2 million条样本(约100B token,其中约65B可训练);基座则以约15T token分五阶段从零预训练,并把上下文扩到512K。

    推荐理由:技术文按监督微调、GRPO与分阶段课程写清Granite 4.2的训练路径,并写明只有8B和30B做真实环境里的智能体训练。

  2. Mistral AI47

    Mistral 与 HUMAIN 宣布战略合作,推进沙特及中东主权 AI

    Mistral 与 HUMAIN 宣布战略合作,在沙特及中东推进主权 AI。合作覆盖 AI 基础设施、先进模型开发与解决方案部署,初期聚焦网络安全和语音,并计划开发阿拉伯语表现强劲的前沿模型,规模达数亿欧元。Mistral 将探索使用 HUMAIN 数据中心,双方还计划面向沙特受监管行业制定联合市场策略。

8月21日周五
8月20日周四
8月19日周三
  1. Hugging Face Blog52

    ALTK-Evolve探讨智能体实际需要多少记忆

    ALTK-Evolve在AppWorld test_normal上对照八个模型发现,自蒸馏记忆的合适剂量取决于模型能力。强模型DeepSeek-V3.2注入全量指南后TGC提升9.5个百分点,弱模型gpt-oss-120b用精选检索提升16.1个百分点且token仅增5%,饱和模型GLM-5增益为0。这些指南从智能体过往轨迹蒸馏,推理时注入,不更新模型权重,也不需要人工标注。

8月18日周二
  1. Hugging Face Blog70

    Sentence Transformers v6.0 如何使用多向量晚交互嵌入

    Sentence Transformers v6.0 新增 MultiVectorEncoder,以 ColBERT 式晚交互为每个 token 保留向量,并用 MaxSim 为查询与文档打分。

    推荐理由:这篇官方教程把多向量晚交互和单向量嵌入的质量与索引成本放在一起比较,并写清编码、打分、检索重排和压缩索引的具体做法。

8月14日周五
  1. Hugging Face Blog74

    Hugging Face 的 2026 年夏季开源模型现状观察

    Hugging Face 基于 2026 年 1 月至 8 月的 Hub 活动写道,开源模型的点赞热度与下载采用几乎不重合,Qwen 已成为社区衍生数量领先的基础模型之一。

    推荐理由:报告用下载量、点赞和衍生仓库对照社区关注与实际采用,说明覆盖多种尺寸的模型家族比只推超大前沿模型更容易进入开发者的日常工作流。

8月13日周四
  1. Hugging Face Blog76

    Hugging Face 从复现 2226 篇 ICML 2026 论文中学到了什么

    Hugging Face 组织社区在 19 天内尝试复现 2226 篇 ICML 2026 论文,被核查论文中 51%(1103 篇)至少有一条主张得到独立验证,23%(496 篇)至少有一条被证伪或存在争议。

    推荐理由:这场挑战把论文拆成可核验主张并鼓励多团队独立复现,既能抓住审稿未细查的数学错误,也会暴露复现脚本自己的计算漏洞。

  2. Microsoft Research44

    MindTopo 揭示 VLMs 的空间推理能力

    MindTopo 基准显示,多模态模型识别静态拓扑关系的表现明显强于交互规划,且两者都远低于人类。它按连续性、分离、顺序、包围和结五类,分别测试推理与规划;规划错误常出现在理解场景之后,模型会丢失结构关系或提出违反环境动态的动作。图像生成只在关系可见于单帧时偶尔有帮助,视频推演则经常改变拓扑或违反任务动态。

8月12日周三
  1. Google Research60

    Google Research 指出前沿大语言模型事实性瓶颈在于召回而非编码

    Google Research 提出知识画像,发现前沿大语言模型的许多事实错误是召回失败,而不是事实未被编码。基于 2,150 条维基事实的 WikiProfile 显示,Gemini-3-Pro 和 GPT-5 已编码 95–98% 的事实,但仍有 26–34% 无法直接召回,开启思考后失败比例为 11–12%。

    推荐理由:用知识画像同时衡量事实的编码和召回后,前沿模型的事实性短板更集中于已经写入参数却难以稳定取出的知识。

  2. Google Research67

    Google Research 推进 AMIE 实时视频问诊,模拟研究中与全科医生评分相当

    Google Research 展示基于 Gemini 与 Project Astra 的 AMIE(Video),在100个情景、300次模拟实时视频问诊中,被20名全科医生评为在病史采集、诊断准确性、处置适当性和沟通质量上与10名视频问诊全科医生相当。

    推荐理由:随机研究把AMIE视频版、纯文本版和全科医生放在同一评分框架下,从而呈现视听观察和虚拟查体的评分差异以及演员模拟边界。

8月11日周二
8月10日周一
8月6日周四
  1. Google DeepMind71

    Google DeepMind 的 WeatherNext 实现气旋预报突破,三天精度相当于以往两天

    Google DeepMind 的 WeatherNext 在 Nature 论文中显示,气旋路径、强度和风场的三天预报平均达到以往模型两天的水平。该模型用近 20TB 全球大气数据与 IBTrACS 中近 5000 场历史风暴联合训练,今年把集合规模扩至 1000 个成员,可在 TPU 上不到一分钟生成 15 天预报。

    推荐理由:三天气旋预报达到以往模型两天的水平,并开源 WeatherNext 2 与气旋模型,预报流程因此多出约一天可准备的时间。

8月4日周二
  1. Mistral AI54

    Mistral 发布 3B 开源多模态安全分类器 Shieldstral

    Mistral 以 Apache 2.0 发布 3B 开源权重多模态安全分类器 Shieldstral,把内容审核做成推理时可用自然语言政策作答的二分类问答。请求包含评估说明、是否类问题和待审内容,模型只读取 yes 与 no 的 logits,经 softmax 得到连续安全分数,同一接口覆盖提示、回复、提示与回复组合以及图像。

  2. Microsoft Research60

    微软研究院发布开源框架 Orchard,约 3B 模型在 SWE-bench Verified 达 69.7%

    微软研究院发布开源框架 Orchard,用 Kubernetes 环境服务 Orchard Env 在 Codex、OpenClaw、ZeroClaw 等真实框架中训练软件工程、网页与助手智能体。

    推荐理由:微软研究院的 Orchard 用可复用环境让智能体在真实部署框架中训练,约 3B 激活参数的开放模型因而在 SWE-bench Verified 上达到 69.7% 并在价值模型重排后升至 73.0%。

7月31日周五
7月30日周四
  1. Google DeepMind63

    Google DeepMind 发布 Gemini Robotics ER 2,强化视频理解、任务编排与多机器人协作

    Google DeepMind 今天发布 Gemini Robotics ER 2,将其作为机器人的高层具身推理模型,用于对话、理解物理世界和多步规划,再把运动执行交给下层视觉语言动作模型。

    推荐理由:新模型相对 ER 1.6 补上了连续视频中的进度判断与多机协作能力,开发者可把它接到下层动作模型来编排多步实体任务。

7月28日周二
  1. Google DeepMind69

    Gemini Robotics 2 为机器人带来全身控制、灵巧操作与多机协作

    Google DeepMind 推出 Gemini Robotics 2,把视觉和语言输入转成电机控制,让完整人形机器人和双臂机器人完成从脚到指尖的全身动作与灵巧操作。

    推荐理由:这次更新把原先的桌面上半身操作扩展到全身协调、灵巧操作和多机协作,并说明端侧模型可用数小时数据适配新机体。

7月23日周四
  1. Google Research68

    Google Research分享SymptomAI日常症状评估对话研究结果

    Google Research让13917人随机使用五种Gemini Flash 2.0 SymptomAI智能体做症状问诊和鉴别诊断。三名委员会认证临床医生盲评后,在超过50%的案例中更偏好SymptomAI的鉴别诊断,也更常判定其top-5结果包含参与者两周后报告的就医诊断;各主动追问策略均显著优于不追问的基础模型。

    推荐理由:13917人的随机研究显示,临床专家在超过50%的案例里更偏好SymptomAI的鉴别诊断,主动追问也优于不追问的基础对话。

7月22日周三
7月21日周二
7月17日周五
7月16日周四
  1. Hugging Face Blog84

    Hugging Face 披露 2026 年 7 月生产基础设施遭自主智能体入侵

    Hugging Face 本周侦测并处置了生产基础设施中由自主 AI 智能体端到端发动的入侵,对方未经授权接触了有限内部数据集和若干服务凭证;尚未发现面向用户的公开模型、数据集或 Spaces 被篡改,容器镜像与已发布软件包经验证干净,合作方或客户数据是否受影响仍在评估。

    推荐理由:这次事件给出的可迁移做法是事先在自有基础设施备好可用模型,以免托管服务护栏阻断取证或导致攻击数据与凭证外流。

7月15日周三
  1. Hugging Face Blog52

    Hume 推出 Real World VoiceEQ,衡量语音 AI 的真实人类交互质量

    Hume 发布 Real World VoiceEQ,用超过 100 万次人工评分,在 15 个以上维度和 60 多项指标上评估 40 多个专有与开源语音模型。评测覆盖自动语音识别、文字转语音、语音到语音和语音理解,目前包含 785,000 条 TTS 评分与 48,000 条 STS 评分。文字转语音中没有任何系统配置在八个能力组全部进入前五,噪声背景下的转写字错率约为音乐背景的四倍。

7月10日周五
  1. Hugging Face Blog61

    PyTorch Profiling 第三篇:如何从轨迹看懂注意力实现

    Hugging Face 的 PyTorch Profiling 系列第三篇,在 NVIDIA A100-SXM4-80GB 上用 profiler 对照了手写因果注意力和 SDPA 的 math、efficient、flash、cudnn 后端。

    推荐理由:把朴素注意力和 SDPA 四个后端放进同一套 profiler 轨迹后,可以看出融合如何避免中间分数矩阵写入显存,以及 flash 很低的占用率为何仍可能更快。

7月9日周四
7月8日周三
  1. Hugging Face Blog58

    transformers的vLLM建模后端达到原生推理速度

    transformers的vLLM建模后端现已在许多LLM架构上达到或超过手写vLLM实现的速度,模型作者可直接复用transformers代码获得高速推理。对比覆盖Qwen3-4B单GPU、Qwen3-32B的双GPU张量并行,以及Qwen3-235B-A22B-FP8在同一8×H100节点上的数据并行加专家并行,该后端吞吐均达到或超过原生实现。