跳到正文

#推理

今日 4 条
今天9月29日周二
  1. Latent Space40

    Claude Opus 5.5 擅长讲解视频

    Claude Opus 5.5 本周发布,社区反响一边倒地正面,并占据讲解视频时间线。它以 88.4% 领先 SimpleBench。视觉评测中,有评测者将其列为 Anthropic 迄今最好的视觉模型,优于 Fable 5 与 GPT-6 Sol、不及 GPT-6 Astra,成本约比 Fable 5.1 低 60%。

9月26日周六
9月25日周五
9月24日周四
9月22日周二
9月16日周三
9月3日周四
  1. Google DeepMind77

    Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber

    Google DeepMind 今日发布 Gemini 3.8 Flash 与 Gemini 3.8 Flash Cyber。3.8 Flash 沿用 3.7 Flash 的入门价格,输入每百万 token 为 $0.75、输出每百万 token 为 $3.75,并提升软件工程、智能体任务与多步推理,HLE-Verified 达到 54.9%。

    推荐理由:3.8 Flash以与3.7相同的价格加强长程编码和多步推理,网络安全变体仅经Fairwind向政府、关键基础设施和软件维护方开放。

8月24日周一
  1. Import AI46

    Import AI 470:机器没有权利;用 SPADE 自动生成环境;用 Hawkeye 构建更好的 GPU 内核

    华盛顿大学、斯坦福大学等高校提出 SPADE,让大语言模型以自对弈交替生成可执行训练环境并求解,用来合成训练数据。Qwen3-30B-A3B 的游戏环境套件平均分为 58.3,比基座高 8.1、比最强固定环境基线高 5.3。METR 研究显示,LLM 对网络安全漏洞发现加速明显,数学仅轻微加速,AI 研究算法进展则没有可测到的加速。

8月13日周四
  1. Microsoft Research44

    MindTopo 揭示 VLMs 的空间推理能力

    MindTopo 基准显示,多模态模型识别静态拓扑关系的表现明显强于交互规划,且两者都远低于人类。它按连续性、分离、顺序、包围和结五类,分别测试推理与规划;规划错误常出现在理解场景之后,模型会丢失结构关系或提出违反环境动态的动作。图像生成只在关系可见于单帧时偶尔有帮助,视频推演则经常改变拓扑或违反任务动态。

4月20日周一
  1. Berkeley AI Research40

    GRASP:面向更长时域世界模型的梯度规划

    GRASP 是面向学习得到的动力学(世界模型)的新型梯度规划器,靠三项设计让长时域规划变得可行。它将轨迹提升到虚拟状态,使优化可沿时间并行;把随机性直接加进状态迭代用于探索;并重塑梯度,让动作获得干净信号,同时避开高维视觉模型中脆弱的 state-input 梯度。