跳到正文

#论文/研究

今日 1 条
今天9月29日周二
  1. The Decoder50

    逾20位顶尖AI研究者警告自动化AI研究构成极端风险

    逾20位顶尖AI研究者在新论文中警告,AI研发自动化虽仍有很大不确定性,但可能很快引发智能爆炸。研究称,构建这些系统的公司里AI已写出大部分代码,并可能在数年内自动化整条AI研发流程,使通常需数年的进展在数月内发生。作者警告社会可能跟不上、对超人类AI的控制可能流失,并敦促政策制定者大幅提高对AI研究自动化的可见性。

9月26日周六
  1. Ars Technica · AI56

    CESifo工作论文称近期大学毕业生招聘未见显著下降

    慕尼黑CESifo工作论文称,没有证据表明近期大学毕业生招聘在绝对或相对水平上出现显著、广泛的替代或减少。作者Robert Fairlie与Jane Wu聚焦应届生,认为劳动力需求变化可能先表现为少招人;当AI足以完成许多入门办公室工作中相对标准化的任务时,企业可能减少简单岗位的新招聘,而非解雇更有经验的长期员工。

9月25日周五
  1. Google Research50

    Google Research 介绍自动生成连贯长视频的 AI 协同导演框架

    Google Research 介绍基于 Gemini 与 Veo 的 AI 视频协同导演,用多智能体编排规划多镜头长视频的视觉连续性。该套件包括将于 COLM 2026 发表的 Co-Director、将于 EMNLP 2026 发表的 CANVAS,以及 A²RD 与 VQQA,分别处理创意配置、持久视觉记忆、分段生成和提示词闭环修正,并继承 SynthID 水印。

9月24日周四
9月21日周一
9月19日周六
9月18日周五
9月16日周三
9月4日周五
9月2日周三
8月28日周五
8月24日周一
  1. Import AI46

    Import AI 470:机器没有权利;用 SPADE 自动生成环境;用 Hawkeye 构建更好的 GPU 内核

    华盛顿大学、斯坦福大学等高校提出 SPADE,让大语言模型以自对弈交替生成可执行训练环境并求解,用来合成训练数据。Qwen3-30B-A3B 的游戏环境套件平均分为 58.3,比基座高 8.1、比最强固定环境基线高 5.3。METR 研究显示,LLM 对网络安全漏洞发现加速明显,数学仅轻微加速,AI 研究算法进展则没有可测到的加速。

8月21日周五
8月19日周三
  1. Hugging Face Blog52

    ALTK-Evolve探讨智能体实际需要多少记忆

    ALTK-Evolve在AppWorld test_normal上对照八个模型发现,自蒸馏记忆的合适剂量取决于模型能力。强模型DeepSeek-V3.2注入全量指南后TGC提升9.5个百分点,弱模型gpt-oss-120b用精选检索提升16.1个百分点且token仅增5%,饱和模型GLM-5增益为0。这些指南从智能体过往轨迹蒸馏,推理时注入,不更新模型权重,也不需要人工标注。

8月12日周三
  1. Google Research60

    Google Research 指出前沿大语言模型事实性瓶颈在于召回而非编码

    Google Research 提出知识画像,发现前沿大语言模型的许多事实错误是召回失败,而不是事实未被编码。基于 2,150 条维基事实的 WikiProfile 显示,Gemini-3-Pro 和 GPT-5 已编码 95–98% 的事实,但仍有 26–34% 无法直接召回,开启思考后失败比例为 11–12%。

    推荐理由:用知识画像同时衡量事实的编码和召回后,前沿模型的事实性短板更集中于已经写入参数却难以稳定取出的知识。

  2. Google Research67

    Google Research 推进 AMIE 实时视频问诊,模拟研究中与全科医生评分相当

    Google Research 展示基于 Gemini 与 Project Astra 的 AMIE(Video),在100个情景、300次模拟实时视频问诊中,被20名全科医生评为在病史采集、诊断准确性、处置适当性和沟通质量上与10名视频问诊全科医生相当。

    推荐理由:随机研究把AMIE视频版、纯文本版和全科医生放在同一评分框架下,从而呈现视听观察和虚拟查体的评分差异以及演员模拟边界。

8月3日周一
7月31日周五
7月23日周四
  1. Google Research68

    Google Research分享SymptomAI日常症状评估对话研究结果

    Google Research让13917人随机使用五种Gemini Flash 2.0 SymptomAI智能体做症状问诊和鉴别诊断。三名委员会认证临床医生盲评后,在超过50%的案例中更偏好SymptomAI的鉴别诊断,也更常判定其top-5结果包含参与者两周后报告的就医诊断;各主动追问策略均显著优于不追问的基础模型。

    推荐理由:13917人的随机研究显示,临床专家在超过50%的案例里更偏好SymptomAI的鉴别诊断,主动追问也优于不追问的基础对话。

7月9日周四
7月8日周三
6月25日周四
  1. Google Research54

    推理如何解锁大语言模型中的参数知识

    Google Research发现,开启推理能让模型召回简单单跳问题上关闭推理时几乎无法得到的事实,机制是计算缓冲和factual priming。对Gemini-2.5 Flash、Pro与Qwen3-32B,等长重复Let me think已明显好于关闭推理,但始终不能完全赶上自然轨迹;相关事实即使在推理关闭时也能挽回大部分增益。

6月13日周六
4月20日周一
  1. Berkeley AI Research40

    GRASP:面向更长时域世界模型的梯度规划

    GRASP 是面向学习得到的动力学(世界模型)的新型梯度规划器,靠三项设计让长时域规划变得可行。它将轨迹提升到虚拟状态,使优化可沿时间并行;把随机性直接加进状态迭代用于探索;并重塑梯度,让动作获得干净信号,同时避开高维视觉模型中脆弱的 state-input 梯度。

1月10日周六
  1. Berkeley AI Research38

    成像系统的信息驱动设计

    NeurIPS 2025 论文提出用互信息直接评估并优化成像系统,仅依赖含噪测量与噪声模型。该指标在彩色摄影、射电天文、无透镜成像和显微四个领域均能预测下游解码表现。据此优化的设计可匹配端到端 SOTA 方法,同时更省内存与算力,且无需任务专用解码器。