OpenAI 发布面向工作的 GPT-6 Astra
OpenAI 发布 GPT-6 Astra,称其为面向商务工作能力最强的模型,具备高级推理、计算机使用,以及更强的写作和设计判断。
OpenAI 发布 GPT-6 Astra,称其为面向商务工作能力最强的模型,具备高级推理、计算机使用,以及更强的写作和设计判断。
一位 MIT 研究人员使用 GPT-5.6 Sol 与 Codex,自主运行量子计算实验。同一用法还用于分析实验结果,并校准量子比特。实验运行、结果分析与量子比特校准,都由 GPT-5.6 Sol 配合 Codex 自主完成。
Google DeepMind推出AlphaGenome Atlas,预计算人类基因组中约90亿个、即全部可能的单核苷酸变异的分子效应。
推荐理由:AlphaGenome Atlas预计算约90亿种单字母变异效应,读者可用AVI分数同时排序变异并查看剪接或表达等驱动因素。
更强且更可负担的 AI 可以扩大个人与企业能够完成的工作,并让增长变得更经济。能力提升与更可负担同时发生,使更多工作进入可完成的范围。对使用这类 AI 的人与企业而言,推进增长的方式可以更经济。
Mistral 宣布完成 €3 billion Series D 融资,投后估值超过 €21 billion,并称这是欧洲科技公司完成过的最大股权融资。Samsung Electronics 领投,由 EQT 管理的 Scaleup Europe Fund 与既有投资人 PSG Equity 联合领投,资金将扩大前沿研究、训练算力、基础设施以及商业增长和国际布局。
推荐理由:这笔融资将显著扩大 Mistral 的前沿研究、训练算力与基础设施投入,并加快开源权重主权全栈的商业增长与国际布局。
ChatGPT Images 2.5 可以把想法、草图和参考照片变成更个性化、更精致的图像。生成结果会更好地反映用户原本的想法。它处理的输入包括创意想法、草图和参考照片。
OpenAI 正在扩大对新闻业的支持,相关举措从课堂延伸到新闻编辑室。支持内容包括工具、培训和合作伙伴关系。覆盖人群包括学生、教育工作者、记者和新闻机构。学生与教育工作者对应课堂一端,记者与新闻机构对应新闻编辑室一端。工具、培训和合作伙伴关系面向上述全部人群。
OpenAI 正在分享一份针对 Navier–Stokes 千禧年大奖问题的 AI 生成解答。这份材料包含一份书面说明。其中还附有一份用 Lean 写成的形式化证明。
OpenAI 现开放 $5 million 资助计划申请,支持关于生成式 AI 如何影响青少年发展、福祉与安全的独立研究。这笔资助用于新的研究,关注生成式 AI 与青少年发展之间的关系。青少年福祉列入同一计划的研究范围。安全也属于该项独立研究所考察的内容。有意参与的研究者现在即可申请。
1Password 借助 Codex 将工程生产力提升了 21%。1Password 的工程师使用 Codex 快速构建新功能。他们也用 Codex 搭建内部工具。相关工作能够达到生产就绪。整个过程仍维持严格的安全策略。
OpenAI、AIRPPU 与 WAN-IFRA 联合推出一项 AI 项目,帮助乌克兰新闻机构加强创新、韧性与独立新闻业。该项目由 OpenAI、AIRPPU 与 WAN-IFRA 共同发起。帮助对象是乌克兰的新闻机构。创新是项目要帮助这些机构加强的一项。韧性是项目要帮助这些机构加强的另一项。独立新闻业是这项 AI 项目要一并加强的方向。
Jakub Pachocki 反思日益强大的人工智能,以及让它保持对齐所面临的挑战。他呼吁建立更强的安全保障,并推动国际协调。这篇讨论以 An Alien Mind 为题,刊于 OpenAI News。
OpenAI 内部的编程智能体正在重塑 AI 研究。早期数据把智能体使用情况放进观察范围。实验速度是另一项被追踪的变化。任务复杂度同样列入这组早期数据。研究加速则是这些内部观察所指向的核心结果。
GitHub 在 Copilot CLI 推出研究预览 Project HydraFusion,运行时按任务在单模型直接求解、高效模型起草后升级,以及跨模型家族独立评审再修订三种模式间编排多个提供商的模型。
推荐理由:它把换模型、独立评审和必要时升级交给运行时选择,读者可对照三项智能体编程基准看相对 Claude Opus 5 的质量与估算成本。
Google Research 联合 HHMI Janelia、MRC 分子生物学实验室和剑桥大学等合作者,在 Cell 发布雄性果蝇脑及中枢神经系统的完整连接组。
GitHub Copilot app 能让同一项目上的多个 AI 智能体分开干活、互不干扰,从而用更少时间做完更多事。智能体会话就是交给 Copilot 的一项从头到尾的任务,sessions 视图用卡片同时管理它们,每张卡片显示标题和进度。
Google DeepMind与Google Research发布WeatherNext 3,可每小时生成最高5公里分辨率的全球天气预报。相较25公里网格、6小时更新的WeatherNext 2,新模型的全球天气画面约锐利5倍;中期预报早期时效的CRPS相对IMERG最高改善60%,相对MRMS为30%,相对雨量计为10%。
推荐理由:WeatherNext 3将WeatherNext 2的25公里、6小时改为5公里与每小时更新,并接入Search、Gemini和Maps。
OpenAI 推出 Daybreak for Frontline Defenders,承诺投入 $1 billion 保护关键服务。这笔承诺用来扩大关键服务对前沿网络安全 AI 的获取。培训被纳入同一项投入。支持也会提供给这些关键服务。前沿网络安全 AI、培训与支持,是 Daybreak 扩大接入时并列覆盖的三部分。
NeoMME推出260M和800M两款多语言多模态编码器,单一双向Transformer从零处理文本token与32×32图像块,并用掩码离散扩散目标训练全模型。
Legora 使用 GPT-6 Astra,在数分钟内审阅了 41 份文件。这次审阅是在财务审阅工作流中完成的。流程找出了全部 4 处预先埋入的错误。同一财务审阅工作流中的表现提升了近 40%。
Playco 使用 GPT-6 Astra,从同一套 grey box 基础做出三款主题游戏原型,并报告人工修复比上一模型减少 50%。这三款原型共用一个 grey box 基础,再分别做成不同主题。对比基准是 Playco 此前使用的模型,下降的是人工修复,幅度为 50%。
作者用TRL与OpenEnv复现Surya Narreddi的思路,训练编码模型编写JavaScript,经p5.brush绘制水彩,并在Hugging Face公开参考池、RL环境、训练脚本和模型。
funes 为 Claude Code、Codex、pi 和 Hermes 提供归用户所有的持久记忆,默认在本机索引已有会话,也可同步到默认私有的 Hugging Face 数据集。
推荐理由:这种记忆以你拥有的数据集而非独立服务存在,原始回合始终可追溯,因此换机器或换智能体后仍能召回先前的决策与失败尝试。
用TRL的GRPO以约500条样本和100步微调LFM2.5-350M,IFStruct通过率从22.6%升至29.7%。JSON通过率从18.0%升至31.9%,顶层裸列表从16.6%升至29.7%,YAML从27.2%到27.5%几乎不变,仍低于Qwen3.5-2B的33.15%。
Google 启动 Fairwind Program,让政府与可信伙伴借助 Gemini 3.8 Flash Cyber 和 CodeMender 自主修复漏洞。不必再花数周,数分钟内即可在安全云环境生成经验证、可部署的补丁。已有超过 650 家合作伙伴,访问限于内部网络安全、事件响应或渗透测试团队并需多因素认证。
Google DeepMind 今日发布 Gemini 3.8 Flash 与 Gemini 3.8 Flash Cyber。3.8 Flash 沿用 3.7 Flash 的入门价格,输入每百万 token 为 $0.75、输出每百万 token 为 $3.75,并提升软件工程、智能体任务与多步推理,HLE-Verified 达到 54.9%。
推荐理由:3.8 Flash以与3.7相同的价格加强长程编码和多步推理,网络安全变体仅经Fairwind向政府、关键基础设施和软件维护方开放。
AllenAI 提出 BenchMIRT(http://allenai.org/papers/benchmirt),用多维项目反应理论在单题层面审计大语言模型基准,并在 100 个 LLM、16 个基准和超过 34K 道题上自行收回安全与通用推理两个主导维度。
Google 的 MAPL-EMIT 用深度学习处理 EMIT 高光谱数据,自动检测并定位全球甲烷点源。专家标注羽流召回率达84%,信噪比高于匹配滤波增强方法,训练数据为3.6 million条合成羽流。全球羽流数据库已放上Earth Engine,训练模型与合成羽流在Kaggle,推理库在Github。
Google DeepMind 今天在 Gemini 3.7 Flash、3.6 Flash 与 3.5 Flash-Lite 上线智能体式视频理解,视频分析的 token 消耗最多降低 88%,成本最多降低 66%,准确率最多提升 7%。
推荐理由:智能体模式让模型按目标选择画面、音频或文字稿并只读取所需片段,长视频分析不必再整段按固定帧率消耗大量 token。
Hugging Face 发布 JavaScript 库 @huggingface/kernels 及 huggingface.co/webgpu-kernels 上的 207 个 Apache-2.0 WebGPU kernel,可从 Hub 按契约版本加载并在浏览器中运行本地推理算子。
Google Research 推出时间序列基础模型 TimesFM-3,参数量为 330 million,预训练数据超过 1 万亿个时间点,可在单次前向中零样本联合预测多条序列。
Google Research 在 Google Earth AI 中介绍实验性行星预测引擎 PPE,可根据自然语言查询自动完成地理空间数据发现、整理、训练、评估并生成报告,把含人工数据工程的建模时间从数周缩到数分钟。
Gemini Omni 1.1 Flash 现已推出,开发者可通过 Gemini API 做场景延续、首尾帧插值和最高 4K 放大。场景延续能分析最多 10 秒前文,而不只参考最后 1 秒,并按 10 秒一段把视频延到累计 40 秒;360p 预览成本为标准 720p 的三分之一,生成最高快 60%,成片可输出 1080p 或 4K。
推荐理由:开发者现在可以用最多10秒前文把已有视频按10秒一段延续到累计40秒,再以360p三分之一的成本和最高快60%的速度试稿后放大到4K。
Google 发布语音转文字模型 Gemini 3.5 Transcribe,可将原始音频直接转为准确、润色并自动排版的文本,并称这是其迄今最精确的语音转写模型。
推荐理由:相对 Chirp 3,新模型给出流式 4.0% 与非流式 2.6% 词错误率以及终稿时间改善 70% 的直接对比。
Sentence Transformers v6.0 的 MultiVectorEncoder 可用于训练和微调 ColBERT 式多向量嵌入模型。
推荐理由:原文整理了用领域问答对微调多向量检索模型的训练组件,并比较无监督检查点与成品检查点在医学数据上的适应差异。
Granite 4.2从Granite-4.1基座出发,经监督微调和多阶段GRPO强化学习,得到3B、8B、30B三款稠密仅解码器推理模型。监督微调约用7.2 million条样本(约100B token,其中约65B可训练);基座则以约15T token分五阶段从零预训练,并把上下文扩到512K。
推荐理由:技术文按监督微调、GRPO与分阶段课程写清Granite 4.2的训练路径,并写明只有8B和30B做真实环境里的智能体训练。
Gradio 的 gr.Workflow 用类型节点图把 AI 流水线变成可拖拽界面,同一张图同时是 REST API,并可一键部署到 Hugging Face Spaces。
推荐理由:把多步 AI 流程写成带类型端口的节点图后,可以在画布上单独运行每一步并看到中间值,同一张图还能作为 REST 接口部署到 Spaces。
Mistral 与 HUMAIN 宣布战略合作,在沙特及中东推进主权 AI。合作覆盖 AI 基础设施、先进模型开发与解决方案部署,初期聚焦网络安全和语音,并计划开发阿拉伯语表现强劲的前沿模型,规模达数亿欧元。Mistral 将探索使用 HUMAIN 数据中心,双方还计划面向沙特受监管行业制定联合市场策略。
华盛顿大学、斯坦福大学等高校提出 SPADE,让大语言模型以自对弈交替生成可执行训练环境并求解,用来合成训练数据。Qwen3-30B-A3B 的游戏环境套件平均分为 58.3,比基座高 8.1、比最强固定环境基线高 5.3。METR 研究显示,LLM 对网络安全漏洞发现加速明显,数学仅轻微加速,AI 研究算法进展则没有可测到的加速。
Hugging Face 提出三项测试,评估 11 个开源语音识别模型是否针对公开基准优化,而非提升通用转写。
推荐理由:三项测试显示,部分模型在公开语音基准上的高分,与其识别数据集线索并复现参考文本有关,单一词错误率因此不足以代表通用转写能力。