跳到正文

全部动态

今日 4 条
9月16日周三
9月15日周二
  1. NVIDIA Blog52

    费城儿童医院如何用开源 NVIDIA AI 开展小儿心脏诊疗

    费城儿童医院基于 NVIDIA 联合创立的开源框架 MONAI,把患儿已有的 CT、MRI 和三维超声在数秒内生成解剖精确的心脏模型,用于先天性心脏病诊疗。原先需熟练研究人员约四小时的流程已快到可作常规临床使用;美国已有 20 多家儿童医院开展心脏建模,波士顿儿童医院每年约 500 例心脏手术中过半借助建模,CHOP 预计今年建模约 200 例。

9月12日周六
9月11日周五
9月10日周四
  1. Mistral AI38

    Cloudera 与 Mistral 合作,将专业化主权智能带入企业数据

    Cloudera 与 Mistral 合作,将模型接入其混合数据平台,支持在私有云、公有云、本地和完全隔离环境中受控运行推理。企业可在受控环境用大量专有数据训练定制模型,并保有数据与所得智能的所有权。Mistral 将主权 AI 带到该平台 30 exabytes 客户自管数据上,模型可基于开放权重适配并拥有。

  2. Hugging Face Blog57

    用 Gradio Workflow 将 AUTOMATIC1111 重建为 Workflow1111

    Workflow1111 把 AUTOMATIC1111 的大部分功能重做成一张 Gradio 工作流画布,包含十一条媒体管线和七十三个节点。登录 Hugging Face 账号或提供访问令牌后,可运行文生图、高分辨率修复、图生图、提示词矩阵、VLM 反推、检测生成遮罩、标注、去背景、PNG Info 和图像转视频,模型调用使用用户自己的额度。

9月9日周三
9月8日周二
  1. Mistral AI67

    Mistral 完成 €3 billion Series D 融资,投后估值超过 €21 billion

    Mistral 宣布完成 €3 billion Series D 融资,投后估值超过 €21 billion,并称这是欧洲科技公司完成过的最大股权融资。Samsung Electronics 领投,由 EQT 管理的 Scaleup Europe Fund 与既有投资人 PSG Equity 联合领投,资金将扩大前沿研究、训练算力、基础设施以及商业增长和国际布局。

    推荐理由:这笔融资将显著扩大 Mistral 的前沿研究、训练算力与基础设施投入,并加快开源权重主权全栈的商业增长与国际布局。

9月5日周六
  1. GitHub Blog · AI & ML66

    GitHub Copilot 推出多模型编排研究预览 Project HydraFusion

    GitHub 在 Copilot CLI 推出研究预览 Project HydraFusion,运行时按任务在单模型直接求解、高效模型起草后升级,以及跨模型家族独立评审再修订三种模式间编排多个提供商的模型。

    推荐理由:它把换模型、独立评审和必要时升级交给运行时选择,读者可对照三项智能体编程基准看相对 Claude Opus 5 的质量与估算成本。

9月4日周五
9月3日周四
  1. Google DeepMind73

    Google DeepMind与Google Research发布全球天气模型WeatherNext 3

    Google DeepMind与Google Research发布WeatherNext 3,可每小时生成最高5公里分辨率的全球天气预报。相较25公里网格、6小时更新的WeatherNext 2,新模型的全球天气画面约锐利5倍;中期预报早期时效的CRPS相对IMERG最高改善60%,相对MRMS为30%,相对雨量计为10%。

    推荐理由:WeatherNext 3将WeatherNext 2的25公里、6小时改为5公里与每小时更新,并接入Search、Gemini和Maps。

  2. Hugging Face Blog72

    funes 为编码智能体提供归用户所有的记忆

    funes 为 Claude Code、Codex、pi 和 Hermes 提供归用户所有的持久记忆,默认在本机索引已有会话,也可同步到默认私有的 Hugging Face 数据集。

    推荐理由:这种记忆以你拥有的数据集而非独立服务存在,原始回合始终可追溯,因此换机器或换智能体后仍能召回先前的决策与失败尝试。

  3. Google DeepMind77

    Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber

    Google DeepMind 今日发布 Gemini 3.8 Flash 与 Gemini 3.8 Flash Cyber。3.8 Flash 沿用 3.7 Flash 的入门价格,输入每百万 token 为 $0.75、输出每百万 token 为 $3.75,并提升软件工程、智能体任务与多步推理,HLE-Verified 达到 54.9%。

    推荐理由:3.8 Flash以与3.7相同的价格加强长程编码和多步推理,网络安全变体仅经Fairwind向政府、关键基础设施和软件维护方开放。

9月2日周三
  1. Google DeepMind69

    Gemini 3.7 Flash 等模型上线智能体式视频理解

    Google DeepMind 今天在 Gemini 3.7 Flash、3.6 Flash 与 3.5 Flash-Lite 上线智能体式视频理解,视频分析的 token 消耗最多降低 88%,成本最多降低 66%,准确率最多提升 7%。

    推荐理由:智能体模式让模型按目标选择画面、音频或文字稿并只读取所需片段,长视频分析不必再整段按固定帧率消耗大量 token。

9月1日周二
8月28日周五
  1. Google DeepMind63

    Google DeepMind 推出 Gemini Omni 1.1 Flash,强化生成视频控制

    Gemini Omni 1.1 Flash 现已推出,开发者可通过 Gemini API 做场景延续、首尾帧插值和最高 4K 放大。场景延续能分析最多 10 秒前文,而不只参考最后 1 秒,并按 10 秒一段把视频延到累计 40 秒;360p 预览成本为标准 720p 的三分之一,生成最高快 60%,成片可输出 1080p 或 4K。

    推荐理由:开发者现在可以用最多10秒前文把已有视频按10秒一段延续到累计40秒,再以360p三分之一的成本和最高快60%的速度试稿后放大到4K。

8月27日周四
8月26日周三
8月25日周二
  1. Hugging Face Blog68

    IBM Granite 4.2推理模型如何构建

    Granite 4.2从Granite-4.1基座出发,经监督微调和多阶段GRPO强化学习,得到3B、8B、30B三款稠密仅解码器推理模型。监督微调约用7.2 million条样本(约100B token,其中约65B可训练);基座则以约15T token分五阶段从零预训练,并把上下文扩到512K。

    推荐理由:技术文按监督微调、GRPO与分阶段课程写清Granite 4.2的训练路径,并写明只有8B和30B做真实环境里的智能体训练。

  2. Mistral AI47

    Mistral 与 HUMAIN 宣布战略合作,推进沙特及中东主权 AI

    Mistral 与 HUMAIN 宣布战略合作,在沙特及中东推进主权 AI。合作覆盖 AI 基础设施、先进模型开发与解决方案部署,初期聚焦网络安全和语音,并计划开发阿拉伯语表现强劲的前沿模型,规模达数亿欧元。Mistral 将探索使用 HUMAIN 数据中心,双方还计划面向沙特受监管行业制定联合市场策略。

8月21日周五
8月20日周四
8月19日周三
  1. Hugging Face Blog52

    ALTK-Evolve探讨智能体实际需要多少记忆

    ALTK-Evolve在AppWorld test_normal上对照八个模型发现,自蒸馏记忆的合适剂量取决于模型能力。强模型DeepSeek-V3.2注入全量指南后TGC提升9.5个百分点,弱模型gpt-oss-120b用精选检索提升16.1个百分点且token仅增5%,饱和模型GLM-5增益为0。这些指南从智能体过往轨迹蒸馏,推理时注入,不更新模型权重,也不需要人工标注。

8月14日周五
8月13日周四
  1. Microsoft Research44

    MindTopo 揭示 VLMs 的空间推理能力

    MindTopo 基准显示,多模态模型识别静态拓扑关系的表现明显强于交互规划,且两者都远低于人类。它按连续性、分离、顺序、包围和结五类,分别测试推理与规划;规划错误常出现在理解场景之后,模型会丢失结构关系或提出违反环境动态的动作。图像生成只在关系可见于单帧时偶尔有帮助,视频推演则经常改变拓扑或违反任务动态。

8月12日周三
  1. Google Research60

    Google Research 指出前沿大语言模型事实性瓶颈在于召回而非编码

    Google Research 提出知识画像,发现前沿大语言模型的许多事实错误是召回失败,而不是事实未被编码。基于 2,150 条维基事实的 WikiProfile 显示,Gemini-3-Pro 和 GPT-5 已编码 95–98% 的事实,但仍有 26–34% 无法直接召回,开启思考后失败比例为 11–12%。

    推荐理由:用知识画像同时衡量事实的编码和召回后,前沿模型的事实性短板更集中于已经写入参数却难以稳定取出的知识。

  2. Google Research67

    Google Research 推进 AMIE 实时视频问诊,模拟研究中与全科医生评分相当

    Google Research 展示基于 Gemini 与 Project Astra 的 AMIE(Video),在100个情景、300次模拟实时视频问诊中,被20名全科医生评为在病史采集、诊断准确性、处置适当性和沟通质量上与10名视频问诊全科医生相当。

    推荐理由:随机研究把AMIE视频版、纯文本版和全科医生放在同一评分框架下,从而呈现视听观察和虚拟查体的评分差异以及演员模拟边界。