Nvidia 希望用芯片内置看门狗严格约束 AI 智能体
Nvidia希望用芯片内置看门狗Sentry收紧对AI智能体的约束。方案结合3月推出的开源软件OpenShell沙箱与BlueField-4的Sentry参考设计,后者独立于主计算机、对智能体不可见,并应在数毫秒内隔离逃逸。兼容系统只需软件更新,公告未给出单独的全面可用日期,也无逃逸检测可靠性数据。
Nvidia希望用芯片内置看门狗Sentry收紧对AI智能体的约束。方案结合3月推出的开源软件OpenShell沙箱与BlueField-4的Sentry参考设计,后者独立于主计算机、对智能体不可见,并应在数毫秒内隔离逃逸。兼容系统只需软件更新,公告未给出单独的全面可用日期,也无逃逸检测可靠性数据。
Grok 4.7 现已在 Amazon Bedrock 上线,上下文窗口为 500K token,面向编码、长时智能体和知识工作。
AI 推理基础设施公司 Modal Labs 接近完成由 Accel 领投的 $750M 融资,估值 $15.75B(含本轮投资)。估值将超过四个月前 $355M 融资时所达 $4.65B 的三倍,公司拒绝置评。截至 5 月 Modal 年化收入已超 $300M;推理需求飙升,尤其来自依赖开源模型的客户。
Claude Sonnet 5.5 今日登陆 Amazon Bedrock,Claude Platform on AWS 在北美提供。它适合范围明确的编码与知识工作,多数工作的单任务成本更低、速度更快。数据留在 AWS 内并支持区域数据驻留,可配合 IAM 与 Amazon Bedrock Guardrails。
Nvidia 首席执行官 Jensen Huang 周一发布 Nvidia Open Agent Safety Platform,用独立的软件与硬件安全层把 AI 智能体限制在测试环境内。
Mistral在慕尼黑开设德国中心,组建Physics AI与工业AI团队并直接服务企业。2026年5月收购Emmi AI后逾30人加入,与BMW做碰撞仿真、与Siemens Energy做工业AI,并与慕尼黑工业大学合作汽车空气动力学数字孪生。到2030年建1 GW欧洲算力,开放权重在客户基础设施运行且数据不出组织。
Amazon EKS结合EFA与DeepEP扩展MoE强化学习训练,吞吐量提升40%。该方案面向RLHF与GRPO,协调rollout生成和策略训练,并由DeepEP优化EFA上的Expert Parallelism通信。MoE更稀疏后训练更受跨节点通信而非计算制约,还需同时平衡加速器算力、内存与网络带宽。
可从 Amazon SageMaker JumpStart 将公开的 Qwen3-TTS-12Hz-1.7B-Base 部署到全托管实时推理端点,用短参考录音及其转写克隆说话人声音来合成新文本,无需重新训练。
Google将于10月1日发射首颗Suncatcher试验卫星MVP,以验证轨道AI数据中心构想。这颗冰箱大小的卫星由Planet Labs提供,内置四颗Google自研TPU,太阳能供电约一千瓦,用于训练模型并通过推理生成token。原计划2027年发射两颗定制卫星,此次改为把芯片集成进已建成卫星以加快测试。
Liquid AI 发布 LFM2.5-VL-3B 的实验性 DSpark 草稿模型,用投机解码加速推理且输出质量不变。设备端解码最高 3.13x、H100 最高 2.66x,端到端最高 2.62x 与 2.27x,参数多 280M(8.9%)。首日支持 llama.cpp、MLX-VLM、SGLang,提供开放权重。
GitHub Copilot 应用重建 PR 视图后,含 2,200 文件、逾百万行改动和超 400 条行内评论的 diff 仍能流畅滚动。纯代码行在绘制前即可确定高度,虚拟化后同时大约只挂载 100 行。评论高度要到渲染时才知道,因此总高度拆成确定性代码高度与懒测量的动态块,修正则锚定在用户正在看的位置。
Microsoft Research 发现,把物理 AI 推理卸载到边缘或云端 GPU 可提升任务表现。在内存足够时,建图与规划比 A100 最多慢 383%,较轻 GPU 使障碍及时检测降 30%,较小 GPU 使 VLA 准确率降 50%。Jetson Thor 等较大机载 GPU 可使耗电增加最多 160%。
Google 将为 Private AI Compute 增加可跨设备的服务端持久记忆,并维持通常限于设备端的严格隐私标准。数据封存在专用加密存储,解锁密钥仅在个人设备上,连 Google 也无法访问。设备发送个人数据前可核验服务器软件真实且未被篡改。
Sakeena Fiza 担任 NVIDIA 验证工程师,在量产前把数据中心系统从托盘测到客户 AI 工厂,抢在客户之前发现问题。她见证 NVIDIA Rubin GPU 首次在系统级枚举,显示为 “NVIDIA Corporation Device”。单块板卡可含数万个元件,一个机架接近 50 万个,这些部件必须在压力和多种 AI 工厂配置下协同工作。
Hugging Face transformers 现可在 main 分支高效运行 GGUF,用户用 from_pretrained 加载 Hub 检查点后即可在本机生成。
推荐理由:GGUF 现在能直接进 transformers 做检查和自定义生成,Apple Silicon 上速度接近 llama.cpp。
NVIDIA 推出 DSX Ready,认证符合 NVIDIA DSX AI 工厂参考设计的电池储能与冷却产品。已认证 BESS 来自 Hitachi Energy、LG Energy Solution 和 Tesla,CDU 来自 LG Electronics、LiquidStack 和 Vertiv。基础设施与软件等更多类别将逐步推出。
埃及 AI 生态已从赋能走向执行并达到生产规模,开发者、初创与企业正跨行业构建应用。Hassan Allam Utilities 与 A15 同意在埃及新建数据中心,投资估约 4 亿美元。非洲一年内已宣布或上线四座 AI 工厂,另有 656 兆瓦新产能正在推进。
Multiverse 把大语言模型的块移除写成 Ising glass 上的受约束二元优化,Llama-3.3-70B-Instruct 在 50% 压缩时 MMLU 比最佳同类块移除方法高出近 23 个百分点。
GitHub 用 Copilot 将 Copilot agent runtime 从 TypeScript/Node.js 重写为超过 800,000 行生产 Rust,大部分代码由 AI 智能体完成,并通过 128 个合入主干的 pull request 增量交付。
推荐理由:原文写清 Copilot 运行时如何以组件原子替换迁到 Rust 并增量发布,读者可从智能体分工看到大规模改写怎样维持主干持续可交付。
负责 GitHub 日本和韩国市场的 Tomoko Tanaka 用 GitHub Copilot、Issue 和 Actions 自动化活动运营,过去要手工处理一两天的搭建现在从单条 Issue 开始,系统每天早上筛查报名者,并在结束后自行收尾。
Cloudera 与 Mistral 合作,将模型接入其混合数据平台,支持在私有云、公有云、本地和完全隔离环境中受控运行推理。企业可在受控环境用大量专有数据训练定制模型,并保有数据与所得智能的所有权。Mistral 将主权 AI 带到该平台 30 exabytes 客户自管数据上,模型可基于开放权重适配并拥有。
Mistral 与 HUMAIN 宣布战略合作,在沙特及中东推进主权 AI。合作覆盖 AI 基础设施、先进模型开发与解决方案部署,初期聚焦网络安全和语音,并计划开发阿拉伯语表现强劲的前沿模型,规模达数亿欧元。Mistral 将探索使用 HUMAIN 数据中心,双方还计划面向沙特受监管行业制定联合市场策略。
华盛顿大学、斯坦福大学等高校提出 SPADE,让大语言模型以自对弈交替生成可执行训练环境并求解,用来合成训练数据。Qwen3-30B-A3B 的游戏环境套件平均分为 58.3,比基座高 8.1、比最强固定环境基线高 5.3。METR 研究显示,LLM 对网络安全漏洞发现加速明显,数学仅轻微加速,AI 研究算法进展则没有可测到的加速。
Mistral 推进三项 AI 主权举措:区域内推理、开放模型与欧洲长期算力。Regional Endpoints 已全面可用,可选欧洲或美国;Priority Tier 公开预览,提供 uptime SLA。平台将先接入 Z.ai 的 GLM-5.2,并以 European Compute Units 承接多年承诺。
微软研究院发布开源框架 Orchard,用 Kubernetes 环境服务 Orchard Env 在 Codex、OpenClaw、ZeroClaw 等真实框架中训练软件工程、网页与助手智能体。
推荐理由:微软研究院的 Orchard 用可复用环境让智能体在真实部署框架中训练,约 3B 激活参数的开放模型因而在 SWE-bench Verified 上达到 69.7% 并在价值模型重排后升至 73.0%。