Grok 4.7 现已在 Amazon Bedrock 上线
Grok 4.7 现已在 Amazon Bedrock 上线,上下文窗口为 500K token,面向编码、长时智能体和知识工作。
Grok 4.7 现已在 Amazon Bedrock 上线,上下文窗口为 500K token,面向编码、长时智能体和知识工作。
Claude Sonnet 5.5 今日登陆 Amazon Bedrock,Claude Platform on AWS 在北美提供。它适合范围明确的编码与知识工作,多数工作的单任务成本更低、速度更快。数据留在 AWS 内并支持区域数据驻留,可配合 IAM 与 Amazon Bedrock Guardrails。
Mistral在慕尼黑开设德国中心,组建Physics AI与工业AI团队并直接服务企业。2026年5月收购Emmi AI后逾30人加入,与BMW做碰撞仿真、与Siemens Energy做工业AI,并与慕尼黑工业大学合作汽车空气动力学数字孪生。到2030年建1 GW欧洲算力,开放权重在客户基础设施运行且数据不出组织。
Amazon EKS结合EFA与DeepEP扩展MoE强化学习训练,吞吐量提升40%。该方案面向RLHF与GRPO,协调rollout生成和策略训练,并由DeepEP优化EFA上的Expert Parallelism通信。MoE更稀疏后训练更受跨节点通信而非计算制约,还需同时平衡加速器算力、内存与网络带宽。
可从 Amazon SageMaker JumpStart 将公开的 Qwen3-TTS-12Hz-1.7B-Base 部署到全托管实时推理端点,用短参考录音及其转写克隆说话人声音来合成新文本,无需重新训练。
Liquid AI 发布 LFM2.5-VL-3B 的实验性 DSpark 草稿模型,用投机解码加速推理且输出质量不变。设备端解码最高 3.13x、H100 最高 2.66x,端到端最高 2.62x 与 2.27x,参数多 280M(8.9%)。首日支持 llama.cpp、MLX-VLM、SGLang,提供开放权重。
GitHub Copilot 应用重建 PR 视图后,含 2,200 文件、逾百万行改动和超 400 条行内评论的 diff 仍能流畅滚动。纯代码行在绘制前即可确定高度,虚拟化后同时大约只挂载 100 行。评论高度要到渲染时才知道,因此总高度拆成确定性代码高度与懒测量的动态块,修正则锚定在用户正在看的位置。
开发者可以用开源终端智能体 OpenCode 调用 Amazon Bedrock 上的开放权重模型,把推理留在自有 AWS 账号并按消耗计费。
Microsoft Research 发现,把物理 AI 推理卸载到边缘或云端 GPU 可提升任务表现。在内存足够时,建图与规划比 A100 最多慢 383%,较轻 GPU 使障碍及时检测降 30%,较小 GPU 使 VLA 准确率降 50%。Jetson Thor 等较大机载 GPU 可使耗电增加最多 160%。
Google 将为 Private AI Compute 增加可跨设备的服务端持久记忆,并维持通常限于设备端的严格隐私标准。数据封存在专用加密存储,解锁密钥仅在个人设备上,连 Google 也无法访问。设备发送个人数据前可核验服务器软件真实且未被篡改。
Sakeena Fiza 担任 NVIDIA 验证工程师,在量产前把数据中心系统从托盘测到客户 AI 工厂,抢在客户之前发现问题。她见证 NVIDIA Rubin GPU 首次在系统级枚举,显示为 “NVIDIA Corporation Device”。单块板卡可含数万个元件,一个机架接近 50 万个,这些部件必须在压力和多种 AI 工厂配置下协同工作。
Hugging Face transformers 现可在 main 分支高效运行 GGUF,用户用 from_pretrained 加载 Hub 检查点后即可在本机生成。
推荐理由:GGUF 现在能直接进 transformers 做检查和自定义生成,Apple Silicon 上速度接近 llama.cpp。
NVIDIA 推出 DSX Ready,认证符合 NVIDIA DSX AI 工厂参考设计的电池储能与冷却产品。已认证 BESS 来自 Hitachi Energy、LG Energy Solution 和 Tesla,CDU 来自 LG Electronics、LiquidStack 和 Vertiv。基础设施与软件等更多类别将逐步推出。
埃及 AI 生态已从赋能走向执行并达到生产规模,开发者、初创与企业正跨行业构建应用。Hassan Allam Utilities 与 A15 同意在埃及新建数据中心,投资估约 4 亿美元。非洲一年内已宣布或上线四座 AI 工厂,另有 656 兆瓦新产能正在推进。
Multiverse 把大语言模型的块移除写成 Ising glass 上的受约束二元优化,Llama-3.3-70B-Instruct 在 50% 压缩时 MMLU 比最佳同类块移除方法高出近 23 个百分点。
GitHub 用 Copilot 将 Copilot agent runtime 从 TypeScript/Node.js 重写为超过 800,000 行生产 Rust,大部分代码由 AI 智能体完成,并通过 128 个合入主干的 pull request 增量交付。
推荐理由:原文写清 Copilot 运行时如何以组件原子替换迁到 Rust 并增量发布,读者可从智能体分工看到大规模改写怎样维持主干持续可交付。
负责 GitHub 日本和韩国市场的 Tomoko Tanaka 用 GitHub Copilot、Issue 和 Actions 自动化活动运营,过去要手工处理一两天的搭建现在从单条 Issue 开始,系统每天早上筛查报名者,并在结束后自行收尾。
Cloudera 与 Mistral 合作,将模型接入其混合数据平台,支持在私有云、公有云、本地和完全隔离环境中受控运行推理。企业可在受控环境用大量专有数据训练定制模型,并保有数据与所得智能的所有权。Mistral 将主权 AI 带到该平台 30 exabytes 客户自管数据上,模型可基于开放权重适配并拥有。
Hugging Face 发布 JavaScript 库 @huggingface/kernels 及 huggingface.co/webgpu-kernels 上的 207 个 Apache-2.0 WebGPU kernel,可从 Hub 按契约版本加载并在浏览器中运行本地推理算子。
Gradio 的 gr.Workflow 用类型节点图把 AI 流水线变成可拖拽界面,同一张图同时是 REST API,并可一键部署到 Hugging Face Spaces。
推荐理由:把多步 AI 流程写成带类型端口的节点图后,可以在画布上单独运行每一步并看到中间值,同一张图还能作为 REST 接口部署到 Spaces。
Mistral 与 HUMAIN 宣布战略合作,在沙特及中东推进主权 AI。合作覆盖 AI 基础设施、先进模型开发与解决方案部署,初期聚焦网络安全和语音,并计划开发阿拉伯语表现强劲的前沿模型,规模达数亿欧元。Mistral 将探索使用 HUMAIN 数据中心,双方还计划面向沙特受监管行业制定联合市场策略。
Hugging Face 说明如何用 Jobs、Storage Buckets 和 Inference Endpoints 支撑 Papers with Code 的混合搜索:离线批量生成论文向量,在线只嵌入查询,端点冷启动或异常时回退全文检索。
Liquid AI 发布三款 LFM2.5 的 DSpark 草稿模型,在不改变贪心输出的前提下,把 GPU 吞吐最高做到 3.18 倍、端侧最高做到 2.87 倍。
Mistral 推进三项 AI 主权举措:区域内推理、开放模型与欧洲长期算力。Regional Endpoints 已全面可用,可选欧洲或美国;Priority Tier 公开预览,提供 uptime SLA。平台将先接入 Z.ai 的 GLM-5.2,并以 European Compute Units 承接多年承诺。
微软研究院发布开源框架 Orchard,用 Kubernetes 环境服务 Orchard Env 在 Codex、OpenClaw、ZeroClaw 等真实框架中训练软件工程、网页与助手智能体。
推荐理由:微软研究院的 Orchard 用可复用环境让智能体在真实部署框架中训练,约 3B 激活参数的开放模型因而在 SWE-bench Verified 上达到 69.7% 并在价值模型重排后升至 73.0%。
Mistral 发布 Mistral OCR 4,在提取文本之外返回边界框、类型化块分类和行内置信度,支持 10 个语系共 170 种语言,并可在单个容器中完全自托管。
推荐理由:官方说明 Mistral OCR 4 在文本之外返回边界框、块分类和置信度,并公布人工评测胜率与基准分数,便于评估其进入检索和自托管流水线的条件。
Mistral今日以公开预览发布Workflows,作为Studio中的企业AI编排层,用于把AI流程从概念验证可靠推进到生产。开发者用Python编写流程并发布到Le Chat触发,可用wait_for_input()暂停等待人工审批且不消耗算力。