Grok 4.7 现已在 Amazon Bedrock 上线
Grok 4.7 现已在 Amazon Bedrock 上线,上下文窗口为 500K token,面向编码、长时智能体和知识工作。
Grok 4.7 现已在 Amazon Bedrock 上线,上下文窗口为 500K token,面向编码、长时智能体和知识工作。
NVIDIA 联合 Google DeepMind、EMBL-EBI 等机构,通过 AlphaFold Database 公开超过 2800 种病毒蛋白复合物的预测三维结构,供各地科学家为未来疫情提前积累结构知识。
Microsoft Research 发现,把物理 AI 推理卸载到边缘或云端 GPU 可提升任务表现。在内存足够时,建图与规划比 A100 最多慢 383%,较轻 GPU 使障碍及时检测降 30%,较小 GPU 使 VLA 准确率降 50%。Jetson Thor 等较大机载 GPU 可使耗电增加最多 160%。
Claude Opus 5.5 现已在 Amazon Bedrock 和 Claude Platform on AWS 提供,是 Claude 5.5 家族的第一个模型,面向智能体编码、知识工作与长时任务。
Hugging Face transformers 现可在 main 分支高效运行 GGUF,用户用 from_pretrained 加载 Hub 检查点后即可在本机生成。
推荐理由:GGUF 现在能直接进 transformers 做检查和自定义生成,Apple Silicon 上速度接近 llama.cpp。
Google DeepMind发布Gemini 3.8 Live与Gemini 3.8 Live Extended Thinking,把近实时推理用于语音智能体。
推荐理由:原文给出了Extended Thinking的语音基准分数,以及两款模型面向开发者、企业和普通用户的不同开放范围。
Google DeepMind 今日发布 Gemini 3.8 Flash 与 Gemini 3.8 Flash Cyber。3.8 Flash 沿用 3.7 Flash 的入门价格,输入每百万 token 为 $0.75、输出每百万 token 为 $3.75,并提升软件工程、智能体任务与多步推理,HLE-Verified 达到 54.9%。
推荐理由:3.8 Flash以与3.7相同的价格加强长程编码和多步推理,网络安全变体仅经Fairwind向政府、关键基础设施和软件维护方开放。
AllenAI 提出 BenchMIRT(http://allenai.org/papers/benchmirt),用多维项目反应理论在单题层面审计大语言模型基准,并在 100 个 LLM、16 个基准和超过 34K 道题上自行收回安全与通用推理两个主导维度。
Hugging Face 发布 JavaScript 库 @huggingface/kernels 及 huggingface.co/webgpu-kernels 上的 207 个 Apache-2.0 WebGPU kernel,可从 Hub 按契约版本加载并在浏览器中运行本地推理算子。
Granite 4.2从Granite-4.1基座出发,经监督微调和多阶段GRPO强化学习,得到3B、8B、30B三款稠密仅解码器推理模型。监督微调约用7.2 million条样本(约100B token,其中约65B可训练);基座则以约15T token分五阶段从零预训练,并把上下文扩到512K。
推荐理由:技术文按监督微调、GRPO与分阶段课程写清Granite 4.2的训练路径,并写明只有8B和30B做真实环境里的智能体训练。
Liquid AI 发布三款 LFM2.5 的 DSpark 草稿模型,在不改变贪心输出的前提下,把 GPU 吞吐最高做到 3.18 倍、端侧最高做到 2.87 倍。
MindTopo 基准显示,多模态模型识别静态拓扑关系的表现明显强于交互规划,且两者都远低于人类。它按连续性、分离、顺序、包围和结五类,分别测试推理与规划;规划错误常出现在理解场景之后,模型会丢失结构关系或提出违反环境动态的动作。图像生成只在关系可见于单帧时偶尔有帮助,视频推演则经常改变拓扑或违反任务动态。
Google Research 提出知识画像,发现前沿大语言模型的许多事实错误是召回失败,而不是事实未被编码。基于 2,150 条维基事实的 WikiProfile 显示,Gemini-3-Pro 和 GPT-5 已编码 95–98% 的事实,但仍有 26–34% 无法直接召回,开启思考后失败比例为 11–12%。
推荐理由:用知识画像同时衡量事实的编码和召回后,前沿模型的事实性短板更集中于已经写入参数却难以稳定取出的知识。
Mistral发布Apache-2.0免费模型Leanstral 1.5,总参数119B、激活参数6B,在miniF2F验证集与测试集均达到100%,并解出PutnamBench 672题中的587题。
推荐理由:原文给出6B激活参数模型的基准成绩、约4美元单题成本和开源入口,读者可以据此比较它与更高成本形式验证系统的差异。
Google Research发现,开启推理能让模型召回简单单跳问题上关闭推理时几乎无法得到的事实,机制是计算缓冲和factual priming。对Gemini-2.5 Flash、Pro与Qwen3-32B,等长重复Let me think已明显好于关闭推理,但始终不能完全赶上自然轨迹;相关事实即使在推理关闭时也能挽回大部分增益。
Google DeepMind发布实验性开源模型DiffusionGemma,这款26B MoE以文本扩散整块并行生成文本,在专用GPU上最高可实现4倍加速。
推荐理由:DiffusionGemma把本地文本生成从逐token解码改成整段并行起草,并交代相对Gemma 4的速度、显存和质量取舍,便于判断它适合哪些交互式本地工作流。
Mistral 发布 128B 稠密开源权重模型 Mistral Medium 3.5,并将其作为 Mistral Vibe 与 Le Chat 的默认模型,同时上线可在云端并行异步运行的远程编程智能体。
推荐理由:新的128B开源权重模型把编程会话放到云端并行运行,开发者可在离开后查看进度并在敏感操作前做人工确认。
GRASP 是面向学习得到的动力学(世界模型)的新型梯度规划器,靠三项设计让长时域规划变得可行。它将轨迹提升到虚拟状态,使优化可沿时间并行;把随机性直接加进状态迭代用于探索;并重塑梯度,让动作获得干净信号,同时避开高维视觉模型中脆弱的 state-input 梯度。