Google DeepMind 重新构想由 Gemini 驱动的 AI 鼠标指针
Google DeepMind 正探索由 Gemini 驱动的 AI 鼠标指针,让系统理解用户所指内容及其重要性,从而在现有工具中直接协作。他们提出保持流程、看图说明、用简短指代配合语音,以及把像素变成可操作实体四项原则。
推荐理由:文中提出四条交互原则,说明指针如何在当前工具里理解所指内容,把详细提示和跨窗口搬运换成指向与口语。
文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。
Google DeepMind 正探索由 Gemini 驱动的 AI 鼠标指针,让系统理解用户所指内容及其重要性,从而在现有工具中直接协作。他们提出保持流程、看图说明、用简短指代配合语音,以及把像素变成可操作实体四项原则。
推荐理由:文中提出四条交互原则,说明指针如何在当前工具里理解所指内容,把详细提示和跨窗口搬运换成指向与口语。
Mistral 发布 Mistral Small 4,把 Magistral 的推理、Pixtral 的多模态和 Devstral 的智能体编码整合进同一模型,并以 Apache 2.0 许可开源。
推荐理由:公告把推理、多模态和智能体编码收进同一开源模型,并给出相对 Mistral Small 3 的完成时间与每秒请求数变化。
Mistral AI 发布开源模型家族 Mistral 3,含 14B、8B、3B 的 Ministral 3,以及激活 41B、总参数 675B 的稀疏 MoE 模型 Mistral Large 3。
推荐理由:官方这次把稀疏大模型与三档端侧小模型一起开源,读者可以对照参数规模、许可证和推理变体来选择部署方式。
Mistral AI 发布 Mistral Medium 3,主打 SOTA 性能、8X 更低成本和更简单的部署,并称其在各项基准上达到 Claude Sonnet 3.7 至少 90% 的表现,API 价格为输入 $0.4、输出 $2 per M token。
推荐理由:读者可据此对照 Mistral Medium 3 相对 Claude Sonnet 3.7 至少九成的基准表现、每百万 token 输入与输出价格,以及四张 GPU 起即可自托管的企业部署条件。
Mistral AI 发布 Mistral Small 3.1,在 Mistral Small 3 基础上提升文本表现与多模态理解,上下文窗口扩至 128k tokens,推理速度为每秒 150 tokens,并称其超过 Gemma 3 和 GPT-4o Mini。
推荐理由:官方发布的 Mistral Small 3.1 在同权重级别提升文本表现、多模态理解与最长 128k 的上下文窗口,并给出每秒 150 tokens 的推理速度以及单张 RTX 4090 或 32GB 内存 Mac 的本地运行条件。
Mistral 推出 OCR API Mistral OCR,可将图片和 PDF 提取为有序交错的文本与图像,并作为 Le Chat 数百万用户的默认文档理解模型。
推荐理由:官方公布了复杂文档理解的内部基准、每美元页数和单节点处理速度,便于对照现有 OCR 服务评估精度与接入成本。