跳到正文

多模态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

最新精选

第 21–26 条 · 共 26 条
3月29日周日
  1. Google DeepMind60

    Google DeepMind 重新构想由 Gemini 驱动的 AI 鼠标指针

    Google DeepMind 正探索由 Gemini 驱动的 AI 鼠标指针,让系统理解用户所指内容及其重要性,从而在现有工具中直接协作。他们提出保持流程、看图说明、用简短指代配合语音,以及把像素变成可操作实体四项原则。

    推荐理由:文中提出四条交互原则,说明指针如何在当前工具里理解所指内容,把详细提示和跨窗口搬运换成指向与口语。

3月17日周二
12月3日周三
5月7日周三
  1. Mistral AI68

    Mistral AI 发布 Mistral Medium 3,强调更低成本与企业部署

    Mistral AI 发布 Mistral Medium 3,主打 SOTA 性能、8X 更低成本和更简单的部署,并称其在各项基准上达到 Claude Sonnet 3.7 至少 90% 的表现,API 价格为输入 $0.4、输出 $2 per M token。

    推荐理由:读者可据此对照 Mistral Medium 3 相对 Claude Sonnet 3.7 至少九成的基准表现、每百万 token 输入与输出价格,以及四张 GPU 起即可自托管的企业部署条件。

3月17日周一
  1. Mistral AI73

    Mistral AI 发布 Mistral Small 3.1,升级文本与多模态并支持 128k 上下文

    Mistral AI 发布 Mistral Small 3.1,在 Mistral Small 3 基础上提升文本表现与多模态理解,上下文窗口扩至 128k tokens,推理速度为每秒 150 tokens,并称其超过 Gemma 3 和 GPT-4o Mini。

    推荐理由:官方发布的 Mistral Small 3.1 在同权重级别提升文本表现、多模态理解与最长 128k 的上下文窗口,并给出每秒 150 tokens 的推理速度以及单张 RTX 4090 或 32GB 内存 Mac 的本地运行条件。

3月7日周五
  1. Mistral AI69

    Mistral 推出光学字符识别 API Mistral OCR

    Mistral 推出 OCR API Mistral OCR,可将图片和 PDF 提取为有序交错的文本与图像,并作为 Le Chat 数百万用户的默认文档理解模型。

    推荐理由:官方公布了复杂文档理解的内部基准、每美元页数和单节点处理速度,便于对照现有 OCR 服务评估精度与接入成本。