跳到正文

模型发布

新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。

最新精选

第 21–40 条 · 共 45 条
7月2日周四
7月1日周三
6月30日周二
  1. Google Research62

    Google Research 推出零样本表格基础模型 TabFM

    Google Research 推出零样本表格基础模型 TabFM,一次前向即可对未见过的表做分类和回归,无需逐表训练、调参和特征工程。它把整张表当作统一提示,用行列交替注意力、行压缩和 Transformer 做上下文学习,全部基于数亿个结构因果模型合成的数据集预训练。

    推荐理由:把表格预测改写成上下文学习之后,读者可以对照传统树模型流程判断单次前向能否省掉调参和特征工程。

6月23日周二
  1. Mistral AI65

    Mistral 发布 OCR 4,支持边界框、块分类与 170 种语言

    Mistral 发布 Mistral OCR 4,在提取文本之外返回边界框、类型化块分类和行内置信度,支持 10 个语系共 170 种语言,并可在单个容器中完全自托管。

    推荐理由:官方说明 Mistral OCR 4 在文本之外返回边界框、块分类和置信度,并公布人工评测胜率与基准分数,便于评估其进入检索和自托管流水线的条件。

6月11日周四
  1. Google DeepMind70

    Google DeepMind发布实验性开源模型DiffusionGemma,文本生成最高快4倍

    Google DeepMind发布实验性开源模型DiffusionGemma,这款26B MoE以文本扩散整块并行生成文本,在专用GPU上最高可实现4倍加速。

    推荐理由:DiffusionGemma把本地文本生成从逐token解码改成整段并行起草,并交代相对Gemma 4的速度、显存和质量取舍,便于判断它适合哪些交互式本地工作流。

6月9日周二
  1. Google DeepMind73

    Google 发布 Gemini 3.5 Live Translate,支持 70 多种语言近实时语音翻译

    Google 发布音频模型 Gemini 3.5 Live Translate,可自动检测 70 多种语言,并近实时生成保留语调、节奏和音高的语音翻译。

    推荐理由:相比轮次等待后再译,Gemini 3.5 Live Translate 会持续出声并落后说话人仅几秒,读者可据此了解它进入翻译应用、Meet 和开发接口后的实时互译方式。

  2. Google DeepMind76

    Google DeepMind 发布无编码器统一多模态模型 Gemma 4 12B

    Google DeepMind 发布面向笔记本的 Gemma 4 12B,采用无编码器统一架构,让视觉和音频直接进入 LLM 主干。它是该系列首个支持原生音频输入的中等尺寸模型,标准基准表现接近 26B MoE,总内存不到后者一半,16GB VRAM 或统一内存即可本地运行,以 Apache 2.0 许可发布并配备 MTP drafter。

    推荐理由:它位于端侧友好的E4B与更先进的26B MoE之间,用无编码器设计把视觉和音频直接交给语言模型,并以不到一半内存接近更大模型的基准表现。

5月22日周五
  1. Mistral AI72

    Mistral 发布 Mistral Medium 3.5,并在 Mistral Vibe 与 Le Chat 上线云端远程编程智能体

    Mistral 发布 128B 稠密开源权重模型 Mistral Medium 3.5,并将其作为 Mistral Vibe 与 Le Chat 的默认模型,同时上线可在云端并行异步运行的远程编程智能体。

    推荐理由:新的128B开源权重模型把编程会话放到云端并行运行,开发者可在离开后查看进度并在敏感操作前做人工确认。

5月18日周一
  1. Google DeepMind79

    Google DeepMind 推出 Gemini Omni Flash,可用多模态输入生成并对话编辑视频

    Google DeepMind 推出 Gemini Omni 家族的首个模型 Gemini Omni Flash,可将图像、音频、视频和文本作为输入生成视频,并用自然语言多轮编辑且保持角色、物理和场景连贯。

    推荐理由:官方同时给出对话式编辑、物理与世界知识约束以及SynthID核验路径,读者可以据此判断这款视频模型会怎样进入现有创作流程。

5月16日周六
  1. Google DeepMind83

    Google DeepMind 发布 Gemini 3.5 并开放 3.5 Flash

    Google DeepMind 发布 Gemini 3.5 模型家族,并开放 Gemini 3.5 Flash,使其成为全球 Gemini 应用和 Google 搜索 AI Mode 的默认模型,同时进入 Google Antigravity、Gemini API 及企业平台。

    推荐理由:3.5 Flash已同时向用户、开发者和企业开放,智能体与编码基准超过Gemini 3.1 Pro,可比较其速度和落地范围。

4月16日周四
  1. Google DeepMind63

    Google DeepMind 发布 Gemini 3.1 Flash TTS,可用音频标签控制语音表达

    Google DeepMind发布Gemini 3.1 Flash TTS,用可嵌入文本的音频标签控制风格、语速与表达。该模型即日起向开发者通过Gemini API和Google AI Studio预览,企业通过Vertex AI预览,Workspace用户可通过Google Vids使用。

    推荐理由:开发者可以把自然语言音频标签直接写进文本,在句中切换语气和语速,再将同样的参数导出为Gemini API代码,以便在不同项目中保持一致音色。

4月13日周一
  1. Google DeepMind63

    Google DeepMind 发布 Gemini Robotics-ER 1.6,强化具身推理与仪表读数

    Google DeepMind 发布 Gemini Robotics-ER 1.6,将其作为机器人的高层推理模型,强化空间与物理推理、多视角理解及任务成功检测,并新增仪表读数。

    推荐理由:新版相对 Gemini Robotics-ER 1.5 与 Gemini 3.0 Flash 强化了空间指向、物体计数、多视角成功检测以及仪表读数能力,开发者现可在 Gemini API 与 Google AI Studio 中直接配置调用。

4月3日周五
3月24日周二
  1. Mistral AI66

    Mistral AI 发布 4B 参数文本转语音模型 Voxtral TTS

    Mistral AI 发布 4B 参数文本转语音模型 Voxtral TTS,支持 9 种语言,API 价格为每 1k 字符 $0.016。母语者评测显示其自然度优于 TTFA 相近的 ElevenLabs Flash v2.5 且情感引导与 v3 持平,10 秒、500 字符输入的模型延迟为 70ms,实时率约 9.7 倍。

    推荐理由:母语者对照显示 Voxtral TTS 自然度高于 TTFA 相近的 ElevenLabs Flash v2.5,情感引导与 v3 持平。

3月17日周二
2月5日周四
  1. Mistral AI66

    Mistral 发布 Voxtral Transcribe 2 批量与实时语音转写模型

    Mistral 发布 Voxtral Transcribe 2,提供批量与实时两款语音转写模型。Voxtral Realtime 采用流式架构,延迟可配置至 sub-200ms,480ms 延迟时词错误率维持在 1-2%,约 4B 参数,以 Apache 2.0 在 Hugging Face 开放权重,API 为 $0.006/min。

    推荐理由:官方把实时转写的开放权重、可配置延迟和批量转写的价格与说话人分离放在同一发布里,方便按延迟和成本比较接入方式。

12月9日周二
  1. Mistral AI76

    Mistral 发布 Devstral 2、Devstral Small 2 与 Vibe CLI

    Mistral 发布开源编码模型 Devstral 2(123B)和 Devstral Small 2(24B),并推出由 Devstral 驱动的开源命令行助手 Mistral Vibe CLI。

    推荐理由:官方同时发布两档开源编码模型与命令行智能体,读者可以按参数量、基准得分和后续接口价格比较本地部署与闭源方案的取舍。

12月3日周三
7月15日周二
7月11日周五
  1. Mistral AI69

    Mistral 发布 Devstral Medium 并升级 Devstral Small 1.1

    Mistral AI 联合 All Hands AI 发布 Devstral Medium,并将 Devstral Small 升级为 Apache 2.0 开源的 1.1。

    推荐理由:合作推出的开源模型 Devstral Small 1.1 在 SWE-Bench Verified 得到 53.6% 且每百万输入 token 价格为 $0.1,性能更高的 Devstral Medium 则以 61.6% 得分和 $0.4 的同等计价提供 API 与私有部署选择。