跳到正文

全部动态

今日 14 条
7月16日周四
7月15日周三
  1. Hugging Face Blog52

    Hume 推出 Real World VoiceEQ,衡量语音 AI 的真实人类交互质量

    Hume 发布 Real World VoiceEQ,用超过 100 万次人工评分,在 15 个以上维度和 60 多项指标上评估 40 多个专有与开源语音模型。评测覆盖自动语音识别、文字转语音、语音到语音和语音理解,目前包含 785,000 条 TTS 评分与 48,000 条 STS 评分。文字转语音中没有任何系统配置在八个能力组全部进入前五,噪声背景下的转写字错率约为音乐背景的四倍。

7月10日周五
  1. Hugging Face Blog61

    PyTorch Profiling 第三篇:如何从轨迹看懂注意力实现

    Hugging Face 的 PyTorch Profiling 系列第三篇,在 NVIDIA A100-SXM4-80GB 上用 profiler 对照了手写因果注意力和 SDPA 的 math、efficient、flash、cudnn 后端。

    推荐理由:把朴素注意力和 SDPA 四个后端放进同一套 profiler 轨迹后,可以看出融合如何避免中间分数矩阵写入显存,以及 flash 很低的占用率为何仍可能更快。

7月9日周四
7月8日周三
  1. Hugging Face Blog58

    transformers的vLLM建模后端达到原生推理速度

    transformers的vLLM建模后端现已在许多LLM架构上达到或超过手写vLLM实现的速度,模型作者可直接复用transformers代码获得高速推理。对比覆盖Qwen3-4B单GPU、Qwen3-32B的双GPU张量并行,以及Qwen3-235B-A22B-FP8在同一8×H100节点上的数据并行加专家并行,该后端吞吐均达到或超过原生实现。

7月7日周二
7月6日周一
7月3日周五
  1. Google DeepMind50

    Google DeepMind与A24宣布研究合作,Google已投资A24

    Google DeepMind与A24今天宣布以研究为重点的同类首个合作,帮助艺术家开发新工作流和技术,Google并对A24作出投资。双方将开展跨越多个项目的深度研发,把创新放进创作过程,由A24电影人帮助塑造技术并拓展叙事可能,同时向DeepMind提供艺术家反馈。合作初期聚焦连接前沿技术与下一代娱乐,具体目标、技术产出和创作里程碑将随时间演变。

7月2日周四
7月1日周三
6月30日周二
  1. Google Research62

    Google Research 推出零样本表格基础模型 TabFM

    Google Research 推出零样本表格基础模型 TabFM,一次前向即可对未见过的表做分类和回归,无需逐表训练、调参和特征工程。它把整张表当作统一提示,用行列交替注意力、行压缩和 Transformer 做上下文学习,全部基于数亿个结构因果模型合成的数据集预训练。

    推荐理由:把表格预测改写成上下文学习之后,读者可以对照传统树模型流程判断单次前向能否省掉调参和特征工程。

6月25日周四
  1. Google Research54

    推理如何解锁大语言模型中的参数知识

    Google Research发现,开启推理能让模型召回简单单跳问题上关闭推理时几乎无法得到的事实,机制是计算缓冲和factual priming。对Gemini-2.5 Flash、Pro与Qwen3-32B,等长重复Let me think已明显好于关闭推理,但始终不能完全赶上自然轨迹;相关事实即使在推理关闭时也能挽回大部分增益。

  2. Google DeepMind72

    Gemini 3.5 Flash 内置计算机使用以构建跨平台智能体

    计算机使用现已成为 Gemini 3.5 Flash 的内置工具,开发者可构建在浏览器、移动端和桌面中观察、推理并执行操作的自定义智能体。

    推荐理由:原先独立的Gemini 2.5计算机使用模型已并入Gemini 3.5 Flash,开发者可据此构建跨端长程自动化智能体,并选用操作确认与注入拦截。

6月23日周二
  1. Mistral AI65

    Mistral 发布 OCR 4,支持边界框、块分类与 170 种语言

    Mistral 发布 Mistral OCR 4,在提取文本之外返回边界框、类型化块分类和行内置信度,支持 10 个语系共 170 种语言,并可在单个容器中完全自托管。

    推荐理由:官方说明 Mistral OCR 4 在文本之外返回边界框、块分类和置信度,并公布人工评测胜率与基准分数,便于评估其进入检索和自托管流水线的条件。

6月22日周一
6月13日周六
6月11日周四
  1. Google DeepMind70

    Google DeepMind发布实验性开源模型DiffusionGemma,文本生成最高快4倍

    Google DeepMind发布实验性开源模型DiffusionGemma,这款26B MoE以文本扩散整块并行生成文本,在专用GPU上最高可实现4倍加速。

    推荐理由:DiffusionGemma把本地文本生成从逐token解码改成整段并行起草,并交代相对Gemma 4的速度、显存和质量取舍,便于判断它适合哪些交互式本地工作流。

6月9日周二
  1. Google DeepMind73

    Google 发布 Gemini 3.5 Live Translate,支持 70 多种语言近实时语音翻译

    Google 发布音频模型 Gemini 3.5 Live Translate,可自动检测 70 多种语言,并近实时生成保留语调、节奏和音高的语音翻译。

    推荐理由:相比轮次等待后再译,Gemini 3.5 Live Translate 会持续出声并落后说话人仅几秒,读者可据此了解它进入翻译应用、Meet 和开发接口后的实时互译方式。

  2. Google DeepMind76

    Google DeepMind 发布无编码器统一多模态模型 Gemma 4 12B

    Google DeepMind 发布面向笔记本的 Gemma 4 12B,采用无编码器统一架构,让视觉和音频直接进入 LLM 主干。它是该系列首个支持原生音频输入的中等尺寸模型,标准基准表现接近 26B MoE,总内存不到后者一半,16GB VRAM 或统一内存即可本地运行,以 Apache 2.0 许可发布并配备 MTP drafter。

    推荐理由:它位于端侧友好的E4B与更先进的26B MoE之间,用无编码器设计把视觉和音频直接交给语言模型,并以不到一半内存接近更大模型的基准表现。

6月8日周一
  1. Google DeepMind60

    Google DeepMind衡量Gemini引导式学习在塞拉利昂的影响

    Google DeepMind的塞拉利昂预注册试验显示,Guided Learning组数学成绩比对照组高0.258个标准差,八周约合1.2到1.7年进度。逾113,000次互动中,91.4%的对话用于建立概念理解,Gemini在76%的消息里提出脚手架问题,只在2%的情形直接给解答;技能建构类提问由首周68%升至末周90%,寻求直接解答的提问由25%降至10%。

    推荐理由:塞拉利昂八周试验显示,引导式学习带来0.258个标准差的数学增益,约一半课时使用Gemini的班级约合1.8到2.5年进度。

6月5日周五
6月4日周四
5月28日周四
  1. Mistral AI72

    Mistral 上线统一智能体 Vibe,Le Chat 对话与套餐一并迁移

    Mistral 上线统一智能体 Vibe,把 Le Chat 收成覆盖办公与编码的同一产品和许可,原有对话、设置与套餐已迁移。Work Mode 可在网页和移动端跨企业工具处理收件、研究与文档等长任务,Code Mode 则在隔离沙箱中把编码做到可审查的 pull request,并提供 VS Code 扩展与 CLI。

    推荐理由:Vibe 将办公长任务与编码会话收进同一智能体,并公开网页、VS Code 和 CLI 入口,读者可以对照它如何承接从计划确认到可审查改动的流程。

  2. Mistral AI61

    Mistral AI 以公开预览发布开源 Search Toolkit

    Mistral AI 今日以公开预览发布开源 Search Toolkit,把数据接入、检索和评测统一为面向 AI 应用的生产级搜索管线。检索支持 BM25 稀疏检索、稠密嵌入检索和混合配置,评测内置召回率、精确率、MRR 与 NDCG,可在自有测试集上对比配置。框架可在云端、本地或边缘运行;CMA CGM 将其与 Voxtral 配合处理三个音频来源,并在 15 秒内端到端返回预警。

    推荐理由:它把文档接入、混合检索和内置评测收进同一开源框架,便于团队在自有数据上单独比较检索配置并衡量质量。

5月26日周二
5月22日周五
  1. Mistral AI72

    Mistral 发布 Mistral Medium 3.5,并在 Mistral Vibe 与 Le Chat 上线云端远程编程智能体

    Mistral 发布 128B 稠密开源权重模型 Mistral Medium 3.5,并将其作为 Mistral Vibe 与 Le Chat 的默认模型,同时上线可在云端并行异步运行的远程编程智能体。

    推荐理由:新的128B开源权重模型把编程会话放到云端并行运行,开发者可在离开后查看进度并在敏感操作前做人工确认。

5月20日周三
5月19日周二
5月18日周一
  1. Google DeepMind79

    Google DeepMind 推出 Gemini Omni Flash,可用多模态输入生成并对话编辑视频

    Google DeepMind 推出 Gemini Omni 家族的首个模型 Gemini Omni Flash,可将图像、音频、视频和文本作为输入生成视频,并用自然语言多轮编辑且保持角色、物理和场景连贯。

    推荐理由:官方同时给出对话式编辑、物理与世界知识约束以及SynthID核验路径,读者可以据此判断这款视频模型会怎样进入现有创作流程。

5月17日周日