Basis 用 GPT-6 Astra 以 2 倍速度完成税务工作簿
Basis 用 GPT-6 Astra 完成一份含 50 个标签页的税务工作簿,速度达到 GPT-5.6 Sol 的 2 倍。GPT-6 Astra 对用户意图的理解更强,让 Basis 对真实场景使用更有信心。
Basis 用 GPT-6 Astra 完成一份含 50 个标签页的税务工作簿,速度达到 GPT-5.6 Sol 的 2 倍。GPT-6 Astra 对用户意图的理解更强,让 Basis 对真实场景使用更有信心。
MindTopo 基准显示,多模态模型识别静态拓扑关系的表现明显强于交互规划,且两者都远低于人类。它按连续性、分离、顺序、包围和结五类,分别测试推理与规划;规划错误常出现在理解场景之后,模型会丢失结构关系或提出违反环境动态的动作。图像生成只在关系可见于单帧时偶尔有帮助,视频推演则经常改变拓扑或违反任务动态。
Hume 发布 Real World VoiceEQ,用超过 100 万次人工评分,在 15 个以上维度和 60 多项指标上评估 40 多个专有与开源语音模型。评测覆盖自动语音识别、文字转语音、语音到语音和语音理解,目前包含 785,000 条 TTS 评分与 48,000 条 STS 评分。文字转语音中没有任何系统配置在八个能力组全部进入前五,噪声背景下的转写字错率约为音乐背景的四倍。