ALTK-Evolve探讨智能体实际需要多少记忆
ALTK-Evolve在AppWorld test_normal上对照八个模型发现,自蒸馏记忆的合适剂量取决于模型能力。强模型DeepSeek-V3.2注入全量指南后TGC提升9.5个百分点,弱模型gpt-oss-120b用精选检索提升16.1个百分点且token仅增5%,饱和模型GLM-5增益为0。这些指南从智能体过往轨迹蒸馏,推理时注入,不更新模型权重,也不需要人工标注。
ALTK-Evolve在AppWorld test_normal上对照八个模型发现,自蒸馏记忆的合适剂量取决于模型能力。强模型DeepSeek-V3.2注入全量指南后TGC提升9.5个百分点,弱模型gpt-oss-120b用精选检索提升16.1个百分点且token仅增5%,饱和模型GLM-5增益为0。这些指南从智能体过往轨迹蒸馏,推理时注入,不更新模型权重,也不需要人工标注。
多伦多大学等机构用可装入单块80GB A100的开源权重LLM,做出自我复制的AI蠕虫原型,完整攻击成功率约37%。约1337名来自OpenAI、Anthropic、Google DeepMind、Meta等机构的人士请求美国政府支持国际努力,开发有意放缓自动化AI研发前沿所需的技术与治理工具。