智能体跑得久还要会掉头:Argus修复任务约78%,代价是1.41倍Token
微软与上海交通大学、复旦大学、南京大学、清华大学、香港大学、北京大学等机构发布Argus,一个面向长程推理的持久智能体运行时。模型权重不变,系统通过角色分工、项目状态、验证记录和控制策略积累经验。
从最新学术论文中提炼值得关注的技术进展、实验结果和产业信号。
微软与上海交通大学、复旦大学、南京大学、清华大学、香港大学、北京大学等机构发布Argus,一个面向长程推理的持久智能体运行时。模型权重不变,系统通过角色分工、项目状态、验证记录和控制策略积累经验。
普林斯顿大学、卡内基梅隆大学、多伦多大学、伊利诺伊大学厄巴纳-香槟分校、斯坦福大学和牛津大学团队提出“技能熵”,专门衡量大模型在一条推理链中从一种技能切换到另一种技能的难度。
中国科学技术大学和京东探索研究院提出OmniVR,用一个22B参数音视频生成模型同时修复历史影片。输入里的模糊、噪点、闪烁、低曝光、嘶声、削波和声音缺失,会在统一扩散过程中处理,而不是先修画面、再接独立音频工具。
阿里巴巴、浙江大学、北京航空航天大学和字节跳动团队发布MetaVideoAgent,让长视频问答智能体根据目标视频类型自动修改自己的处理流程。四轮进化后,八类视频的宏平均准确率从38.44%升到51.47%。
清华大学、南京大学、快手可灵团队、上海科技大学和香港科技大学提出ContextMaster。它把文字生成、参考图生成和视频编辑放进同一个多轮工作流,每次接受的新镜头都会加入历史,供后续镜头继续使用。
洛桑联邦理工学院和英国人工智能安全研究所研究者测试了七个前沿推理模型:当提示词明确要求模型受某个线索影响并隐瞒原因时,思维链监控器能发现60%至94%的行为变化;同一线索若只是自然地混在上下文里,检出率会明显下降。
伊利诺伊大学厄巴纳-香槟分校、Google DeepMind和OpenAI研究者提出CoCo-IR,把“拿一张参考图加一句修改要求”的图像检索,扩展为可连续追问的多轮搜索。用户可以先换颜色,再改背景,随后引用前面某一轮的视角或物体继续筛选。
斯坦福大学等机构推出DelusionEval,用经历过妄想和心理伤害的用户对话测试聊天机器人。评测包含18名参与者、589段对话历史和12591条消息,观察模型是否迎合妄想、夸大自身能力、制造亲密关系,或未能劝阻自伤与暴力。
东京大学、字节跳动Seed、香港大学、上海交通大学和清华大学团队发布SiMDex。它没有扩大机器人模型,也没有增加训练数据量,而是从约3200万段人类第一视角视频中筛出约149万段与目标动作相近的样本,再用于视觉—语言—动作模型后训练。
长视频编辑智能体要连续做素材选择、剪切、排序、字幕和导出,最终成片出炉后才得到好坏评价。阿里巴巴、中国科学技术大学等机构提出GRPB,把同一任务多版成片的相对排名,重新分配给中间编辑片段,用于训练9B参数的Crayotter。
论文公开页面未披露作者机构。Video-DeepResearch团队研究的任务要求模型先在连续画面里找到人物或物体,再去网页补充外部知识;团队发现,现有智能体常跳过视觉工具直接搜索文字,或凭模型记忆作答。新系统因此分阶段开放工具,强制先完成
上海财经大学与复旦大学研究者的一项开源社区模拟发现,引入编码智能体后,完成任务数增加39%,中位完成时间从45分钟缩短到20分钟;同一批工作留下的公共知识更难被后续开发者利用,标准化检索中的覆盖率只有22.3%,真实人类语料为81.1%。
音频模型答对一道题,可能靠文字常识猜中,未必真正听懂声音。微软研究院、马里兰大学、伊利诺伊大学和MBZUAI团队提出AudioRubrics,为每个样本生成基于原始波形的评分表,并在训练中根据模型的新回答持续改写标准。
带长期记忆的AI智能体会把历史交互写入数据库,后续遇到相似问题再检索。香港科技大学团队提出的MAFIA攻击只通过普通查询和写入接口投放恶意记录,在论文测试中最高取得90.7%的攻击成功率,并把审计检测率压到不超过7.4%。
DT-Project研究者的一项0.6B语言模型改造实验出现了反常结果:学生模型的困惑度已经接近教师,C-Eval选择题准确率却只有25%至29%,并在81%的回答中预测“A”。问题不在于知识全部丢失,而是模型没有跟随答案内容切换选项标签。
腾讯、帝国理工学院、密歇根大学等机构的研究人员提出LoCA。它先用一次反向传播完成校准,后续适配只运行前向计算和局部闭式求解。包含校准在内,全程GPU峰值内存比LoRA低26%至29%。
浙江大学、上海交通大学和上海创新研究院等团队提出Track4Action,把机器人演示视频中的3D场景变化变成训练监督。传统模仿学习通常只学习“下一步执行什么命令”,动作让物体、遮挡和相机视角发生了什么变化,并没有被直接写进标签;新方法在四
网页里连续出现几张相同卡片,其中一张明显更宽。多模态模型先算出它接近120%,最后却把代码填成和其他卡片一样的100%。一项由威廉与玛丽学院团队完成的研究,把这种错误称为“视觉模式补全偏差”。
腾讯混元公布Hunyuan3D-Buffalo 1.0,把3D问答与定位、文本生成3D、指令编辑3D和指定部件生成放进同一套架构。训练语料总规模为8700万条,包括2500万理解样本、5000万文本到3D配对和1200万编辑配对。
复旦大学、哈尔滨工业大学和北京大学等团队复现了bfloat16 Transformer训练中的突然崩溃:模型可以正常运行很多步,注意力随后快速失控。研究发现,不同位置的低精度误差最终会汇入查询—键权重的共同通道。