CAFE: Self-Improving Search Agents Need Co-Evolving Feedback
CAFE:自改进搜索智能体需要协同演化的反馈
机构 * Fudan University(复旦大学) ; Tencent(腾讯)
AI总结 该研究提出 CAFE 框架,通过共享参数模型耦合搜索智能体与评判者的协同演化反馈,在七个及六个域外搜索基准上均优于现有 RL 智能体,减少答案幻觉且性能持续提升。
高校专区
CAFE:自改进搜索智能体需要协同演化的反馈
机构 * Fudan University(复旦大学) ; Tencent(腾讯)
AI总结 该研究提出 CAFE 框架,通过共享参数模型耦合搜索智能体与评判者的协同演化反馈,在七个及六个域外搜索基准上均优于现有 RL 智能体,减少答案幻觉且性能持续提升。
StepGuard:利用可扩展监督与安全-效用平衡学习步骤级护栏
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Beihang University(北京航空航天大学) ; Fudan University(复旦大学) ; Renmin University of China(中国人民大学) ; KAUST(阿卜杜拉国王科技大学)
AI总结 该研究针对LLM智能体交互的安全风险,提出步骤级护栏模型StepGuard,通过自动数据引擎StepGen与动态平衡学习方法Balance-GRPO训练,在降低攻击成功率的同时仅小幅影响效用。
Comments Accepted by EMNLP 2026. Project page: this https URL (https://zheng977.github.io/StepGuard/)
IAPO:面向多轮服务智能体信用分配的感知影响策略优化
机构 * Fudan University(复旦大学) ; WeChat, Tencent Inc.(腾讯公司微信业务)
AI总结 本研究提出IAPO方法,将轨迹转化为影响依赖图以优化多轮服务智能体的信用分配,在三个服务智能体基准及BFCL-v4多轮任务上,性能优于多轮RL基线。
Comments 12 pages, 3 figures, 5 tables. Preprint
等变协方差张量:张量值几何学习的保证SPD不确定性
机构 * College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院) ; School of Microelectronics, Fudan University(复旦大学微电子学院) ; ByteDance(字节跳动) ; School of Information Science and Engineering, East China University of Science and Technology(华东理工大学信息科学与工程学院)
AI总结 针对几何深度学习中张量值预测的不确定性量化难题,提出E(3)等变UQ框架,通过分解协方差与矩阵指数法保证正定性,构建LE-ESO损失,在两类数据集上验证了方法的竞争力与不确定性估计的有效性。
Comments Accepted to ICML 2026
面向机器人操作的轨迹级连续动作表示
机构 * Fudan University(复旦大学) ; TeleAI, China Telecom(中国电信TeleAI)
AI总结 该研究提出CAT轨迹级连续动作表示框架,通过频率感知位置编码等技术解决现有视觉运动系统的动作表示冗余问题,在LIBERO等数据集上显著提升机器人操作任务成功率。
扩散模型与基于流的模型中的表示学习:应用视角
机构 * Fudan University(复旦大学) ; School of Artificial Intelligence, OPtics and ElectroNics (iOPEN), Northwestern Polytechnical University(西北工业大学光学与电子信息人工智能学院(iOPEN)) ; The University of Hong Kong(香港大学)
AI总结 本综述聚焦应用场景,提出三层渐进框架,梳理扩散与基于流的模型中表示学习的双向关系,分类下游任务方法,明确研究挑战并指明未来方向,为相关应用研究提供参考。
Comments Accepted by Vicinagearth
IterCAD:基于正交视图的CAD代码生成的迭代程序修复方法
机构 * Fudan University(复旦大学) ; ByteDance Inc.(字节跳动公司)
AI总结 IterCAD是一种迭代框架,将正交视图转CAD代码任务重构为渐进式程序修复,通过三阶段训练与监督集优化,在CADExpert上显著提升了代码可执行性与几何保真度。
Comments Accepted to the 34th ACM International Conference on Multimedia (ACM MM 2026)
SAGE:面向中国古代文献理解的从直接回答到证据导向推理
机构 * Fudan University(复旦大学) ; University of Liverpool(利物浦大学)
AI总结 针对现有大型视觉语言模型(LVLMs)在古代文献理解中证据支撑不足的问题,本文提出SAGE多智能体框架,通过多阶段证据导向推理实现任务规划、证据获取与验证,在AncientDoc基准上优于基线,搭载Qwen3.5-9B的SAGE性能超更大单体模型。
AffineTok:面向扩散模型友好型视觉分词器的语义仿射一致性
机构 * Fudan University(复旦大学) ; Alibaba Group(阿里巴巴集团)
AI总结 本文提出AffineTok,通过语义仿射一致性(SAC)引导视觉分词器训练,引入M_SAC作为代理指标,在ImageNet 256上实现了gFID的显著降低,达到无引导1.21、有引导1.10的SOTA性能。
Comments Project page: this https URL (https://michaelyu781.github.io/AffineTok-site/)
统一多模态模型中视觉生成何时能助力视觉理解?
机构 * Nanjing University(南京大学) ; Tsinghua University(清华大学) ; Fudan University(复旦大学)
AI总结 本研究提出VGAU-Diag评估框架,发现统一多模态模型的视觉生成仅在简单任务上助益理解,瓶颈多在理解侧,有效生成需瞄准理解瓶颈。
技能条件门控自蒸馏用于大语言模型推理
机构 * Tsinghua University(清华大学) ; Fudan University(复旦大学) ; City University of Hong Kong(香港城市大学) ; Huazhong University of Science and Technology(华中科技大学) ; University of Wisconsin-Madison(威斯康星大学麦迪逊分校)
AI总结 提出技能条件门控自蒸馏(SGSD),通过从经验技能库中检索技能-错误对构建多教师池,并利用验证器验证教师极性,以鲁棒门控目标蒸馏信息性师生差异,在弱先验信息假设下提升数学推理性能。
Comments Accepted by EMNLP 2026 Findings. Code is available at this https URL (https://github.com/walawalagoose/SGSD)
LLM代理市场中的战略利用:电子商务信任的模拟框架
机构 * Northwestern Polytechnical University(西北工业大学) ; Boston University(波士顿大学) ; Fudan University(复旦大学) ; Wuhan University(武汉大学) ; Chinese Academy of Sciences(中国科学院) ; University of Oxford(牛津大学)
AI总结 本文提出TruthMarketTwin模拟框架,用于研究LLM代理在电子商务市场中的行为,发现LLM代理在传统市场中会利用声誉治理的弱点,而强制执行可减少欺骗并重塑战略推理。
Tora3:基于轨迹的音频视频生成与物理一致性
机构 * Alibaba Cloud Computing(阿里巴巴云 computing) ; Fudan University(复旦大学)
AI总结 Tora3通过引入轨迹作为共享的运动先验,提升音频视频生成的物理一致性,采用轨迹对齐的运动表示和混合流匹配方案,改进运动真实性和运动-声音同步性。
Comments accepted by ACM MM 2026
大语言模型对顺序敏感性如何?OrderProbe用于确定性结构重建
机构 * Peking University(北京大学) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; City University of Hong Kong(香港城市大学) ; Fudan University(复旦大学) ; The Hong Kong Polytechnic University(香港理工大学) ; Tsinghua University(清华大学) ; Zhejiang University(浙江大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学香槟分校) ; Marquette University(马凯特大学) ; Juniata College(朱尼阿特学院)
AI总结 研究通过OrderProbe基准评估大语言模型对输入顺序的敏感性,发现即使在前沿模型上,结构重建仍面临挑战,且语义能力与结构鲁棒性存在脱节。
Comments EMNLP 2026 Findings