JIT-Agent: Scaling Harness Intelligence via Just-in-Time Harness Evolution
JIT-Agent:通过即时测试框架演进扩展测试框架智能
机构 * LV-NUS Lab(LV-NUS实验室)
AI总结 JIT-Agent是首个专为即时生成智能体测试框架设计的模型,可定制、修复、自我演进测试框架,提升DeepSeek、GLM等模型在多基准任务的性能,确立测试框架智能为智能体能力的独立可扩展维度。
高校专区
JIT-Agent:通过即时测试框架演进扩展测试框架智能
机构 * LV-NUS Lab(LV-NUS实验室)
AI总结 JIT-Agent是首个专为即时生成智能体测试框架设计的模型,可定制、修复、自我演进测试框架,提升DeepSeek、GLM等模型在多基准任务的性能,确立测试框架智能为智能体能力的独立可扩展维度。
智能体游戏开发:用于扩展世界模型的可验证轨迹数据引擎
机构 * Cardinal AI Lab(卡迪纳尔人工智能实验室) ; University of California, Berkeley(加州大学伯克利分校) ; Hong Kong University of Science and Technology(香港科技大学) ; National University of Singapore(新加坡国立大学) ; HPC-AI Lab(高性能计算与人工智能实验室)
AI总结 本文指出扩展世界模型的传统策略效率低,提出将游戏开发作为可验证轨迹数据引擎,构建RLHEV后训练范式,为空间世界模型提供高质量奖励信号与长程轨迹数据。
ReliableRAG:通过可靠性引导推理链对抗检索增强生成中的错误信息
机构 * College of Software, Jilin University(吉林大学软件学院) ; College of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院) ; Key Laboratory of Symbolic Computation and Knowledge Engineering of Ministry of Education, College of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院 教育部符号计算与知识工程重点实验室) ; College of Computer Science and Technology, Dalian University of Technology(大连理工大学计算机科学与技术学院) ; National University of Singapore(新加坡国立大学) ; School of Computer Science, Zhuhai College of Science and Technology(珠海科技学院计算机学院)
AI总结 ReliableRAG是首个通过细粒度评估三元组缓解多跳问答中欺骗性错误信息的可靠性驱动框架,可提升RAG系统的事实可靠性与鲁棒性。
TailSieve:面向大语言模型(LLM)rollout的部分rollout引导式长尾路由
机构 * Qwen Business Unit of Alibaba(阿里巴巴通义千问业务部) ; Carnegie Mellon University(卡内基梅隆大学) ; Zhejiang University(浙江大学) ; University of Science and Technology of China(中国科学技术大学) ; National University of Singapore(新加坡国立大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
AI总结 TailSieve是面向LLM rollout的部分rollout引导式框架,通过联合控制长尾路由与副本分配,仅路由即可实现最高1.67倍加速,结合专用推测解码可达2.59倍加速,同时保留策略内生成并避免长度偏差。
明确用户专业能力:面向可根据用户熟练度调整响应的主动式对话智能体
机构 * School of Computing and Data Science, The University of Hong Kong(香港大学计算与数据科学学院) ; Institute of Data Science, National University of Singapore(新加坡国立大学数据科学研究所) ; College of Computer Science, Sichuan University(四川大学计算机学院)
AI总结 本研究针对现有对话智能体无法仅通过查询判断用户专业能力的缺陷,提出PASSING方法,通过LLM自博弈生成的询问策略主动明确用户专业能力,以调整响应提升用户理解,实验显示该方法具有优越性。
Comments Findings of EMNLP 2026
DAW:面向混沌系统深度学习预测的动力学感知加权方法
机构 * National University of Singapore(新加坡国立大学)
AI总结 针对混沌系统深度学习预测的长期误差累积问题,提出DAW框架,利用动力系统局部维度重塑损失,在KS方程上显著降低了长期自回归误差。
ResMerge:基于残差的谱合并大型语言模型
机构 * Southeast University(东南大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; University of Chinese Academy of Sciences(中国科学院大学) ; National University of Singapore(新加坡国立大学) ; Wuhan University of Technology(武汉理工大学) ; Peking University(北京大学) ; Wuhan AI Research(武汉人工智能研究院)
AI总结 提出ResMerge框架,通过将RL任务向量分解为谱头部和残差组件,利用残差组件构建稳定骨干并选择性引入头部信息,实现无需训练的专家模型合并。
Comments 19 pages including appendix. Accepted to the EMNLP 2026 Main Conference
通过激活回放提升大多模态模型的推理能力
机构 * Nanyang Technological University(南洋理工大学) ; National University of Singapore(国立新加坡大学) ; Tencent Youtu Lab(腾讯云图实验室) ; Zhejiang University(浙江大学) ; Fudan University(复旦大学)
AI总结 本文通过激活回放方法提升大模型的多模态推理能力,通过操控低熵激活来增强推理性能,验证了该方法在数学、视觉代理和视频推理等场景中的有效性。
Comments CVPR 2026
基于梯度的样本选择用于更快的贝叶斯优化
机构 * The University of Manchester(曼彻斯特大学) ; National University of Singapore(新加坡国立大学) ; Southern University of Science and Technology(南方科技大学)
AI总结 该研究提出GSSBO方法,通过梯度选择样本构建GP模型以降低计算复杂度,在合成与真实任务上验证其可减少BO的GP拟合成本且优化性能与基线相当。
Forge4D:基于未校准稀疏视图视频的前馈式4D人体重建与插值
机构 * HKUST(香港科技大学) ; Tongyi Lab, Alibaba Group(阿里云实验室) ; NUS(新加坡国立大学) ; FDU(福建大学)
AI总结 提出Forge4D模型,将4D人体重建与插值简化为流式3D高斯重建和稠密运动预测任务,结合自监督损失实现高效重建与插值,在多数据集上验证有效性。
推理还是漫谈?探究思考过程对智能体说服能力的影响
机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) ; National University of Singapore(新加坡国立大学) ; Inner Mongolia Research Institute, Shanghai Jiao Tong University(上海交通大学内蒙古研究院)
AI总结 本文对比通用LLM与LRM,发现推理对智能体说服能力存在二元性影响,还揭示其依赖表面线索的漏洞,提出提示级对抗性论点检测方法以提升鲁棒性。
Comments Accepted as EMNLP 2026 Findings