TIGPO: Temporal Instance-Graph Policy Optimization for Long-Horizon LLM Agents
TIGPO:用于长视野大语言模型智能体的时间实例图策略优化
机构 * Nanjing University(南京大学)
AI总结 TIGPO为长视野LLM智能体提出跨策略更新的持久转换图策略,通过分配固定回滚预算稳定优势估计,在ALFWorld和WebShop上优于现有相关方法。
高校专区
TIGPO:用于长视野大语言模型智能体的时间实例图策略优化
机构 * Nanjing University(南京大学)
AI总结 TIGPO为长视野LLM智能体提出跨策略更新的持久转换图策略,通过分配固定回滚预算稳定优势估计,在ALFWorld和WebShop上优于现有相关方法。
R2S-Eval:基于视觉语言模型的现实到仿真校准的机器人评估方法
机构 * Sharpa(夏普) ; Nanjing University(南京大学) ; Tongji University(同济大学) ; Tsinghua University(清华大学)
AI总结 R2S-Eval结合现实到仿真校准与VLM偏好评估,实现机器人操纵策略的自动化、稳定且感知质量的评估,减少硬件操作工作量并揭示二元成功标签未捕捉的行为差异。
TRACE:面向一致性、极限感知的自进化技能库
机构 * Xiaomi Inc.(小米公司) ; Nanjing University(南京大学) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; Tsinghua University(清华大学)
AI总结 TRACE是一种无需修改模型权重的自进化技能库方法,通过轨迹对比进化优化技能,在CAR-bench任务上显著提升LLM智能体的一致性性能,缩小潜在与可靠性能的差距。
Comments 9 pages, 5 figures, 2 tables
通过学习潜在控制动力学加速掩码图像生成
机构 * Shanghai Jiao Tong University, Shanghai, China(上海交通大学) ; Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室) ; Shanghai Innovation Institute, Shanghai, China(上海创新研究院) ; Nankai University, Tianjin, China(南开大学) ; University of Science(科学技术大学) ; Nanjing University, Nanjing, China(南京大学) ; The University of Sydney, Sydney, Australia(悉尼大学) ; Peking University, Beijing, China(北京大学)
AI总结 本文提出MIGM-Shortcut模型,通过学习潜在控制动力学加速掩码图像生成,在保持质量的同时实现文本到图像生成的四倍加速。
VKnowU:评估多模态语言模型中的视觉知识理解
机构 * University of Science and Technology of China(中国科学技术大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; Nanjing University(南京大学) ; Shanghai Innovation Institute(上海创新研究院) ; City University of Hong Kong(香港城市大学)
AI总结 研究多模态大语言模型视觉知识理解能力,提出VKnowU基准测试。评估28个模型,发现与人类表现有差距。引入新数据集和VideoKnow+基线模型,采用结构化范式和强化学习,提升模型表现。
Comments Code: https://github.com/OpenGVLab/VKnowU
用于恢复个体与群体层面效应的AI情境测量:与调查测量及职业应用的验证
机构 * Northwestern University(西北大学) ; Nanjing University(南京大学)
AI总结 本研究提出AICOME框架,验证其可在拥有丰富受访者与工作特征时,从现有数据集中恢复理论重要构念,以AI生成测量在情境模型中恢复个体与群体层面效应。
LookStep:基于语言远见与事件驱动记忆的高效视觉语言导航
机构 * National Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) ; School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) ; TermiTech(TermiTech公司) ; School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院)
AI总结 该研究针对视觉语言导航(VLN)的高数据与资源开销问题,提出LookStep框架,在相同训练设置下于R2R-CE Val-Unseen任务取得49.7%成功率,且内存效率更高、数据使用更少。
Comments 19 Pages, 7 Figures. Accepted in EMNLP 2026 Main
CoViT:用于视觉Transformer的实例对应对比学习
机构 * State Key Laboratory for Novel Software Technology(计算机软件新技术国家重点实验室) ; Nanjing University(南京大学)
AI总结 该研究针对视觉Transformer(ViT)无法区分目标实例的问题,提出CoViT框架,通过几何引导的对比学习为ViT注入实例感知,在多个实例级任务上实现超2AP点的稳定性能提升,且无需额外解码器或标签。
重新思考离线数据驱动优化中的可学习性
机构 * Nanjing University(南京大学)
AI总结 本文提出算法依赖型可学习性,设计轨迹学习框架,提出UGTL方法,在五个Design-Bench任务上的25种方法中取得最佳综合平均排名3.1/25,验证了轨迹构建的重要作用。
大型推理模型何时能“节省思考”?推理中行为分歧的机制分析
机构 * State Key Laboratory for Novel Software Technology, Nanjing University, China(新型软件技术国家重点实验室,南京大学,中国) ; University of California, Merced, USA(加州大学梅德福分校) ; National Institute of Healthcare Data Science, Nanjing University, China(健康医疗数据科学国立研究所,南京大学,中国)
AI总结 本研究分析大型推理模型的“过度思考”行为,提出注意力干预方法调控该行为,揭示指令遵循、推理效率与正确性间的权衡。
Comments Accepted in the Findings of EMNLP 2026
基于事实效用估计的搜索智能体密集过程监督
机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) ; Ant Group(蚂蚁集团) ; National Institute of Healthcare Data Science, Nanjing University(南京大学国家健康医疗数据科学研究院)
AI总结 该研究针对搜索智能体强化学习的信用分配问题,提出基于事实效用估计的密集过程监督方法,在7个QA基准上优于现有基线。
Comments Accepted in the 2026 Conference on Empirical Methods in Natural Language Processing (EMNLP 2026)
精致却未解决:识别长 horizon 工具使用智能体的晚期压力状态
机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) ; Alibaba Group(阿里巴巴集团)
AI总结 本研究识别长 horizon 工具使用智能体的晚期压力状态,提出 PSPR 插件缓解该压力,实验显示其可增强现有智能体方法。
Comments Accepted in the 2026 Conference on Empirical Methods in Natural Language Processing (EMNLP 2026)
智能体实证资产定价:方法论基础
机构 * Stanford University(斯坦福大学) ; Nanjing University(南京大学) ; Hasso Plattner Institute(哈索·普拉特纳研究所)
AI总结 该研究提出智能体实证资产定价(AEAP)范式,明确其核心构建模块,构建因子发现的参考架构与评估标准,通过SEADS实验发现单一指标无法稳定评估系统,还揭示了AEAP系统的评估陷阱。
Comments 26 pages, 5 figures, 12 tables
面向多智能体协作的令牌/KV缓存通信介质选择与资源分配策略
机构 * State Key Laboratory of Novel Software Technology, Nanjing University, Nanjing, 210008, China(新型软件技术国家重点实验室,南京大学,南京) ; Institute of Intelligent Networks and Communications (NINE), Nanjing University (Suzhou Campus), Suzhou, 215163, China(智能网络与通信研究院(NINE),南京大学(苏州校区),苏州)
AI总结 针对多智能体协作中异构交互介质带来的端到端延迟权衡问题,提出一种联合通信介质选择与无线资源分配的优化方法,并设计低复杂度算法以最小化延迟。
Journal ref SCIENCE CHINA Information Sciences, 2026
突破实体对齐基础模型中的推理地平线
机构 * Nanjing University of Information Science and Technology(南京信息工程大学) ; State Key Laboratory for Novel Software Technology, Nanjing University(南京大学软件新技术国家重点实验室) ; National Institute of Healthcare Data Science, Nanjing University(南京大学健康数据科学国家研究院) ; University of Queensland(昆士兰大学) ; Engineering Research Center of Digital Forensics, Ministry of Education, Nanjing University of Information Science and Technology(南京信息工程大学数字取证工程研究中心)
AI总结 本文提出基于并行编码策略的实体对齐基础模型,通过局部锚点引导信息流和合并关系图,有效解决实体对齐中长距离依赖捕捉问题,验证了模型在未见过的知识图谱上的强泛化能力。
GRRM:用于机器翻译的组相对奖励建模
机构 * National Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家实验室,南京大学) ; Singapore University of Technology and Design(新加坡科技设计大学)
AI总结 本文提出GRRM,通过组相对奖励模型提升机器翻译的排名准确性和推理能力。
Comments Accepted by EMNLP2026; 23 pages, 7 figures
超越静态摘要:为LLM代理的主动记忆提取
机构 * State Key Laboratory for Novel Software Technology, Nanjing University, China(新型软件技术国家重点实验室,南京大学) ; National Institute of Healthcare Data Science, Nanjing University, China(健康数据科学国家研究院,南京大学)
AI总结 本文提出ProMem,一种主动记忆提取方法,通过递归反馈机制提升LLM代理的记忆完整性和问答准确性,实现高质量与低成本的平衡。
Comments Accepted in the Findings of EMNLP 2026
KGFR:面向通用知识图谱问答的基础检索器
机构 * School of Computer Science, Nanjing University of Information Science and Technology(南京信息工程大学计算机科学学院) ; State Key Laboratory for Novel Software Technology, Nanjing University(南京大学软件新技术国家重点实验室) ; National Institute of Healthcare Data Science, Nanjing University(南京大学健康数据科学国家研究院) ; Engineering Research Center of Digital Forensics, Ministry of Education, Nanjing University of Information Science and Technology(南京信息工程大学教育部长江数字取证工程研究中心)
AI总结 本文提出LLM-KGFR协作框架,通过KGFR结合LLM与结构化检索能力,实现对未见过KG的零样本泛化,采用APP高效处理大型图谱,形成可控推理循环,在KG问答任务中兼具高性能、可扩展性与泛化性。
时序强制:面向视觉-语言-动作模型的四维表示对齐
机构 * Nanjing University(南京大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; University of Chinese Academy of Sciences(中国科学院大学)
AI总结 该研究针对视觉-语言-动作模型缺乏时序信息的问题,提出 Temporal Forcing 方法,通过历史通路与时序一致的四维几何特征对齐,在 LIBERO 等任务上取得性能提升。
REER-PT:面向困惑度引导的预训练数据增强的逆向工程推理
机构 * Peking University(北京大学) ; Nanjing University(南京大学)
AI总结 该研究提出REER-PT框架,通过逆向工程推理生成预训练数据的推理注释以增强数据,使模型在多个知识和推理基准上性能提升最高达2.07个百分点。
SPLG-Mamba:用于光学遥感图像显著目标检测的结构保持型局部-全局Mamba网络
机构 * Nanjing University(南京大学) ; China Pharmaceutical University(中国药科大学)
AI总结 针对光学遥感图像显著目标检测中的结构退化问题,提出SPLG-Mamba网络,整合SDR、层级感知局部-全局Mamba及GCSF,在三个公开数据集上取得最优结果,提升了结构完整性与连续性。
RACER:面向知识图谱可解释推理的强化智能体协作框架
机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) ; Chinaunicom Software Nanjing Branch(中国联通软件南京分公司)
AI总结 RACER是面向知识图谱可解释推理的强化智能体协作框架,通过多智能体协作等技术解决LLM的幻觉与复杂推理难题,在两个数据集上平均提升5%性能。
Comments 15 pages, 1 figures, This paper has been accepted by ICONIP 2026
无校准孔径衍射的紧凑型快照光谱成像
机构 * Nanjing University(南京大学)
AI总结 该研究针对快照光谱成像系统复杂、需重复校准的问题,提出无校准的ADIS方法,结合ODAUVST框架实现紧凑型全分辨率光谱成像,验证了其性能优势。
Comments Submitted to IEEE TPAMI. Under Review
大型语言模型能否识别转化归因中有意义的接触点?
机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) ; School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) ; Taobao & Tmall Group of Alibaba(阿里巴巴淘宝天猫集团)
AI总结 该研究针对转化归因接触点选择的语义差距问题,评估LLMs识别隐藏关联的能力,分析提示策略与模型选择的影响,还将LLM归因标签用于提升CVR模型性能。
Comments 6 pages, 4 figures, 3 tables; accepted as a short paper at CIKM 2026
超越NL2Code:多模态代码智能的结构化综述
机构 * Meituan(美团) ; The University of Hong Kong(香港大学) ; The Chinese University of Hong Kong(香港中文大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Nanjing University(南京大学) ; Harbin Institute of Technology(哈尔滨工业大学) ; Australian Institute for Machine Learning, Adelaide University(阿德莱德大学澳大利亚机器学习研究所) ; Ludwig Maximilian University of Munich(慕尼黑大学) ; University of Science and Technology of China(中国科学技术大学) ; Queen Mary University of London(伦敦玛丽女王大学)
AI总结 本文系统综述多模态代码智能,将任务按代码角色分类,覆盖GUI、科学可视化、结构化图形及前沿任务,并提出四个基于验证的未来方向。
Comments Accepted by TMLR 2026
技能还是跳过?通过双粒度偏好学习在智能体任务中学习选择性技能调用
机构 * Meituan(美团) ; Fudan University(复旦大学) ; Shanghai Jiao Tong University(上海交通大学) ; Nanjing University(南京大学) ; Peking University(北京大学)
AI总结 提出SelSkill框架,通过双粒度偏好学习实现选择性技能调用,在ALFWorld和BFCL上显著提升任务成功率和执行精度。
Comments 17 pages, 4 figures
解锁大型推理模型中细粒度翻译质量评估:通过协同演化隐式和显式推理
机构 * National Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) ; Huawei Translation Services Center, Beijing, China(北京华为翻译服务中心)
AI总结 针对大型推理模型在细粒度翻译质量评估上的困难,提出RIEQE两阶段训练框架,通过非思考监督微调(隐式推理)和思考强化学习(显式推理)协同演化,在WMT测试集上超越基线。
Comments EMNLP 2026
通过供应链模型代码后门进行本地LLM微调中的秘密窃取攻击
机构 * Nanjing University(南京大学)
AI总结 研究揭示本地微调数据中敏感信息泄露风险,提出通过供应链代码后门实现主动执行劫持,引入确定性全链记忆机制,实现高精度秘密窃取,实验表明方法在不干扰主要任务的前提下达到98%以上的ASR。
Comments Accepted to EMNLP 2026 Main Conference
MM-BrowseComp:多模态浏览智能体的综合基准
机构 * Nanjing University(南京大学) ; Zhejiang University(浙江大学)
AI总结 针对现有浏览基准忽略多模态内容的问题,推出多模态浏览智能体基准MM-BrowseComp,含400道需从网页图像视频提取证据的问题,评估显示领先模型准确率仅24.25%,该基准成领域新标准。
Comments EMNLP 2026. The first two authors contribute equally, 20 pages, repo at https://github.com/MMBrowseComp/MM-BrowseComp
SymboLLM-FE:用于表格数据自动特征工程的大语言模型加速符号回归
机构 * Nanjing University(南京大学) ; School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) ; School of Artificial Intelligence, Nanjing University(南京大学人工智能学院)
AI总结 SymboLLM-FE将符号回归与LLM结合,通过符号回归提取强相关公式并经LLM优化,在6个真实数据集和4个Kaggle竞赛上性能优于现有AutoFE,解决了可解释性差和迭代多的问题。