arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Nanjing University(南京大学)

共收录 1851
2609.03383 2026-09-04 cs.LG 新提交

TIGPO: Temporal Instance-Graph Policy Optimization for Long-Horizon LLM Agents

TIGPO:用于长视野大语言模型智能体的时间实例图策略优化

Jinwei Gan

机构 * Nanjing University(南京大学)

AI总结 TIGPO为长视野LLM智能体提出跨策略更新的持久转换图策略,通过分配固定回滚预算稳定优势估计,在ALFWorld和WebShop上优于现有相关方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.03276 2026-09-04 cs.RO 新提交

R2S-Eval: Robot Evaluation with Real-to-Sim Calibration via Vision-Language Models

R2S-Eval:基于视觉语言模型的现实到仿真校准的机器人评估方法

Yidi Wang, Feixiang Ruan, Ruoqu Chen, Jie Yin, Yang Yu, Mengdi Xu, Kaifeng Zhang

机构 * Sharpa(夏普) Nanjing University(南京大学) Tongji University(同济大学) Tsinghua University(清华大学)

AI总结 R2S-Eval结合现实到仿真校准与VLM偏好评估,实现机器人操纵策略的自动化、稳定且感知质量的评估,减少硬件操作工作量并揭示二元成功标签未捕捉的行为差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22793 2026-09-04 cs.CL cs.AI 版本更新

TRACE: A Self-Evolving Skill Bank for Consistent, Limit-Aware LLM Agents

TRACE:面向一致性、极限感知的自进化技能库

Wenhao Wu, Menghao Zhang, Xin Wang, Zhi Wang, Kun Shao, Jian Luan

机构 * Xiaomi Inc.(小米公司) Nanjing University(南京大学) Beijing University of Posts and Telecommunications(北京邮电大学) Tsinghua University(清华大学)

AI总结 TRACE是一种无需修改模型权重的自进化技能库方法,通过轨迹对比进化优化技能,在CAR-bench任务上显著提升LLM智能体的一致性性能,缩小潜在与可靠性能的差距。

Comments 9 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23996 2026-09-04 cs.CV 版本更新

Accelerating Masked Image Generation by Learning Controlled Latent Dynamics

通过学习潜在控制动力学加速掩码图像生成

Kaiwen Zhu, Quansheng Zeng, Yuandong Pu, Shuo Cao, Xiaohui Li, Yi Xin, Qi Qin, Jiayang Li, Juncheng Yan, Yu Qiao, Jinjin Gu, Yihao Liu

机构 * Shanghai Jiao Tong University, Shanghai, China(上海交通大学) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室) Shanghai Innovation Institute, Shanghai, China(上海创新研究院) Nankai University, Tianjin, China(南开大学) University of Science(科学技术大学) Nanjing University, Nanjing, China(南京大学) The University of Sydney, Sydney, Australia(悉尼大学) Peking University, Beijing, China(北京大学)

AI总结 本文提出MIGM-Shortcut模型,通过学习潜在控制动力学加速掩码图像生成,在保持质量的同时实现文本到图像生成的四倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20272 2026-09-04 cs.CV 版本更新

VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs

VKnowU:评估多模态语言模型中的视觉知识理解

Tianxiang Jiang, Sheng Xia, Yicheng Xu, Linquan Wu, Xiangyu Zeng, Limin Wang, Yu Qiao, Yi Wang

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai AI Laboratory(上海人工智能实验室) Nanjing University(南京大学) Shanghai Innovation Institute(上海创新研究院) City University of Hong Kong(香港城市大学)

AI总结 研究多模态大语言模型视觉知识理解能力,提出VKnowU基准测试。评估28个模型,发现与人类表现有差距。引入新数据集和VideoKnow+基线模型,采用结构化范式和强化学习,提升模型表现。

Comments Code: https://github.com/OpenGVLab/VKnowU

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.02821 2026-09-03 cs.AI cs.LG 新提交

AI Contextual Measurement for Recovering Individual and Group-Level Effects: Validation Against Survey Measures and an Occupational Application

用于恢复个体与群体层面效应的AI情境测量:与调查测量及职业应用的验证

Wenxin Jiang, Xuyang Wang, Yuxiao Wu

机构 * Northwestern University(西北大学) Nanjing University(南京大学)

AI总结 本研究提出AICOME框架,验证其可在拥有丰富受访者与工作特征时,从现有数据集中恢复理论重要构念,以AI生成测量在情境模型中恢复个体与群体层面效应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.02350 2026-09-03 cs.CV cs.RO 新提交

LookStep: Efficient Vision-Language Navigation with Linguistic Foresight and Event Driven Memory

LookStep:基于语言远见与事件驱动记忆的高效视觉语言导航

Kun-Yang Yu, Yingzhe Li, Hongyu Xu, Shi-Yu Tian, Zhi Zhou, Yang Chen, Ming Yang, Sheng Wang, Qing Yu, Lan-Zhe Guo, Yu-Feng Li

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) TermiTech(TermiTech公司) School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院)

AI总结 该研究针对视觉语言导航(VLN)的高数据与资源开销问题,提出LookStep框架,在相同训练设置下于R2R-CE Val-Unseen任务取得49.7%成功率,且内存效率更高、数据使用更少。

Comments 19 Pages, 7 Figures. Accepted in EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01787 2026-09-03 cs.CV 新提交

CoViT: Instance-Correspondence Contrastive Learning for Vision Transformer

CoViT:用于视觉Transformer的实例对应对比学习

Yisen Wang, Zhirong Wu, Limin Wang

机构 * State Key Laboratory for Novel Software Technology(计算机软件新技术国家重点实验室) Nanjing University(南京大学)

AI总结 该研究针对视觉Transformer(ViT)无法区分目标实例的问题,提出CoViT框架,通过几何引导的对比学习为ViT注入实例感知,在多个实例级任务上实现超2AP点的稳定性能提升,且无需额外解码器或标签。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01493 2026-09-03 cs.LG cs.AI cs.NE 版本更新

Rethinking Learnability in Offline Data-driven Optimization

重新思考离线数据驱动优化中的可学习性

Chao Qian, Chen-Guang Wang, Rong-Xi Tan, Ke Xue

机构 * Nanjing University(南京大学)

AI总结 本文提出算法依赖型可学习性,设计轨迹学习框架,提出UGTL方法,在五个Design-Bench任务上的25种方法中取得最佳综合平均排名3.1/25,验证了轨迹构建的重要作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15276 2026-09-03 cs.AI cs.CL 版本更新

When Can Large Reasoning Models Save Thinking? Mechanistic Analysis of Behavioral Divergence in Reasoning

大型推理模型何时能“节省思考”?推理中行为分歧的机制分析

Rongzhi Zhu, Yi Liu, Jiancheng Wang, Xiangyu Liu, Zequn Sun, Yiwei Wang, Yu Deng, Zijian Zhou, Wei Hu

机构 * State Key Laboratory for Novel Software Technology, Nanjing University, China(新型软件技术国家重点实验室,南京大学,中国) University of California, Merced, USA(加州大学梅德福分校) National Institute of Healthcare Data Science, Nanjing University, China(健康医疗数据科学国立研究所,南京大学,中国)

AI总结 本研究分析大型推理模型的“过度思考”行为,提出注意力干预方法调控该行为,揭示指令遵循、推理效率与正确性间的权衡。

Comments Accepted in the Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.00833 2026-09-02 cs.CL cs.LG 新提交

Dense Process Supervision for Search Agents via Fact Utility Estimation

基于事实效用估计的搜索智能体密集过程监督

Rongzhi Zhu, Xiangyu Liu, Yi Liu, Shuo Zhang, Ruirui Zhang, Rui Wu, Tao Jiang, Zequn Sun, Wenhao Xu, Wei Hu

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) Ant Group(蚂蚁集团) National Institute of Healthcare Data Science, Nanjing University(南京大学国家健康医疗数据科学研究院)

AI总结 该研究针对搜索智能体强化学习的信用分配问题,提出基于事实效用估计的密集过程监督方法,在7个QA基准上优于现有基线。

Comments Accepted in the 2026 Conference on Empirical Methods in Natural Language Processing (EMNLP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.00823 2026-09-02 cs.AI cs.CL 新提交

Polished but Unresolved: Identifying Late-Stage Pressure States in Long-Horizon Tool-Use Agents

精致却未解决:识别长 horizon 工具使用智能体的晚期压力状态

Haoyang Chen, Yi Liu, Jianzhi Shao, Xiaozhou Xu, Zhe Sun, Wei Hu

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) Alibaba Group(阿里巴巴集团)

AI总结 本研究识别长 horizon 工具使用智能体的晚期压力状态,提出 PSPR 插件缓解该压力,实验显示其可增强现有智能体方法。

Comments Accepted in the 2026 Conference on Empirical Methods in Natural Language Processing (EMNLP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.00731 2026-09-02 cs.AI cs.LG q-fin.ST 新提交

Agentic Empirical Asset Pricing: Methodological Foundations

智能体实证资产定价:方法论基础

Yingjian Pan, Xiaowei Ding, Kay Giesecke

机构 * Stanford University(斯坦福大学) Nanjing University(南京大学) Hasso Plattner Institute(哈索·普拉特纳研究所)

AI总结 该研究提出智能体实证资产定价(AEAP)范式,明确其核心构建模块,构建因子发现的参考架构与评估标准,通过SEADS实验发现单一指标无法稳定评估系统,还揭示了AEAP系统的评估陷阱。

Comments 26 pages, 5 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25422 2026-09-02 eess.SP cs.AI cs.IT math.IT

A Token/KV-Cache Communication Media Selection and Resource Allocation Strategy for Multi-Agent Collaboration

面向多智能体协作的令牌/KV缓存通信介质选择与资源分配策略

Lipeng Dai, Luping Xiang, Kun Yang

机构 * State Key Laboratory of Novel Software Technology, Nanjing University, Nanjing, 210008, China(新型软件技术国家重点实验室,南京大学,南京) Institute of Intelligent Networks and Communications (NINE), Nanjing University (Suzhou Campus), Suzhou, 215163, China(智能网络与通信研究院(NINE),南京大学(苏州校区),苏州)

AI总结 针对多智能体协作中异构交互介质带来的端到端延迟权衡问题,提出一种联合通信介质选择与无线资源分配的优化方法,并设计低复杂度算法以最小化延迟。

Journal ref SCIENCE CHINA Information Sciences, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21174 2026-09-02 cs.LG 版本更新

Breaking the Reasoning Horizon in Entity Alignment Foundation Models

突破实体对齐基础模型中的推理地平线

Yuanning Cui, Zequn Sun, Wei Hu, Kexuan Xin, Zhangjie Fu

机构 * Nanjing University of Information Science and Technology(南京信息工程大学) State Key Laboratory for Novel Software Technology, Nanjing University(南京大学软件新技术国家重点实验室) National Institute of Healthcare Data Science, Nanjing University(南京大学健康数据科学国家研究院) University of Queensland(昆士兰大学) Engineering Research Center of Digital Forensics, Ministry of Education, Nanjing University of Information Science and Technology(南京信息工程大学数字取证工程研究中心)

AI总结 本文提出基于并行编码策略的实体对齐基础模型,通过局部锚点引导信息流和合并关系图,有效解决实体对齐中长距离依赖捕捉问题,验证了模型在未见过的知识图谱上的强泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14028 2026-09-02 cs.CL 版本更新

GRRM: Group Relative Reward Modeling for Machine Translation

GRRM:用于机器翻译的组相对奖励建模

Sen Yang, Shanbo Cheng, Lu Xu, Jianbing Zhang, Shujian Huang

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家实验室,南京大学) Singapore University of Technology and Design(新加坡科技设计大学)

AI总结 本文提出GRRM,通过组相对奖励模型提升机器翻译的排名准确性和推理能力。

Comments Accepted by EMNLP2026; 23 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04463 2026-09-02 cs.CL cs.AI 版本更新

Beyond Static Summarization: Proactive Memory Extraction for LLM Agents

超越静态摘要:为LLM代理的主动记忆提取

Chengyuan Yang, Zequn Sun, Wei Wei, Wei Hu

机构 * State Key Laboratory for Novel Software Technology, Nanjing University, China(新型软件技术国家重点实验室,南京大学) National Institute of Healthcare Data Science, Nanjing University, China(健康数据科学国家研究院,南京大学)

AI总结 本文提出ProMem,一种主动记忆提取方法,通过递归反馈机制提升LLM代理的记忆完整性和问答准确性,实现高质量与低成本的平衡。

Comments Accepted in the Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04093 2026-09-02 cs.AI 版本更新

KGFR: A Foundation Retriever for Generalized Knowledge Graph Question Answering

KGFR:面向通用知识图谱问答的基础检索器

Yuanning Cui, Zequn Sun, Wei Hu, Zhangjie Fu

机构 * School of Computer Science, Nanjing University of Information Science and Technology(南京信息工程大学计算机科学学院) State Key Laboratory for Novel Software Technology, Nanjing University(南京大学软件新技术国家重点实验室) National Institute of Healthcare Data Science, Nanjing University(南京大学健康数据科学国家研究院) Engineering Research Center of Digital Forensics, Ministry of Education, Nanjing University of Information Science and Technology(南京信息工程大学教育部长江数字取证工程研究中心)

AI总结 本文提出LLM-KGFR协作框架,通过KGFR结合LLM与结构化检索能力,实现对未见过KG的零样本泛化,采用APP高效处理大型图谱,形成可控推理循环,在KG问答任务中兼具高性能、可扩展性与泛化性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30643 2026-09-01 cs.RO 新提交

Temporal Forcing: 4D Representation Alignment for Vision-Language-Action Models

时序强制:面向视觉-语言-动作模型的四维表示对齐

Xingyu Ding, Yuzhong Zhao, Chunhai Zhao, Yinghuan Shi, Chaoyang Zhao, Yifan Zhang

机构 * Nanjing University(南京大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 该研究针对视觉-语言-动作模型缺乏时序信息的问题,提出 Temporal Forcing 方法,通过历史通路与时序一致的四维几何特征对齐,在 LIBERO 等任务上取得性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30627 2026-09-01 cs.CL 新提交

REER-PT: Reverse-Engineered Reasoning for Perplexity-Guided Pre-training Data Augmentation

REER-PT:面向困惑度引导的预训练数据增强的逆向工程推理

Haoran Que, Jiajun Shi, Ting Huang, Renming Pang, Jiaheng Liu, Ge Zhang, Wenhao Huang, Shen Yan, Wei Ye, Shikun Zhang

机构 * Peking University(北京大学) Nanjing University(南京大学)

AI总结 该研究提出REER-PT框架,通过逆向工程推理生成预训练数据的推理注释以增强数据,使模型在多个知识和推理基准上性能提升最高达2.07个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29626 2026-09-01 cs.CV 新提交

SPLG-Mamba: Structure-Preserving Local-Global Mamba Network for Salient Object Detection in Optical Remote Sensing Images

SPLG-Mamba:用于光学遥感图像显著目标检测的结构保持型局部-全局Mamba网络

Yi Xu, Ruichao Hou, Tongwei Ren, Gangshan Wu

机构 * Nanjing University(南京大学) China Pharmaceutical University(中国药科大学)

AI总结 针对光学遥感图像显著目标检测中的结构退化问题,提出SPLG-Mamba网络,整合SDR、层级感知局部-全局Mamba及GCSF,在三个公开数据集上取得最优结果,提升了结构完整性与连续性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29263 2026-09-01 cs.AI 新提交

RACER: Reinforced Agent Collaboration for Explainable Reasoning on Knowledge Graphs

RACER:面向知识图谱可解释推理的强化智能体协作框架

Yuwei Lou, Hao Hu, Yuzhou Jiang, Zongfei Zhang, Liang Wang, Jincai Liu, Jidong Ge, Xianping Tao

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) Chinaunicom Software Nanjing Branch(中国联通软件南京分公司)

AI总结 RACER是面向知识图谱可解释推理的强化智能体协作框架,通过多智能体协作等技术解决LLM的幻觉与复杂推理难题,在两个数据集上平均提升5%性能。

Comments 15 pages, 1 figures, This paper has been accepted by ICONIP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29230 2026-09-01 cs.CV 新提交

Compact Snapshot Spectral Imaging with Calibration-Free Aperture Diffraction

无校准孔径衍射的紧凑型快照光谱成像

Tao Lv, Quan Yuan, Shiqiao Li, Chenglong Huang, Linsen Chen, Chongde Zi, Shuming Wang, Xun Cao

机构 * Nanjing University(南京大学)

AI总结 该研究针对快照光谱成像系统复杂、需重复校准的问题,提出无校准的ADIS方法,结合ODAUVST框架实现紧凑型全分辨率光谱成像,验证了其性能优势。

Comments Submitted to IEEE TPAMI. Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28649 2026-09-01 cs.CL cs.AI cs.IR 新提交

Can Large Language Models Identify Meaningful Touchpoints in Conversion Attribution?

大型语言模型能否识别转化归因中有意义的接触点?

Jinqi Wu, Sishuo Chen, Zhangming Chan, Yong Bai, Chao Yi, Han Zhu, Shuodian Yu, Lei Zhang, Sheng Chen, Chenghuan Hou, Jian Xu, Chaoyou Fu

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) Taobao & Tmall Group of Alibaba(阿里巴巴淘宝天猫集团)

AI总结 该研究针对转化归因接触点选择的语义差距问题,评估LLMs识别隐藏关联的能力,分析提示策略与模型选择的影响,还将LLM归因标签用于提升CVR模型性能。

Comments 6 pages, 4 figures, 3 tables; accepted as a short paper at CIKM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15932 2026-09-01 cs.CL 版本更新

Beyond NL2Code: A Structured Survey of Multimodal Code Intelligence

超越NL2Code:多模态代码智能的结构化综述

Xuanle Zhao, Qiushi Sun, Jingyu Xiao, Xuexin Liu, Haoyue Yang, Qiaosheng Chen, Xianzhen Luo, Jing Huang, Yufeng Zhong, Lei Chen, Shuai Fu, Zhenlin Wei, Jinhe Bi, Lei Jiang, Haibo Qiu, Siqi Yang, Peng Shi, Jian Hu, Zhixiong Zeng

机构 * Meituan(美团) The University of Hong Kong(香港大学) The Chinese University of Hong Kong(香港中文大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Nanjing University(南京大学) Harbin Institute of Technology(哈尔滨工业大学) Australian Institute for Machine Learning, Adelaide University(阿德莱德大学澳大利亚机器学习研究所) Ludwig Maximilian University of Munich(慕尼黑大学) University of Science and Technology of China(中国科学技术大学) Queen Mary University of London(伦敦玛丽女王大学)

AI总结 本文系统综述多模态代码智能,将任务按代码角色分类,覆盖GUI、科学可视化、结构化图形及前沿任务,并提出四个基于验证的未来方向。

Comments Accepted by TMLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00510 2026-09-01 cs.CL cs.AI 版本更新

Skill or Skip? Learning Selective Skill Invocation in Agentic Tasks via Dual-Granularity Preference Learning

技能还是跳过?通过双粒度偏好学习在智能体任务中学习选择性技能调用

Chishui Chen, Jiaye Lin, Te Sun, Yi Yang, Junxi Wang, Cong Qin, Yangen Hu, Lu Pan, Ke Zeng

机构 * Meituan(美团) Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学) Nanjing University(南京大学) Peking University(北京大学)

AI总结 提出SelSkill框架,通过双粒度偏好学习实现选择性技能调用,在ALFWorld和BFCL上显著提升任务成功率和执行精度。

Comments 17 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31378 2026-09-01 cs.CL 版本更新

Unlocking Fine-Grained Translation Quality Estimation in LRMs through Mutually Boosting Implicit and Explicit Reasoning

解锁大型推理模型中细粒度翻译质量评估:通过协同演化隐式和显式推理

Renfei Dang, Xinye Wang, Zhejian Lai, Weilu Xu, Shimin Tao, Daimeng Wei, Min Zhang, Shujian Huang

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) Huawei Translation Services Center, Beijing, China(北京华为翻译服务中心)

AI总结 针对大型推理模型在细粒度翻译质量评估上的困难,提出RIEQE两阶段训练框架,通过非思考监督微调(隐式推理)和思考强化学习(显式推理)协同演化,在WMT测试集上超越基线。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27426 2026-09-01 cs.CR cs.AI 版本更新

Secret Stealing Attacks on Local LLM Fine-Tuning through Supply-Chain Model Code Backdoors

通过供应链模型代码后门进行本地LLM微调中的秘密窃取攻击

Zi Li, Tian Zhou, Wenze Li, Jingyu Hua, Yunlong Mao, Sheng Zhong

机构 * Nanjing University(南京大学)

AI总结 研究揭示本地微调数据中敏感信息泄露风险,提出通过供应链代码后门实现主动执行劫持,引入确定性全链记忆机制,实现高精度秘密窃取,实验表明方法在不干扰主要任务的前提下达到98%以上的ASR。

Comments Accepted to EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13186 2026-09-01 cs.CL cs.AI cs.CV 版本更新

MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents

MM-BrowseComp:多模态浏览智能体的综合基准

Shilong Li, Xingyuan Bu, Wenjie Wang, Jiaheng Liu, Jun Dong, Haoyang He, Hao Lu, Haozhe Zhang, Chenchen Jing, Zhen Li, Chuanhao Li, Jiayi Tian, Chenchen Zhang, Tianhao Peng, Yancheng He, Jihao Gu, Hui Huang, Donghao Zhou, Yuanxing Zhang, Jian Yang, Ge Zhang, Wenhao Huang, Zhaoxiang Zhang, Qiangpeng Yang, Shilei Wen

机构 * Nanjing University(南京大学) Zhejiang University(浙江大学)

AI总结 针对现有浏览基准忽略多模态内容的问题,推出多模态浏览智能体基准MM-BrowseComp,含400道需从网页图像视频提取证据的问题,评估显示领先模型准确率仅24.25%,该基准成领域新标准。

Comments EMNLP 2026. The first two authors contribute equally, 20 pages, repo at https://github.com/MMBrowseComp/MM-BrowseComp

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28408 2026-08-31 cs.LG 新提交

SymboLLM-FE: LLM-Accelerated Symbolic Regression for Automated Feature Engineering on Tabular Data

SymboLLM-FE:用于表格数据自动特征工程的大语言模型加速符号回归

Zi-Jian Cheng, Zi-Yi Jia, Zhi Zhou, Yu-Feng Li, Lan-Zhe Guo

机构 * Nanjing University(南京大学) School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) School of Artificial Intelligence, Nanjing University(南京大学人工智能学院)

AI总结 SymboLLM-FE将符号回归与LLM结合,通过符号回归提取强相关公式并经LLM优化,在6个真实数据集和4个Kaggle竞赛上性能优于现有AutoFE,解决了可解释性差和迭代多的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏