arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Chinese Academy of Sciences(中国科学院大学)

2026-08-28 至 2026-08-28 共收录 5
2608.10954 2026-08-28 cs.CV cs.AI 版本更新

Evidence-Grounded Trustworthy Multimodal Reasoning and Evaluation Benchmark in Complex Urban Scenes

复杂城市场景中基于证据的可信多模态推理与评估基准

Zhaoyang Wei, Bowen Jiang, Xumeng Han, Jiashu Li, Xuehui Yu, Yuling Liu, Guorong Li, Zhenjun Han, Jianbin Jiao

机构 * University of Chinese Academy of Sciences (UCAS)(中国科学院大学) Tencent CDG(腾讯云与智慧产业事业群) Institute of Information Engineering, CAS(中国科学院信息工程研究所)

AI总结 针对复杂城市场景中多模态大语言模型的推理可靠性问题,提出AD2-Bench基准与EGVOR模型,提升了不利条件下的多模态推理稳定性。

Comments This submission is an iterative version of our previous work, **"AD^2-Bench: A Hierarchical CoT Benchmark for MLLM in Autonomous Driving under Adverse Conditions"** ( arXiv:2506.09557 (https://arxiv.org/abs/2506.09557) ). We plan to consolidate the current submission with the earlier version into a unified manuscript. Therefore, we would like to withdraw this submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27747 2026-08-28 cs.CL cs.AI 版本更新

Can LVLMs Uncover the Truth Behind Visual Illusions? An Analysis of Perceptual and Reasoning Capabilities

大型视觉语言模型(LVLMs)能否揭示视觉错觉背后的真相?感知与推理能力分析

Liangjie Zhao, Jiaqing Lyu, Kexin Tang, Zecheng Fang, Rong Yin, Yulan Hu, Da Li, Jianing Li

机构 * Adelaide University(阿德莱德大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) Tsinghua University(清华大学) Amap, Alibaba Group(阿里巴巴集团高德地图) Beihang University(北京航空航天大学)

AI总结 本文利用IllusionReasoning基准,以视觉错觉为诊断工具评估LVLMs,发现多款LVLMs的推理能力不及宣称水平,为其优化提供了新方向。

Comments EMNLP2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11358 2026-08-28 cs.CL cs.AI cs.IR 版本更新

LLM-Specific Utility for Retrieval-Augmented Generation

针对大语言模型的特定效用:检索增强生成的新视角

Hengran Zhang, Keping Bi, Jiafeng Guo, Jiaming Zhang, Shuaiqiang Wang, Dawei Yin, Xueqi Cheng

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Baidu Inc(百度公司)

AI总结 本文提出LLM特定效用的概念,指出不同大语言模型对证据的需求不同,提出构建基准以研究这种效用,并推动生成器定制的证据选择方法改进RAG。

Comments Accepted to CIKM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06270 2026-08-28 cs.LG cs.AI 版本更新

MCCE: A Framework for Multi-LLM Collaborative Search in Discrete Spaces with Similarity-Filtered Preference Learning

MCCE:基于相似度过滤偏好学习的离散空间多大语言模型协同搜索框架

Nian Ran, Zhongzheng Li, Yue Wang, Qingsong Ran, Xiaoyuan Zhang, Shikun Feng, Richard Allmendinger, Xiaoguang Zhao

机构 * Zhongguancun Academy(中关村学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) University of Manchester(曼彻斯特大学) Tongji University(同济大学)

AI总结 MCCE是结合冻结闭源LLM与轻量可训练模型的混合框架,通过轨迹记忆与强化学习优化小型模型,在多目标药物设计基准上实现最优帕累托前沿质量,优于基线方法,为混合LLM系统提供持续演化新范式。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05216 2026-08-28 cs.IR cs.AI cs.CL 版本更新

Unleashing the Power of LLMs in Dense Retrieval with Query Likelihood Modeling

利用查询似然建模释放大型语言模型在密集检索中的能力

Hengran Zhang, Keping Bi, Jiafeng Guo, Xiaojie Sun, Shihao Liu, Daiting Shi, Dawei Yin, Xueqi Cheng

机构 * CAS Key Lab of Network Data Science and Technology, ICT, CAS(中国科学院网络数据科学与技术重点实验室) University of Chinese Academy of Sciences(中国科学院大学) Baidu Inc(百度公司)

AI总结 该研究针对LLM在密集检索中全局信息建模不足的问题,提出含注意力块和文档损坏组件的LLM-QL模型,通过查询似然最大化辅助任务增强检索器主干,在MS MARCO和BEIR数据集上优于其他LLM-based检索器。

Comments Accepted to CIKM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏