arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Chinese Academy of Sciences(中国科学院大学)

2026-08-28 至 2026-08-28 共收录 11
2608.27154 2026-08-28 cs.CV 新提交

ReViCo: Unveiling the Limitations of VLMs in Visual Text Understanding via Error Correction

ReViCo:通过纠错揭示视觉语言模型在视觉文本理解中的局限性

Bojun Zhang, Junhong Liang, Feifei Zhai, Fengxian Ji, Yu Zhou

机构 * Institute of Automation, CAS(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Zhongke Fanyu Technology Co., Ltd(中科梵语科技有限公司)

AI总结 该研究提出ReViCo基准,以视觉文本纠错任务评估VLMs,发现其与人类存在显著性能差距,为开发更优文本感知VLMs提供新基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27146 2026-08-28 cs.AI cs.SE 新提交

When Tool Outputs Become Commands: Separating Action Induction from Runtime Authorization in Tool-Augmented LLM Agents

当工具输出成为命令:在工具增强型大语言模型智能体中分离动作诱导与运行时授权

Xiaokun Guo, Zhen Xu, Dongdong Huo, Yanqiu Zhang, Wei Wang, Qinfu Yang, Dongjin Yu, Yu Wang

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院)

AI总结 该研究针对工具增强型LLM智能体中工具输出成为命令的风险,提出SARA框架分离动作诱导与执行授权,在AgentDojo等数据集上有效限制攻击成功率并保持任务效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26849 2026-08-28 cs.AI cs.CY cs.MA 新提交

LiveSim: Simulating Environment-Shaped Users in Multi-Agent Live-Stream Ecosystems

LiveSim:在多智能体直播生态系统中模拟环境塑造的用户

Jiaqi Xu, Yiran Qiao, Jing Chen, Qiwei Zhong, Xiang Ao, Xueqi Cheng

机构 * University of Chinese Academy of Sciences(中国科学院大学) ByteDance China(字节跳动中国)

AI总结 该研究提出基于LLM的LiveSim框架,通过环境塑造的动态用户行为模拟,在真实直播风控数据实验中验证其可提升用户级行为保真度并支持生态系统级分析。

Comments 20 pages, 8 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26832 2026-08-28 cs.CL 新提交

RuleWeaver: Benchmarking Rule-Centered Scenario Reasoning for Large Language Models

RuleWeaver:面向大型语言模型的以规则为中心的场景推理基准测试

Bohan Yu, Shi-Yang Li, Pengfei Cao, Jun Zhao, Kang Liu

机构 * School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉科学学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

AI总结 针对现有基准测试无法全面评估大型语言模型以规则为中心的场景推理能力的问题,本文提出RuleWeaver基准测试框架,通过构建规则化问答实例并开展过程级评估,发现当前主流LLMs在该任务上表现不佳。

Comments Accepted by EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26650 2026-08-28 cs.CL 新提交

Meta-Learning Where to Allocate Experts: Task-Conditioned Layer-Wise Compression for MoEs

元学习专家分配位置:面向混合专家模型的任务条件化分层压缩

Rongfeng Wang, Shichao Weng, Zhiqiang Wang, Xinyu Liu, Yang Yi, Peilong Zhou, Hongwei Tang

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Nanjing College, University of Chinese Academy of Sciences(中国科学院大学南京学院) Nanjing Institute of Information Superbahn(南京信息超级bahn研究院) Dobot Robotics(越疆机器人) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉科学学院) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 该研究提出MetaNet控制器,为MoE模型分层预测专家分配阈值,在DeepSeek-MoE-16B-Chat上实现准确率与专家激活的权衡,且控制器可跨数据集迁移。

Comments 18 pages, 3 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26190 2026-08-28 cs.AI 新提交

Predicting Consequences and Reinforcing Navigation Policies with Latent World Models

用潜世界模型预测后果并强化导航策略

Zengmao Wang, Wei Gao, Shuhan Shen

机构 * School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉科学学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

AI总结 本研究提出用于机器人导航的兼容性预测潜世界模型(LWM),通过预测动作条件下的潜特征兼容性评估动作后果,可从无标注视频监督策略学习并经强化学习改进,在多机器人导航数据集上性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10954 2026-08-28 cs.CV cs.AI 版本更新

Evidence-Grounded Trustworthy Multimodal Reasoning and Evaluation Benchmark in Complex Urban Scenes

复杂城市场景中基于证据的可信多模态推理与评估基准

Zhaoyang Wei, Bowen Jiang, Xumeng Han, Jiashu Li, Xuehui Yu, Yuling Liu, Guorong Li, Zhenjun Han, Jianbin Jiao

机构 * University of Chinese Academy of Sciences (UCAS)(中国科学院大学) Tencent CDG(腾讯云与智慧产业事业群) Institute of Information Engineering, CAS(中国科学院信息工程研究所)

AI总结 针对复杂城市场景中多模态大语言模型的推理可靠性问题,提出AD2-Bench基准与EGVOR模型,提升了不利条件下的多模态推理稳定性。

Comments This submission is an iterative version of our previous work, **"AD^2-Bench: A Hierarchical CoT Benchmark for MLLM in Autonomous Driving under Adverse Conditions"** ( arXiv:2506.09557 (https://arxiv.org/abs/2506.09557) ). We plan to consolidate the current submission with the earlier version into a unified manuscript. Therefore, we would like to withdraw this submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27747 2026-08-28 cs.CL cs.AI 版本更新

Can LVLMs Uncover the Truth Behind Visual Illusions? An Analysis of Perceptual and Reasoning Capabilities

大型视觉语言模型(LVLMs)能否揭示视觉错觉背后的真相?感知与推理能力分析

Liangjie Zhao, Jiaqing Lyu, Kexin Tang, Zecheng Fang, Rong Yin, Yulan Hu, Da Li, Jianing Li

机构 * Adelaide University(阿德莱德大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) Tsinghua University(清华大学) Amap, Alibaba Group(阿里巴巴集团高德地图) Beihang University(北京航空航天大学)

AI总结 本文利用IllusionReasoning基准,以视觉错觉为诊断工具评估LVLMs,发现多款LVLMs的推理能力不及宣称水平,为其优化提供了新方向。

Comments EMNLP2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11358 2026-08-28 cs.CL cs.AI cs.IR 版本更新

LLM-Specific Utility for Retrieval-Augmented Generation

针对大语言模型的特定效用:检索增强生成的新视角

Hengran Zhang, Keping Bi, Jiafeng Guo, Jiaming Zhang, Shuaiqiang Wang, Dawei Yin, Xueqi Cheng

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Baidu Inc(百度公司)

AI总结 本文提出LLM特定效用的概念,指出不同大语言模型对证据的需求不同,提出构建基准以研究这种效用,并推动生成器定制的证据选择方法改进RAG。

Comments Accepted to CIKM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06270 2026-08-28 cs.LG cs.AI 版本更新

MCCE: A Framework for Multi-LLM Collaborative Search in Discrete Spaces with Similarity-Filtered Preference Learning

MCCE:基于相似度过滤偏好学习的离散空间多大语言模型协同搜索框架

Nian Ran, Zhongzheng Li, Yue Wang, Qingsong Ran, Xiaoyuan Zhang, Shikun Feng, Richard Allmendinger, Xiaoguang Zhao

机构 * Zhongguancun Academy(中关村学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) University of Manchester(曼彻斯特大学) Tongji University(同济大学)

AI总结 MCCE是结合冻结闭源LLM与轻量可训练模型的混合框架,通过轨迹记忆与强化学习优化小型模型,在多目标药物设计基准上实现最优帕累托前沿质量,优于基线方法,为混合LLM系统提供持续演化新范式。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05216 2026-08-28 cs.IR cs.AI cs.CL 版本更新

Unleashing the Power of LLMs in Dense Retrieval with Query Likelihood Modeling

利用查询似然建模释放大型语言模型在密集检索中的能力

Hengran Zhang, Keping Bi, Jiafeng Guo, Xiaojie Sun, Shihao Liu, Daiting Shi, Dawei Yin, Xueqi Cheng

机构 * CAS Key Lab of Network Data Science and Technology, ICT, CAS(中国科学院网络数据科学与技术重点实验室) University of Chinese Academy of Sciences(中国科学院大学) Baidu Inc(百度公司)

AI总结 该研究针对LLM在密集检索中全局信息建模不足的问题,提出含注意力块和文档损坏组件的LLM-QL模型,通过查询似然最大化辅助任务增强检索器主干,在MS MARCO和BEIR数据集上优于其他LLM-based检索器。

Comments Accepted to CIKM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏