arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Chinese Academy of Sciences(中国科学院大学)

2026-08-28 至 2026-08-28 共收录 6
2608.27154 2026-08-28 cs.CV 新提交

ReViCo: Unveiling the Limitations of VLMs in Visual Text Understanding via Error Correction

ReViCo:通过纠错揭示视觉语言模型在视觉文本理解中的局限性

Bojun Zhang, Junhong Liang, Feifei Zhai, Fengxian Ji, Yu Zhou

机构 * Institute of Automation, CAS(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Zhongke Fanyu Technology Co., Ltd(中科梵语科技有限公司)

AI总结 该研究提出ReViCo基准,以视觉文本纠错任务评估VLMs,发现其与人类存在显著性能差距,为开发更优文本感知VLMs提供新基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27146 2026-08-28 cs.AI cs.SE 新提交

When Tool Outputs Become Commands: Separating Action Induction from Runtime Authorization in Tool-Augmented LLM Agents

当工具输出成为命令:在工具增强型大语言模型智能体中分离动作诱导与运行时授权

Xiaokun Guo, Zhen Xu, Dongdong Huo, Yanqiu Zhang, Wei Wang, Qinfu Yang, Dongjin Yu, Yu Wang

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院)

AI总结 该研究针对工具增强型LLM智能体中工具输出成为命令的风险,提出SARA框架分离动作诱导与执行授权,在AgentDojo等数据集上有效限制攻击成功率并保持任务效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26849 2026-08-28 cs.AI cs.CY cs.MA 新提交

LiveSim: Simulating Environment-Shaped Users in Multi-Agent Live-Stream Ecosystems

LiveSim:在多智能体直播生态系统中模拟环境塑造的用户

Jiaqi Xu, Yiran Qiao, Jing Chen, Qiwei Zhong, Xiang Ao, Xueqi Cheng

机构 * University of Chinese Academy of Sciences(中国科学院大学) ByteDance China(字节跳动中国)

AI总结 该研究提出基于LLM的LiveSim框架,通过环境塑造的动态用户行为模拟,在真实直播风控数据实验中验证其可提升用户级行为保真度并支持生态系统级分析。

Comments 20 pages, 8 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26832 2026-08-28 cs.CL 新提交

RuleWeaver: Benchmarking Rule-Centered Scenario Reasoning for Large Language Models

RuleWeaver:面向大型语言模型的以规则为中心的场景推理基准测试

Bohan Yu, Shi-Yang Li, Pengfei Cao, Jun Zhao, Kang Liu

机构 * School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉科学学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

AI总结 针对现有基准测试无法全面评估大型语言模型以规则为中心的场景推理能力的问题,本文提出RuleWeaver基准测试框架,通过构建规则化问答实例并开展过程级评估,发现当前主流LLMs在该任务上表现不佳。

Comments Accepted by EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26650 2026-08-28 cs.CL 新提交

Meta-Learning Where to Allocate Experts: Task-Conditioned Layer-Wise Compression for MoEs

元学习专家分配位置:面向混合专家模型的任务条件化分层压缩

Rongfeng Wang, Shichao Weng, Zhiqiang Wang, Xinyu Liu, Yang Yi, Peilong Zhou, Hongwei Tang

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Nanjing College, University of Chinese Academy of Sciences(中国科学院大学南京学院) Nanjing Institute of Information Superbahn(南京信息超级bahn研究院) Dobot Robotics(越疆机器人) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉科学学院) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 该研究提出MetaNet控制器,为MoE模型分层预测专家分配阈值,在DeepSeek-MoE-16B-Chat上实现准确率与专家激活的权衡,且控制器可跨数据集迁移。

Comments 18 pages, 3 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26190 2026-08-28 cs.AI 新提交

Predicting Consequences and Reinforcing Navigation Policies with Latent World Models

用潜世界模型预测后果并强化导航策略

Zengmao Wang, Wei Gao, Shuhan Shen

机构 * School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉科学学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

AI总结 本研究提出用于机器人导航的兼容性预测潜世界模型(LWM),通过预测动作条件下的潜特征兼容性评估动作后果,可从无标注视频监督策略学习并经强化学习改进,在多机器人导航数据集上性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏