arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of California, Los Angeles(加州大学洛杉矶分校)

2026-08-27 至 2026-08-27 共收录 4
2608.26105 2026-08-27 cs.CV cs.AI cs.LG cs.MM cs.RO 新提交

VBVR-Pro: A Scalable and Verifiable Suite for Native Visual Reasoning

VBVR-Pro:用于原生视觉推理的可扩展且可验证工具套件

Junxiang Xu, Ruisi Wang, Fanyi Pu, Maijunxian Wang, Ran Ji, Tongxi Zhou, Chenyang Gu, Jing Zuo, Hongcan Xiao, Yimeng Geng, Wanqi Yin, Wei Chen, Oscar Qian, Zhengan Yan, Ziqi Huang, Haiwen Diao, Liang Pan, Bo Li, Xiangyu Fan, Dezhi Luo, Fengyuan Yu, Zehong Zhao, Qingying Gao, Tinghui Zhu, Yilan Zhang, Jingqi Tong, Pinyuan Feng, Zhengze Jiang, Letian Wang, Ziyu Guo, Renrui Zhang, Jieneng Chen, Sonia Joseph, Constantin Venhoff, Saman Motamed, Mengyue Yang, Chandra Sripada, Alan Yuille, Philip Torr, Lvmin Zhang, Vikash Kumar, Daniel Khashabi, Nikolaus Kriegeskorte, Raphaël Millière, Vincent C. Müller, Anyi Rao, Quan Wang, Ziwei Liu, Dahua Lin, Lei Yang, Hokin Deng, Zhongang Cai

机构 * Nanyang Technological University(南洋理工大学) University of California, Berkeley(加州大学伯克利分校) University of California, San Diego(加州大学圣地亚哥分校) The University of Tokyo(东京大学) The Chinese University of Hong Kong(香港中文大学) University of Michigan(密歇根大学) Johns Hopkins University(约翰霍普金斯大学) University of California, Davis(加州大学戴维斯分校) University of California, Los Angeles(加州大学洛杉矶分校) Carnegie Mellon University(卡内基梅隆大学) Columbia University(哥伦比亚大学) University of Toronto(多伦多大学)

AI总结 本研究提出VBVR-Pro,一个可扩展可验证的原生视觉推理闭环测试平台,含300个生成任务、确定性评分器及多生成器机制研究,训练模型在多视觉推理基准上迁移性强,发布全部相关资源。

Comments Homepage: this https URL (https://video-reason.com/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25276 2026-08-27 cs.CL 新提交

Groundhog Bit-Flip Attack: Seeding Infinite Generation Loops in Mixture-of-Experts LLMs through Bit Flips

土拨比特翻转攻击:通过比特翻转在混合专家大语言模型中植入无限生成循环

Huakang Lin, Tiancheng Zheng, Mingxuan Sun, Tianhong Xu, Fan Zhang, Yunsi Fei, Ruyi Ding

机构 * Louisiana State University(路易斯安那州立大学) Northeastern University(东北大学) Zhejiang University(浙江大学) University of California, Los Angeles(加利福尼亚大学洛杉矶分校) Southeast University(东南大学)

AI总结 本研究提出首个针对混合专家大语言模型的土拨比特翻转攻击,通过翻转路由层相关比特,可使平均输出膨胀率达5912%,揭示了MoE架构的鲁棒性漏洞。

Comments 9 pages, 3 figures; Accepted at EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25152 2026-08-27 cs.CL cs.AI 新提交

Belief Cascades Drive Persuasion in LLM Agent Networks

信念级联驱动LLM智能体网络中的说服行为

Haoyi Qiu, Genglin Liu, Pranav Narayanan Venkit, Kung-Hsiang Huang, Saadia Gabriel, Chien-Sheng Wu, Nanyun Peng

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Salesforce AI Research(Salesforce AI研究)

AI总结 该研究构建受控测试平台,发现LLM智能体网络中说服动态受拓扑等因素影响,直接暴露可预测立场变化,需结合多维度数据评估多智能体说服。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25005 2026-08-27 cs.CL cs.LG 新提交

The Imperfective Paradox Is Not Necessarily in Large Language Models: A Benchmark Failure Before a Model Failure

进行体悖论不一定存在于大型语言模型中:模型失效前的基准失效

Kaiqiao Han, Yizhou Sun

机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

AI总结 该研究发现进行体悖论相关的基准失效,构建词汇匹配最小对并评估多步推理,揭示模型的充分性偏差等失效模式,表明部分大模型体分类性能可媲美人类标注者。

详情

展开后加载摘要…

URL PDF HTML 收藏