arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Southern California(南加州大学)

2026-09-01 至 2026-09-01 共收录 15
2608.29934 2026-09-01 cs.CL cs.LG 新提交

Compression-Aware Abstention: Teaching LLMs to Refuse When KV-Compression Masks Remove Answer Evidence

感知压缩的弃权:当KV压缩掩码移除答案证据时,教大型语言模型拒绝回答

Mohammadali Khodabandehlou, Bhaskar Krishnamachari

机构 * University of Southern California(南加州大学)

AI总结 该研究首次将感知压缩的弃权表述为学习问题,通过训练LoRA适配器,在减少LLM因KV缓存压缩产生的幻觉的同时保留正确回答能力,在压缩缓存解码下取得显著提升。

Comments 19 pages, 5 figures. Accepted to the GroundLM workshop at EMNLP 2026. Code, adapters, and datasets: https://github.com/mali-kh/compression-aware-abstention

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29733 2026-09-01 cs.CV 新提交

XDG: Accelerated Visual Disambiguation

XDG:加速视觉消歧

Gonglin Chen, Ben Southall, Hanyuan Xiao, Wenbin Teng, Haolin Xiong, Tianwen Fu, Junyi Ouyang, Kshitij Singh Minhas, Supun Samarasekera, Rakesh Kumar, Yajie Zhao

机构 * USC Institute for Creative Technologies(南加州大学创意技术研究所) University of Southern California(南加州大学) SRI International(SRI国际公司)

AI总结 XDG是适配可扩展SfM的高效视觉消歧模型,通过微调Depth Anything 3并复用其相机令牌实现配对分类,在保持精度的同时将推理速度提升超3倍,大幅缩短大规模场景消歧耗时。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29492 2026-09-01 cs.CL 新提交

CoCoA: Context-Conditional Cultural Alignment for Large Language Models

CoCoA:面向大语言模型的上下文条件文化对齐

Kyungdon Lee, Wei Xu, Alan Ritter, Dong-Ho Lee, JinYeong Bak

机构 * Sungkyunkwan University(成均馆大学) Georgia Institute of Technology(佐治亚理工学院) University of Southern California(南加利福尼亚大学)

AI总结 CoCoA是面向大语言模型的上下文条件文化对齐框架,通过双上下文训练等方法,可降低实体文化偏见评分且对通用性能影响小,为缓解LLMs实体文化偏见提供新方向。

Comments Accepted to Findings of EMNLP 2026. 22 pages, 4 figures, 19 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29397 2026-09-01 cs.CL 新提交

AlgoWorlds: Benchmarking Tool Use for Global Optimization in Algorithmic Worlds

AlgoWorlds:用于算法世界中全局优化的工具使用基准

Zixiang Xu, Jiaan Wang, Fandong Meng

机构 * Weixin AI, Tencent(腾讯微信AI) University of Southern California(南加州大学)

AI总结 本研究推出AlgoWorlds基准,评估大语言模型在算法世界中利用工具将信息转化为全局最优决策的能力,实验显示领先模型仅38.61%案例能达精确最优。

Comments Homepage: https://xzx34.github.io/AlgoWorlds/ Code: https://github.com/xzx34/AlgoWorlds

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29109 2026-09-01 cs.CL 新提交

Recognition-Refusal Misalignment in LLMs: Why Models Answer Structurally Unanswerable Questions

大语言模型中的识别-拒绝错位:为何模型会回答结构上无法解答的问题

Yucheng Du, Xiyang Hu

机构 * University of Southern California(南加州大学) Arizona State University(亚利桑那州立大学)

AI总结 该研究发现大语言模型会回答结构上无法解答的问题是因识别到不可行性的信号与安全拒绝通路未对齐,而非缺失识别能力。

Comments Accepted to EMNLP 2026 Main Conference. 29 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22808 2026-09-01 cs.LG cs.MA cs.PF 版本更新

CatchBench: When Can an Agent Failure Be Caught?

CatchBench:智能体故障何时能被检测?

Yue Zhao

机构 * University of Southern California(南加州大学)

AI总结 CatchBench是首个在同一任务-方法接口下对智能体运行前、运行中、完成后三种信息状态进行评分的基准,涵盖多类模型与配置,揭示基准分数需结合标签过程才可解释。

Comments 40 pages, 6 figures, 22 tables. Work in progress. Code and data: https://github.com/yzhao062/catchbench

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02665 2026-09-01 cs.CR cs.AI cs.CL 版本更新

Single Canonical Prompts Underestimate LLM Safety's Surface-Form Sensitivity

单一规范提示低估了大语言模型安全的表面形式敏感性

Yongxi Zhou, Junwei Yao, Yuanzhe Liu, Zihan Dong, Wenbo Ye, Jiaxi Wen, Lai Yun Choi

机构 * Northeastern University(东北大学) Georgia Institute of Technology(佐治亚理工学院) University of Southern California(南加利福尼亚大学)

AI总结 该研究发现仅用单一规范提示评估大语言模型安全会低估其不安全合规性,不同表面形式下的不安全结果并集会超出最糟单一形式,且存在模型差异,同时发布了相关数据集、代码与响应标签。

Comments Accepted at the Sci-FM Workshop @ COLM 2026 (non-archival). Workshop version with reviews: https://openreview.net/forum?id=mZh0MqpOOC

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06854 2026-09-01 cs.LG cs.AI cs.GT 版本更新

A Gold-Standard Study of What Makes a Lightweight Game-Playing Agent Strong

关于使轻量级博弈代理强大的因素的金标准研究

Nima Kelidari, Mohammadsaeed Haghi, Mahdi Salmani

机构 * University of Southern California(美国南加州大学)

AI总结 研究不完美信息纸牌游戏中使轻量级博弈代理强大的因素,构建专家代理作标准,经超百次运行确定有效因素,添加基线并应用于另一游戏,得出通用方法可训练有竞争力代理且无需专家训练。

Comments 9 pages, 5 figures, 3 tables. Code and models: https://github.com/Nikelroid/adversarial-coevolution

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05113 2026-09-01 cs.CL cs.CY cs.HC 版本更新

Rating the Pitch, Not the Product: User Evaluations of LLMs Reflect Expectations More Than Performance

评价的是宣传话术,而非产品本身:用户对大语言模型的评估更多反映期望而非性能

Robert Morabito, Tyler McDonald, Charitra Viswanath, Angel Hsing-Chi Hwang, Susanne Gaube, Jad Kabbara, Ali Emami

机构 * Brock University(布鲁克大学) Emory University(埃默里大学) University of Southern California(南加州大学) University College London(伦敦大学学院) Massachusetts Institute of Technology(麻省理工学院)

AI总结 研究通过控制实验,让参与者使用不同宣传话术下的六种大语言模型完成任务,发现宣传话术影响用户评价和交互行为,任务表现未变,用户评价更多反映期望管理。

Comments Accepted to EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27786 2026-09-01 cs.LG cs.AI 版本更新

Locality-Aware Redundancy Pruning for LLM Depth Compression

面向LLM深度压缩的局部感知冗余剪枝

Vincent-Daniel Yun, Youngrae Kim, Woosang Lim, YoungJin Heo, Minkyu Kim, Sunwoo Lee

机构 * University of Southern California(美国南加州大学) Neural Superintelligence Lab, MODULABS(MODULABS神经超级智能实验室) Seoul National University(首尔国立大学) Inha University(釜山大学)

AI总结 提出LoRP,一种基于表示局部性的无训练单次深度剪枝框架,通过引入表示局部性分数(RLS)来识别和剪除冗余层,在多种LLM上提升了困惑度和下游任务准确率。

Comments EMNLP 2026 Main Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26872 2026-09-01 cs.LG cs.AI cs.CL 版本更新

When the Strongest Teacher Is Not the Best Teacher: Student-Centric Answer Selection

最强的教师并不总是最好的教师:以学生为中心的答案选择

Zhengyu Hu, Zheyuan Xiao, Linxin Song, Fengqing Jiang, Yuetai Li, Zhihan Xiong, Yue Liu, Junhao Lin, Yao Su, Lijie Hu, Kaize Ding, Teng Xiao, Radha Poovendran

机构 * University of Washington(华盛顿大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Southern California(南加州大学) Independent Researcher(独立研究者) National University of Singapore(新加坡国立大学) Microsoft(微软) Google(谷歌) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Northwestern University(西北大学) Allen Institute for AI (AI2)(人工智能研究院(AI2))

AI总结 提出以学生为中心的答案采样(SCAS)框架,通过估计学生中心的学习成本选择教师生成的答案,从而提升学生模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24818 2026-09-01 stat.ME cs.CL cs.LG 版本更新

Correcting test set contamination by spiking the training data

向训练数据注入噪声以校正测试集污染

Johnny Tian-Zheng Wei, Jerry Li, Ameya Godbole, Robin Jia

机构 * University of Southern California(南加州大学)

AI总结 提出通过以已知比例故意污染部分测试样本(注入噪声)来校正测试集污染导致的分数膨胀,并利用记忆预测器进行统计校正。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09076 2026-09-01 cs.MA cs.AI cs.LG 版本更新

Robust Multi-Agent LLMs under Byzantine Faults

在拜占庭故障下鲁棒的多智能体大语言模型

Haejoon Lee, Vincent-Daniel Yun, Dimitra Panagou, Sai Praneeth Karimireddy

机构 * Department of Robotics, University of Michigan, Ann Arbor, USA(密歇根大学机器人系,安娜堡,美国) Thomas Lord Department of Computer Science, University of Southern California, USA(南加州大学计算机科学托马斯·劳德系,美国)

AI总结 本文提出Self-Anchored Consensus算法,通过去中心化迭代过滤和优化协议提升多智能体系统在拜占庭故障下的鲁棒性,实验表明其在数学和常识推理任务中表现优异。

Comments EMNLP 2026 Main Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08336 2026-09-01 cs.CL cs.CV 版本更新

UReason: Benchmarking Reasoning-to-Generation Alignment in Unified Multimodal Models

从推理到像素:统一多模态模型中对齐差距的基准测试

Cheng Yang, Chufan Shi, Bo Shui, Yaokang Wu, Muzi Tao, Huijuan Wang, Ivan Yee Lee, Yong Liu, Xuezhe Ma, Taylor Berg-Kirkpatrick

机构 * University of California San Diego(加利福尼亚大学圣迭戈分校) University of Southern California(南加利福尼亚大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文通过UReason基准测试,探讨统一多模态模型中模态对齐问题,发现去上下文生成在图像生成任务中表现更优,揭示了文本推理与生成图像之间存在对齐差距。

Comments Project page: https://ureason.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06210 2026-09-01 cs.LG 版本更新

H-FedSN: Personalized Sparse Networks for Efficient and Accurate Hierarchical Federated Learning for IoT Applications

H-FedSN:面向物联网应用的高效精准分层联邦学习的个性化稀疏网络

Jiechao Gao, Yuangang Li, Jie Wang, Yue Zhao, Michael Lepech, Brad Campbell

机构 * University of Virginia(弗吉尼亚大学) University of Southern California(南加利福尼亚大学)

AI总结 针对物联网分层联邦学习的通信低效等问题,提出带二值掩码与贝叶斯聚合的H-FedSN,可降通信成本最多477倍且保持高准确率,适配物联网部署。

详情

展开后加载摘要…

URL PDF HTML 收藏