arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Southern California(南加州大学)

2026-08-31 至 2026-08-31 共收录 4
2608.24024 2026-08-31 cs.AI 版本更新

Beyond Confidence: Test-Time Scaling for Multi-Turn Search Agents via Retrieval Grounding

超越置信度:基于检索 grounding 的多轮搜索智能体测试时缩放

Hyunho Kook, Junhyuk So, Tianyu Fu, Haizhong Zheng, Beidi Chen

机构 * University of Southern California(南加州大学) Pohang University of Science and Technology (POSTECH)(浦项科技大学) Tsinghua University(清华大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 针对多轮搜索智能体中基于置信度投票因复制膨胀失效的问题,提出检索接地投票(RGV)方法,在四个基准和五个 LLM 上性能优于基线,准确率最高提升 5.4%

Comments Accepted to EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14240 2026-08-31 cs.AI 版本更新

AFFORDANCE20Q: Evaluating Affordance Reasoning from Physical Properties

AFFORDANCE20Q:从物理属性评估可承担性推理

Yifan Jiang, Meige Yang, Zitong Li, Jay Pujara

机构 * Information Sciences Institute, University of Southern California(南加州大学信息科学研究所) University of Southern California(南加州大学)

AI总结 提出Affordance20Q基准,通过20个问题游戏评估模型从物理属性推理物体可承担性的能力,发现LLM与人类差距约20分,并开发KARI方法提升开源模型达15.2分。

Comments EMNLP Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30470 2026-08-31 cs.LG 版本更新

Can Subgraph Explanations Be Weaponized to Steal Graph Neural Networks?

子图解释能否被武器化以窃取图神经网络?

Ojas Nimase, Jiate Li, Yue Zhao, Yushun Dong

机构 * University of Southern California(南加州大学) Florida State University(佛罗里达州立大学)

AI总结 本文提出首个针对图分类的黑盒模型提取攻击,利用模型解释输出引导蒙特卡洛边敏感性估计,并利用解释子图缩小边界搜索空间,实验表明该方法优于现有基线。

Comments 28 pages, 8 figures, 10 tables. Under review at NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19423 2026-08-31 cs.CR cs.AI cs.LG 版本更新

The Autonomy Tax: Defense Training Breaks LLM Agents

自主性税:防御训练破坏LLM智能体

Shawn Li, Yue Zhao

机构 * University of Southern California(南加州大学)

AI总结 揭示防御训练在提升LLM智能体安全性时,系统性地破坏其工具执行能力,导致任务失败率飙升,且无法有效防御复杂攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏