arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Southern California(南加州大学)

2026-08-26 至 2026-08-26 共收录 7
2608.24024 2026-08-26 cs.AI 新提交

Beyond Confidence: Test-Time Scaling for Multi-Turn Search Agents via Retrieval Grounding

超越置信度:基于检索 grounding 的多轮搜索智能体测试时缩放

Hyunho Kook, Junhyuk So, Tianyu Fu, Haizhong Zheng, Beidi Chen

机构 * University of Southern California(南加州大学) Pohang University of Science and Technology (POSTECH)(浦项科技大学) Tsinghua University(清华大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 针对多轮搜索智能体中基于置信度投票因复制膨胀失效的问题,提出检索接地投票(RGV)方法,在四个基准和五个 LLM 上性能优于基线,准确率最高提升 5.4%

Comments Accepted to EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23972 2026-08-26 cs.RO eess.SY 新提交

Safety-aware Model Predictive Path Integral Control with Signal Temporal Logic

感知安全的带信号时序逻辑的模型预测路径积分控制

Yiqi Zhao, Taekyung Kim, Hideki Okamoto, Bardh Hoxha, Jyotirmoy V. Deshmukh, Lars Lindemann, Georgios Fainekos

机构 * University of Southern California(南加州大学) University of Michigan(密歇根大学) Toyota Motor North America R&D(丰田北美研发中心) ETH Zürich(苏黎世联邦理工学院)

AI总结 本文提出safety-aware-stl-mppi框架,将STL公式编码为CBF并集成到MPPI控制器,经火星车与四旋翼实验验证,可在复杂约束下实现高安全与效率的运动规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23835 2026-08-26 cs.LG cs.SI 新提交

Generating Intervention Hypotheses using Explainable Explanations on Graphs: G2I, a Two-Stage Greedy Framework

基于图的可解释解释生成干预假设:G2I,一个两阶段贪心框架

Mulin Tian, Ajitesh Srivastava

机构 * University of Southern California(南加州大学) Northeastern University(东北大学)

AI总结 该研究提出两阶段贪心框架G2I,将反事实解释转化为干预设计问题,在节点层面生成可操作反事实、网络层面解决预算约束下的DNF覆盖问题,实验显示其干预策略效率优于掩码方法。

Comments 11 pages, 3 figures. Accepted at the 35th ACM International Conference on Information and Knowledge Management (CIKM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20818 2026-08-26 cs.LG cs.AI cs.CV 版本更新

Scaling Muon for Diffusion Transformers

针对扩散Transformer的Muon优化器的缩放研究

Chenghao Li, Xiao Han, Xinxin Huang, Wei Liu, Boyang Li, Bing Xiao, Heran Zhang, Juanma Perez Rua, Ke Xu, Kangning Liu, Linjun Kuang, Na Li, Tan Wang, Tian Xie, Wei Peng, Yang Pei, Yifan Xu, Yuanhao Zhai, Yuwei Lin, Zhe Wang, Zihao He, Daniel Li, Junbiao Tang, Ziyang Jiang, Dake Chen

机构 * University of Southern California(南加州大学) Meta

AI总结 该研究针对大型扩散Transformer的Muon优化器,提出周期性行级Muon,在保留其生成质量优势的同时,大幅降低训练的计算、通信开销与时间。

Comments This version has to be withdrawn due to the incomplete publication privacy review required by the company. After completing the privacy review, the newer version will be updated

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19760 2026-08-26 cs.LG cs.AI cs.CL 版本更新

Credit Without Ground Truth: Auditing Step-Level Credit Assignment in LLM Agents Against Executed Replay

无真实值的信用:针对执行重放的大语言模型智能体的步骤级信用分配审计

Haiyue Zhang

机构 * University of Southern California(南加州大学)

AI总结 该研究针对LLM智能体,在ALFWorld环境中审计步骤级信用分配,发现现有信用信号无法识别关键步骤,提出需匹配有效样本量比较信用规则。

Comments 52 pages, 6 figures. Pre-registered; frozen analysis plans and prompts included in the appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26958 2026-08-26 cs.CL cs.AI 版本更新

Tournament-GRPO: Group-Wise Tournament Rewards for Reinforcement Learning in Open-Ended Long-Form Generation

Tournament-GRPO:面向开放式长文本生成强化学习的群组锦标赛奖励

Zixuan Yang, Yiqun Chen, Wei Yang, Erhan Zhang, Zihan Shen, Xiaochi Wei, Yan Gao, Yi Wu, Yao Hu, Jiaxin Mao

机构 * Renmin University of China(中国人民大学) University of Southern California(南加州大学) Zhejiang University(浙江大学) Xiaohongshu Inc.(小红书公司)

AI总结 针对开放式长文本生成中缺乏可靠参考答案和自动评估指标的问题,提出Tournament-GRPO框架,通过同一查询生成结果间的多轮锦标赛比较将基于规则的LLM评判转化为相对奖励,在Deep Research Bench上取得4.52分提升。

Comments Accepted to EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2110.03950 2026-08-26 math.OC cs.GT cs.LG 版本更新

Nonconvex-Nonconcave Min-Max Optimization with a Small Maximization Domain

小最大化域的非凸非凹极小极大优化

Dmitrii M. Ostrovskii, Babak Barazandeh, Meisam Razaviyayn

机构 * School of Mathematics & Industrial & Systems Engineering (ISyE), Atlanta, USA(数学与工业与系统工程学院(ISyE),美国亚特兰大) Viterbi School of Engineering, University of Southern California, Los Angeles, USA(维特比工程学院,美国南加州大学,洛杉矶)

AI总结 针对非凸非凹极小极大问题,提出利用泰勒近似替代原函数,当最大化域直径足够小时,近似问题的稳定点保持原问题的近似稳定点,并给出算法收敛保证。

详情

展开后加载摘要…

URL PDF HTML 收藏