arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Xi'an Jiaotong University(西安交通大学)

2026-08-31 至 2026-08-31 共收录 4
2608.28128 2026-08-31 cs.LG cs.AI 新提交

VICT: Verifier-Instrumented Credit Tracing for Long-Horizon LLM Agent Reinforcement Learning

VICT:用于长 horizon LLM 智能体强化学习的验证器插装式信用追踪

Pengcheng Li, Zhengyang Zhang, Dongxu Zhang, Sui Huang, Shaohua Ma

机构 * Tsinghua University(清华大学) Xi’an Jiaotong University(西安交通大学) Jiaxing Nanhu University(嘉兴南湖学院)

AI总结 针对长 horizon LLM 智能体强化学习的细粒度信用分配挑战,提出 VICT 方法,通过验证器侧的证明边追踪分配信用,在 ALFWorld 和 WebShop 上性能显著优于仅结果训练。

Comments accepted by EMNLP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28067 2026-08-31 cs.AI 新提交

SEPO: Evidence-Grounded Prompt Optimization via Structural Editing

SEPO:基于证据的结构化编辑提示优化

Xiaoyu Ma, Haoyue Liu, Yiwen Li, Jionghao Zhu, Zhichao Wang, Ye Chen, Xiaoying Tang

机构 * School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)理工学院) Xi’an Jiaotong University(西安交通大学) Shenzhen Future Network of Intelligence Institute (FNiI-Shenzhen)(深圳未来智能网络研究院) Guangdong Provincial Key Laboratory of Future Networks of Intelligence, CUHK(SZ)(香港中文大学(深圳)广东省未来网络智能重点实验室)

AI总结 本文提出SEPO提示优化器,通过结构化编辑与编辑-效果谱系反馈优化提示,在14任务套件中较GEPA提升准确率,同时在帕累托前沿上优化效率更高、提示更短。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27875 2026-08-31 cs.AI 新提交

HyQuant: Hybrid-Precision Quantization for LLM Attention

HyQuant:面向大语言模型注意力机制的混合精度量化方法

Jiatong Ding, Bingxin Xing, Yu Zhang, Dian Ding, Xiaodong Yi, Xianbin Ouyang, Feihu Zhou, Kun Zhang, Zhenyu Guo, Hao Pan, Guangtao Xue, Yiming Zhang

机构 * Xiamen University(厦门大学) Tencent Penglai Lab(腾讯蓬莱实验室) Shanghai Jiao Tong University(上海交通大学) Xi’an Jiaotong University(西安交通大学)

AI总结 HyQuant是一种面向LLM注意力的混合精度量化框架,通过保留关键区域高精度、量化其余部分,在各类任务上实现近乎无损精度,提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07261 2026-08-31 cs.CL 版本更新

Why Knowing Both Hops Is Not Enough: Understanding Two-Hop Generalization in Language Models

仅知道两跳信息是不够:理解语言模型中的两跳泛化

Zili Zhang, Yilin Wang, Heng Wang, Herun Wan, Minnan Luo

机构 * Xi’an Jiaotong University(西安交通大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 本研究针对语言模型两跳查询失败问题,在受控环境训练Transformer,揭示其泛化规律与跨层不匹配机制,提出循环式训练策略以提升分布外两跳泛化能力。

Comments EMNLP 2026, findings

详情

展开后加载摘要…

URL PDF HTML 收藏