arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Tencent(腾讯)

2026-08-10 至 2026-08-10 共收录 6
2608.07371 2026-08-10 cs.LG cs.CL 新提交

Trajectory-Relative Hindsight Distillation for Agentic Reinforcement Learning

面向智能体强化学习的轨迹相对事后蒸馏

Haoyu Zheng, Yun Zhu, Qing Wang, Wenqiao Zhang

机构 * Zhejiang University(浙江大学) Shanghai AI Laboratory(上海人工智能实验室) Tencent(腾讯)

AI总结 针对智能体强化学习中事后信号分配不清的问题,提出TRIAL框架,通过轨迹相对步分配优化监督信号,在WebShop、ALFWorld等任务上优于GRPO及多数基线方法,提升了任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06802 2026-08-10 cs.CL 新提交

Simple-OPD: Demystifying Warm-up for On-policy Distillation

Simple-OPD:揭开策略内蒸馏的预热阶段之谜

Tao Liu, Taiqiang Wu, Mao Zheng, Xuan Luo, Runming Yang, Xuewei Yang, Junjie Wang, Yujiu Yang

机构 * Tsinghua University(清华大学) The University of Hong Kong(香港大学) Tencent(腾讯)

AI总结 本文通过数据与训练视角研究OPD的预热阶段,发现预热依赖教师兼容CoT监督、LoRA近饱和训练优于全参数SFT,提出Simple-OPD方法并验证其有效性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06410 2026-08-10 cs.AI cs.CL cs.MA 新提交

ADIAS: Automated Design of Interactive Agentic Systems

ADIAS:交互式智能体系统的自动化设计

Lekang Jiang, Bohan Tang, Stephan Goetz, Yiwen Guo

机构 * University of Cambridge(剑桥大学) Tencent(腾讯)

AI总结 本研究针对现有智能体设计方法的缺陷,提出以问题为中心的优化方案,构建ADIAS框架,在五个交互式基准中较最强基线平均提升25.2%,消融实验验证了关键机制的有效性。

Comments 23 pages, 7 tables, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03020 2026-08-10 cs.AI 版本更新

LoCA: Forward-Only LLM Tuning after One-Shot Calibration with Local Credit Assignment

LoCA:基于局部信用分配的一次性校准后仅前向的大语言模型调优

Linhan Xia, Rui Liu, Zhaofeng Zhang, Yihao Wang, Binrui Shen, Shengxin Zhu

机构 * University of Oklahoma(俄克拉荷马大学) Imperial College London(伦敦帝国学院) University of Michigan(密歇根大学) Tencent(腾讯) University of Edinburgh(爱丁堡大学) University of Southern California(南加州大学) Beijing Normal University(北京师范大学) Beijing Normal-Hong Kong Baptist University(北京师范大学-香港浸会大学联合国际学院)

AI总结 本文提出LoCA方法,通过一次性校准替换大语言模型调优的重复反向传播,在多个基准上优于LoRA,降低了GPU峰值内存、CPU稳态内存与前向传递时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25291 2026-08-10 cs.CL 版本更新

CoSA: Accelerating Long-Context Inference via Proxy-Kernel Co-Designed Sparse Attention

CoSA:通过代理内核协同设计的稀疏注意力加速长上下文推理

Yufei Xue, Lin Niu, Hong Liu, Siran Liu, Hanyong Shao, Wei Liu, Guanghua Yu, Jianchen Zhu, Jun Zhang

机构 * Tencent(腾讯)

AI总结 研究针对自注意力长上下文推理成本高的问题,提出CoSA方法,通过结合内核感知代理与有序跳过内核,在两阶段实现高效稀疏注意力,在主流LLM和长上下文基准测试中,以低预算获高精度,加速注意力并减少端到端时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17889 2026-08-10 cs.CV 版本更新

Identity as Presence: Towards Appearance and Voice Personalized Joint Audio-Video Generation

身份作为存在:迈向基于外观和声音的联合音频视频生成

Qin Chen, Yingjie Chen, Shilun Lin, Cai Xing, Binxin Yang, Long Zhou, Qixin Yan, Wenjing Wang, Dingming Liu, Hao Liu, Chen Li, Jing Lyu

机构 * Tencent Inc.(腾讯公司) Peking University(北京大学)

AI总结 本文提出一个统一的框架,实现身份感知的音频视频生成,通过数据整理管道和灵活的身份注入机制,提升生成内容的高保真度和一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏