arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

2026-04-22 至 2026-04-22 共收录 9
2604.16529 2026-04-22 cs.SE cs.AI cs.CL cs.LG

Scaling Test-Time Compute for Agentic Coding

为代理编程扩展测试时计算

Joongwon Kim, Wannan Yang, Kelvin Niu, Hongming Zhang, Yun Zhu, Eryk Helenowski, Ruan Silva, Zhengxing Chen, Srinivasan Iyer, Manzil Zaheer, Daniel Fried, Hannaneh Hajishirzi, Sanjeev Arora, Gabriel Synnaeve, Ruslan Salakhutdinov, Anirudh Goyal

机构 * Meta Superintelligence Labs(Meta超级智能实验室) University of Washington(华盛顿大学) New York University(纽约大学) Google DeepMind(谷歌DeepMind) Carnegie Mellon University(卡内基梅隆大学) Princeton University(普林斯顿大学)

AI总结 本文提出基于轨迹紧凑表示的代理编程测试时扩展框架,通过递归竞赛投票和并行-蒸馏-细化方法提升长周期代理性能,实验证明在SWE-Bench和Terminal-Bench上显著提升效果。

Comments 70 pages, 26 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11665 2026-04-22 cs.CL

Multi-Task Reinforcement Learning for Enhanced Multimodal LLM-as-a-Judge

多任务强化学习用于增强多模态大语言模型作为裁判

Junjie Wu, Xuan Kan, Zihao He, Shunwen Tan, Bo Pan, Kaitai Zhang

机构 * Meta AI Hong Kong University of Science and Technology(香港科技大学) Emory University(埃默里大学)

AI总结 本文提出MT-RL-Judge框架,通过多任务强化学习优化多模态大语言模型作为裁判,提升判断一致性和与人类偏好的相关性,并在分布外任务中展现鲁棒泛化能力。

Comments ACL 2026 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04800 2026-04-22 cs.CL

Hybrid Architectures for Language Models: Systematic Analysis and Design Insights

语言模型的混合架构:系统分析与设计洞察

Sangmin Bae, Bilge Acun, Chien-Yu Lin, Haroun Habeeb, Seungyeon Kim, Liang Luo, Junjie Wang, Carole-Jean Wu

机构 * FAIR at Meta(Meta的FAIR) Meta

AI总结 本文系统分析了混合架构的设计,探讨了不同融合策略对语言模型性能、长上下文能力及效率的影响,提出优化设计方法。

Comments 41 pages, 8 figures, 22 tables;

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07761 2026-04-22 cs.AI cs.LG

TROJail: Trajectory-Level Optimization for Multi-Turn Large Language Model Jailbreaks with Process Rewards

TROJail: 多轮对话中针对大语言模型的多轮攻击优化

Xiqiao Xiong, Ouxiang Li, Zhuo Liu, Moxin Li, Wentao Shi, Fengbin Zhu, Qifan Wang, Fuli Feng

机构 * University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学) Meta AI

AI总结 本文提出TROJail,通过多轮强化学习优化攻击策略,引入过程奖励提升攻击成功率,实验显示在多个模型和基准上效果显著。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26566 2026-04-22 cs.LG cs.AI

Multiclass Local Calibration with the Jensen-Shannon Distance

多类局部校准与 Jensen-Shannon 距离

Cesare Barbera, Lorenzo Perini, Giovanni De Toni, Andrea Passerini, Andrea Pugnana

机构 * University of Trento(特伦托大学) University of Pisa(比萨大学) Meta Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会)

AI总结 本文提出多类局部校准概念,通过 Jensen-Shannon 距离改进神经网络的局部校准能力,解决现有方法在稀疏区域的校准偏差问题。

Comments Accepted at AISTATS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08240 2026-04-22 cs.CL

The Alignment Waltz: Jointly Training Agents to Collaborate for Safety

对齐之舞:联合训练代理以安全协作

Jingyu Zhang, Haozhu Wang, Eric Michael Smith, Sid Wang, Amr Sharaf, Mahesh Pasupuleti, Benjamin Van Durme, Daniel Khashabi, Jason Weston, Hongyuan Zhan

机构 * Meta Superintelligence Labs(Meta超智能实验室) Johns Hopkins University(约翰·霍普金斯大学)

AI总结 本文提出WaltzRL框架,通过联合训练对话代理和反馈代理,解决LLM在安全与帮助性间的平衡问题,实验表明其有效降低不安全响应和过度拒绝率。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03828 2026-04-22 cs.LG stat.ML

IMPACT: Importance-Aware Activation Space Reconstruction

IMPACT: 基于重要性的激活空间重建

Md Mokarram Chowdhury, Daniel Agyei Asante, Ernie Chang, Yang Li

机构 * Department of Computer Science, Iowa State University, United States(爱荷华州立大学计算机科学系) Meta, United States(Meta公司)

AI总结 本文提出IMPACT框架,通过结合激活结构与梯度重要性,实现低秩压缩优化,实验显示在保持准确性的同时,模型大小可减少55.4%。

Comments To appear in the Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14387 2026-04-22 cs.AI

SEAT: Sparse Entity-Aware Tuning for Knowledge Adaptation while Preserving Epistemic Abstention

SEAT:稀疏实体感知调谐以实现知识适应同时保持认知回避

William F. Shen, Xinchi Qiu, Nicola Cancedda, Nicholas D. Lane

机构 * University of Cambridge(剑桥大学) Meta

AI总结 SEAT通过稀疏调谐和实体扰动KL正则化,在保持认知回避能力的同时提升知识获取,无需对齐数据或后续重对齐,有效提升未知查询的人工评估回避率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20279 2026-04-22 cs.CV cs.CL

VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction

VLM-3R:融合指令对齐3D重建的视觉-语言模型

Zhiwen Fan, Jian Zhang, Renjie Li, Junge Zhang, Runjin Chen, Hezhen Hu, Kevin Wang, Huaizhi Qu, Shijie Zhou, Dilin Wang, Zhicheng Yan, Hongyu Xu, Justin Theiss, Tianlong Chen, Jiachen Li, Zhengzhong Tu, Zhangyang Wang, Rakesh Ranjan

机构 * UT Austin(德克萨斯大学奥斯汀分校) XMU(厦门大学) TAMU(德克萨斯大学阿灵顿分校) UCR(加州大学河滨分校) UNC(北卡罗来纳大学教堂山分校) Meta UCLA(加州大学洛杉矶分校)

AI总结 本文提出VLM-3R,通过融合3D重建指令微调,实现单目视频的3D空间辅助与具身推理,提升了视觉-空间推理和时间3D上下文理解的准确性和可扩展性。

Comments Project Page: https://vlm-3r.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏