arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

大厂专区

Amazon(亚马逊)

2026-04-21 至 2026-04-21 共收录 12
2511.02757 2026-04-21 cs.LG math.OC stat.ML

ConMeZO: Adaptive Descent-Direction Sampling for Gradient-Free Finetuning of Large Language Models

ConMeZO:适应性下降方向采样用于大语言模型的梯度自由微调

Lejs Deen Behric, Liang Zhang, Bingcong Li, Kiran Koshy Thekumparampil

机构 * Department of Computer Science, ETH Zurich(苏黎世联邦理工学院计算机科学系) Amazon AGI Labs(亚马逊人工智能实验室)

AI总结 ConMeZO通过适应性方向采样加速大语言模型微调的收敛速度,保留低内存足迹,比MeZO快2倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18328 2026-04-21 cs.CL

FregeLogic at SemEval 2026 Task 11: A Hybrid Neuro-Symbolic Architecture for Content-Robust Syllogistic Validity Prediction

FregeLogic在SemEval 2026任务11中的应用:一种混合神经符号架构用于内容鲁棒的三段论有效性预测

Adewale Akinfaderin, Nafi Diallo

机构 * Amazon Web Services(亚马逊网络服务)

AI总结 本文提出FregeLogic系统,结合多个LLM分类器与Z3 SMT求解器,通过形式逻辑验证减少内容偏差,提升三段论有效性预测的准确率和鲁棒性。

Comments Camera-ready version to appear at The 20th International Workshop on Semantic Evaluation (SemEval-2026), ACl 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05863 2026-04-21 cs.CL cs.LG cs.SE

ReflexiCoder: Teaching Large Language Models to Self-Reflect on Generated Code and Self-Correct It via Reinforcement Learning

ReflexiCoder:通过强化学习教大语言模型自我反思和自我纠正生成的代码

Juyong Jiang, Jiasi Shen, Sunghun Kim, Kang Min Yoo, Jeonghoon Kim, Sungju Kim

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学) Amazon AGI(亚马逊人工智慧实验室) NAVER Cloud(NAVER云)

AI总结 本文提出ReflexiCoder,一种基于强化学习的框架,使大语言模型在推理过程中自我反思和纠正代码,通过细粒度奖励函数优化整个反思-纠正过程,实现无需外部反馈的自我调试能力,实验表明其在多个基准测试中表现优异,且在推理效率上更高效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11113 2026-04-21 cs.CV cs.AI cs.LG

VIDEOP2R: Video Understanding from Perception to Reasoning

VIDEOP2R:从感知到推理的视频理解

Yifan Jiang, Yueying Wang, Rui Zhao, Toufiq Parag, Zhimin Chen, Zhenyu Liao, Jayakrishnan Unnikrishnan

机构 * USC(USC大学) Amazon(亚马逊) Keystone AI

AI总结 VIDEOP2R提出一种过程感知的视频RFT框架,通过三步流程生成高质量CoT数据集,并引入PA-GRPO算法提升视频推理性能,实现在七个基准中的六个达到SotA水平。

Comments CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08531 2026-04-21 cs.LG stat.ML

On Different Notions of Redundancy in Conditional-Independence-Based Discovery of Graphical Models

关于基于条件独立性的图形模型发现中冗余性的不同概念

Philipp M. Faller, Dominik Janzing

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) Amazon Research(亚马逊研究院)

AI总结 本文探讨了基于条件独立性发现图形模型中冗余测试的作用,指出冗余测试可能修正学习模型的错误,但并非所有测试都具备此能力。

Comments AISTATS 2026. Previous versions contained incorrect claims about partial correlations and the necessity of the condition in proposition 2

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17803 2026-04-21 cs.AI cs.LG

Adversarial Arena: Crowdsourcing Data Generation through Interactive Competition

对抗领域:通过互动竞争进行众包数据生成

Prasoon Goyal, Sattvik Sahai, Michael Johnston, Hangjie Shi, Yao Lu, Shaohua Liu, Anna Rumshisky, Rahul Gupta, Anna Gottardi, Desheng Zhang, Lavina Vaz, Leslie Ball, Lucy Hu, Luke Dai, Samyuth Sagi, Maureen Murray, Sankaranarayanan Ananthakrishnan

机构 * Amazon Nova Responsible AI(亚马逊Nova负责任人工智能)

AI总结 本文提出对抗领域框架,通过攻击者和防御者之间的互动竞争生成高质量对话数据,提升低资源领域和多轮对话的质量。

Comments 10 pages, 3rd DATA-FM workshop @ ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17658 2026-04-21 cs.MA cs.CL

Towards Self-Improving Error Diagnosis in Multi-Agent Systems

迈向多智能体系统中的自改进错误诊断

Jiazheng Li, Emine Yilmaz, Bei Chen, Dieu-Thu Le

机构 * King’s College London(伦敦国王学院) Amazon Alexa AI(亚马逊Alexa AI) University College London(伦敦大学学院)

AI总结 本文提出ErrorProbe框架,通过三阶段流程实现多智能体系统的语义故障归因,利用验证记忆提升跨领域迁移能力,在TracerTraj和Who&When基准测试中表现优异。

Comments 15 pages, 3 figures; accepted at ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14628 2026-04-21 cs.PL cs.AI cs.CR cs.LO

s2n-bignum-bench: A practical benchmark for evaluating low-level code reasoning of LLMs

s2n-bignum-bench:评估LLM低级代码推理能力的实用基准

Balaji Rao, John Harrison, Soonho Kong, Juneyoung Lee, Carlo Lipizzi

机构 * Stevens Institute of Technology(史蒂文斯理工学院) Amazon Web Services(亚马逊网络服务)

AI总结 本文提出s2n-bignum-bench基准,用于评估LLM在工业级低级密码学汇编代码中的定理证明能力,通过形式化验证挑战证明生成。

Comments Accepted as a Workshop paper at AIPV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11338 2026-04-21 cs.AI cs.LG

Automatic Dataset Construction (ADC): Sample Collection, Data Curation, and Beyond

自动数据集构建(ADC):样本收集、数据整理与更广泛的领域

Minghao Liu, Zonglin Di, Jiaheng Wei, Zhongruo Wang, Hengxiang Zhang, Ruixuan Xiao, Haoyu Wang, Jinlong Pang, Hao Chen, Ankit Shah, Hongxin Wei, Xinlei He, Zhaowei Zhao, Haobo Wang, Lei Feng, Jindong Wang, James Davis, Yang Liu

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校) Amazon(亚马逊) SUSTech(华南理工大学) Zhejiang University(浙江大学) Yale University(耶鲁大学) Carnegie Mellon University(卡内基梅隆大学) HKUST (GZ)(香港科技大学) Nanyang Technological University(南洋理工大学) Microsoft(微软)

AI总结 本文提出自动数据集构建方法ADC,通过LLM实现高效数据集生成,减少人工标注成本,构建包含12个主类和12000个细粒度子类的Clothing-ADC数据集,降低标签噪声至10.7%,并设计三个针对标签噪声和类别不平衡的基准数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18361 2026-04-21 cs.CL

Synthetic Data Generation for Training Diversified Commonsense Reasoning Models

为训练多样化常识推理模型生成合成数据

Tianhui Zhang, Bei Peng, Danushka Bollegala

机构 * University of Liverpool(利物浦大学) University of Sheffield(谢菲尔德大学) Amazon(亚马逊)

AI总结 本文提出两阶段方法生成首个合成数据集CommonSyn,提升生成多样性和质量,适用于不同规模的大语言模型。

Comments ACL2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12831 2026-04-21 cs.CL cs.AI cs.DB cs.LG

MTSQL-R1: Towards Long-Horizon Multi-Turn Text-to-SQL via Agentic Training

MTSQL-R1:通过代理训练实现长视界多轮文本到SQL

Taicheng Guo, Hai Wang, ChaoChun Liu, Mohsen Golalikhani, Xin Chen, Xiangliang Zhang, Chandan K. Reddy

机构 * University of Notre Dame(诺特丹大学) Amazon(亚马逊) Salesforce

AI总结 MTSQL-R1通过代理训练框架提升多轮文本到SQL任务的长视界表现,通过环境驱动验证和记忆引导细化提升对话连贯性。

Comments ACL 2026 Main camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09474 2026-04-21 cs.CL cs.AI

Multimodal Policy Internalization for Conversational Agents

多模态策略内化用于对话代理

Zhenhailong Wang, Jiateng Liu, Amin Fazel, Ritesh Sarkhel, Xing Fan, Xiang Li, Chenlei Guo, Heng Ji, Ruhi Sarikaya

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon(亚马逊)

AI总结 本文提出多模态策略内化任务,通过将复杂策略内化为模型参数,提升对话代理的策略遵循能力,同时提供新数据集和训练框架TriMPI以促进研究。

详情

展开后加载摘要…

URL PDF HTML 收藏