arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

大厂专区

Amazon(亚马逊)

2026-05-26 至 2026-05-26 共收录 21
2605.25890 2026-05-26 cs.LG

Merge-Bench: Resolve Merge Conflicts with Large Language Models

Merge-Bench: 使用大型语言模型解决合并冲突

Benedikt Schesch, Michael D. Ernst

机构 * Amazon(亚马逊) University of Washington(华盛顿大学)

AI总结 本文构建了包含7938个真实合并冲突的数据集Merge-Bench,并利用组相对策略优化(GRPO)训练LLMergeJ模型,在Java程序上以14B参数超越多数商业LLM,但最佳模型正确解决率仍低于60%。

Comments 14 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25836 2026-05-26 cs.CR cs.AI cs.CL

TTPrint: Evidence-Grounded TTP Extraction via Diverge-then-Converge Verification

TTPrint:通过发散-收敛验证实现基于证据的TTP提取

Yutong Cheng, Changze Li, Raihan Sultan Pasha Basuki, Qian Cui, Wei Ding, Peng Gao

机构 * Virginia Tech(弗吉尼亚理工大学) Universitas Ary Ginanjar(阿里甘jar大学) Amazon(亚马逊)

AI总结 提出TTPrint方法,采用先广泛提取后严格验证的发散-收敛设计,结合确定性证据定位与权威定义验证,在文档级TTP提取任务上显著提升宏F1分数。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25395 2026-05-26 cs.LG math.OC

EMA-Nesterov: Stabilizing Nesterov's Lookahead for Accelerated Deep Learning Optimization

EMA-Nesterov:稳定Nesterov前瞻以加速深度学习优化

Chung-Yiu Yau, Dawei Li, Athanasios Glentis, Valentyn Boreiko, Hoi-To Wai, Mingyi Hong

机构 * University of Minnesota(明尼苏达大学) Amazon AGI(亚马逊人工智能实验室) The Chinese University of Hong Kong(香港中文大学)

AI总结 针对深度学习优化中Nesterov动量因随机梯度噪声和非凸损失导致的不稳定性,提出EMA-Nesterov方法,用参数更新的指数移动平均替代标准前瞻方向,通过低通滤波捕捉训练轨迹的低频趋势,在凸问题中保持理论加速收敛率,并在语言模型预训练中验证了其广泛适用性和优于现有前瞻方法的性能。

Comments 25 page, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20787 2026-05-26 cs.CV

Findings of the Counter Turing Test: AI-Generated Image Detection

反图灵测试结果:AI生成图像检测

Rajarshi Roy, Nasrin Imanpour, Ashhar Aziz, Shashwat Bajpai, Gurpreet Singh, Shwetangshu Biswas, Kapil Wanaskar, Parth Patwa, Subhankar Ghosh, Shreyas Dixit, Nilesh Ranjan Pal, Vipula Rawte, Ritvik Garimella, Amitava Das, Amit Sheth, Vasu Sharma, Aishwarya Naresh Reganti, Vinija Jain, Aman Chadha

机构 * Kalyani Government Engineering College(卡利尼政府工程学院) University of South Carolina(南卡罗来纳大学) IIIT Delhi(德里IIIT) BITS Pilani Hyderabad Campus(比斯潘尼 Hyderabad 分校) IIIT Guwahati(果阿瓦提IIIT) NIT Silchar(西里char 工科院) San José State University(桑乔斯州立大学) UCLA(加州大学洛杉矶分校) Washington State University(华盛顿州立大学) Vishwakarma Institute of Information Technology(维斯瓦克arma 信息科技学院) Meta AI Amazon AI(亚马逊AI) BITS Pilani Goa(比斯潘尼 Goa 分校)

AI总结 本文通过Defactify 4.0工作坊的反图灵测试竞赛,评估了多种检测方法在区分AI生成图像与真实图像及识别具体生成模型上的性能,发现检测准确率较高但模型识别仍具挑战。

Comments Defactify4 @AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20761 2026-05-26 cs.CL

Findings of the Counter Turing Test: AI-Generated Text Detection

反图灵测试的发现:AI生成文本检测

Rajarshi Roy, Gurpreet Singh, Ashhar Aziz, Shashwat Bajpai, Nasrin Imanpour, Shwetangshu Biswas, Kapil Wanaskar, Parth Patwa, Subhankar Ghosh, Shreyas Dixit, Nilesh Ranjan Pal, Vipula Rawte, Ritvik Garimella, Amitava Das, Amit Sheth, Vasu Sharma, Aishwarya Naresh Reganti, Vinija Jain, Aman Chadha

机构 * Kalyani Government Engineering College(卡利尼政府工程学院) IIIT Delhi(德里IIIT) BITS Pilani Hyderabad Campus(比斯汉学院海得拉巴校区) AI Institute, University of South Carolina(南卡罗来纳大学人工智能研究所) IIIT Guwahati(古瓦哈提IIIT) NIT Silchar(西里char理工学院) San José State University(圣何塞州立大学) UCLA(加州大学洛杉矶分校) Washington State University(华盛顿州立大学) Vishwakarma Institute of Information Technology(维斯瓦卡马信息科技学院) Meta AI Amazon AI(亚马逊人工智能) BITS Pilani Goa(比斯汉学院果阿)

AI总结 本文通过反图灵测试(CT2)共享任务,评估了AI生成文本检测技术的有效性,发现二分类任务表现优异(F1=1.0000),但模型归因任务更具挑战性(最佳F1=0.9531),并分析了微调Transformer、集成学习等方法的优劣。

Comments Defactify4 @AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12906 2026-05-26 cs.LG cs.AI

Data Difficulty and the Generalization--Extrapolation Tradeoff in LLM Fine-Tuning

数据难度与LLM微调中的泛化-外推权衡

Siyuan Liu, Tinghong Chen, Xinghan Li, Yifei Wang, Jingzhao Zhang

机构 * IIIS, Tsinghua University(清华大学人工智能学院) College of AI, Tsinghua University(清华大学人工智能学院) Shanghai Qi Zhi Institute(上海启智研究院) Amazon AGI SF Lab(亚马逊AGI旧金山实验室)

AI总结 本文通过实证和理论分析,研究了监督微调中数据难度对模型行为的影响,发现数据难度与数据量共同决定泛化与外推之间的权衡,并存在最优难度随数据量增加而向更难数据偏移的规律。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00553 2026-05-26 cs.CV cs.AI

A Comprehensive Dataset for Human vs. AI Generated Image Detection

人类与AI生成图像检测的综合数据集

Rajarshi Roy, Ashhar Aziz, Shashwat Bajpai, Nasrin Imanpour, Gurpreet Singh, Shwetangshu Biswas, Kapil Wanaskar, Parth Patwa, Subhankar Ghosh, Shreyas Dixit, Nilesh Ranjan Pal, Vipula Rawte, Ritvik Garimella, Amitava Das, Amit Sheth, Gaytri Jena, Vasu Sharma, Aishwarya Naresh Reganti, Vinija Jain, Aman Chadha

机构 * 1 Kalyani Government Engineering College, India. 2 IIIT Delhi, India. 3 BITS Pilani Hyderabad Campus, India. 4 University of South Carolina, USA. 5 IIIT Guwahati, India. 6 NIT Silchar, India. 7 San Jos\' e State University, USA. 8 UCLA, USA. 9 Washington State University, USA. 10 Vishwakarma Institute of Information Technology, India. 11 Gandhi Institute for Technological Advancement, India. 12 Meta AI, USA. 13 Amazon AI, USA. 14 BITS Pilani Goa, India.

AI总结 针对AI生成图像检测问题,构建了包含96000个真实与合成数据点的MS COCOAI数据集,并提出了图像真伪分类与生成模型识别两个任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22874 2026-05-26 cs.CL

A Comprehensive Dataset for Human vs. AI Generated Text Detection

人类与AI生成文本检测的综合数据集

Rajarshi Roy, Gurpreet Singh, Ashhar Aziz, Shashwat Bajpai, Nasrin Imanpour, Shwetangshu Biswas, Kapil Wanaskar, Parth Patwa, Subhankar Ghosh, Shreyas Dixit, Nilesh Ranjan Pal, Vipula Rawte, Ritvik Garimella, Gaytri Jena, Amitava Das, Amit Sheth, Vasu Sharma, Aishwarya Naresh Reganti, Vinija Jain, Aman Chadha

机构 * Kalyani Government Engineering College(卡利尼政府工程学院) IIIT Guwahati(古瓦哈提理工学院) IIIT Delhi(德里理工学院) BITS Pilani Hyderabad Campus(比什帕利 Hyderabad 分校) University of South Carolina(南卡罗来纳大学) NIT Silchar(西里 char 工程学院) San José State University(桑乔斯州立大学) UCLA(加州大学洛杉矶分校) Washington State University(华盛顿州立大学) Vishwakarma Institute of Information Technology(维斯瓦卡arma 信息科技学院) Gandhi Institute for Technological Advancement(甘地技术进步研究所) BITS Pilani Goa(比什帕利 Goa 分校) Meta AI Amazon AI(亚马逊AI)

AI总结 本文提出了一个包含73,193个文本样本的综合数据集,结合真实纽约时报文章与多个先进LLM生成的合成文本,用于区分人类与AI生成文本及归因任务,基线准确率分别为58.35%和8.92%。

Comments Defactify4 @AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25189 2026-05-26 cs.LG cs.CL

Directional Alignment Mitigates Reward Hacking in Reinforcement Learning for Language Models

方向对齐缓解语言模型强化学习中的奖励黑客问题

Wenlong Deng, Jiaji Huang, Kaan Ozkara, Yushu Li, Christos Thrampoulidis, Xiaoxiao Li, Youngsuk Park

机构 * University of British Columbia(不列颠哥伦比亚大学) Vector Institute(向量研究所) Amazon(亚马逊)

AI总结 通过分析强化学习更新的几何结构,发现奖励黑客源于优化偏离稳定低维学习轨迹,提出可信方向投影方法约束梯度在干净参考子空间内,延迟捷径利用并保持任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25166 2026-05-26 cs.LG cs.AI

AME-TS: Anchored Mixture-of-Experts for Time Series Forecasting

AME-TS:基于锚定的混合专家模型用于时间序列预测

Rui Wang, Renhao Xue, Ray Razi, Huan Song, Hannah R. Marlowe

机构 * Amazon Web Services(亚马逊网络服务)

AI总结 提出AME-TS,一种结构引导的稀疏时间序列基础模型,通过轻量级预测器估计序列级描述符并生成专家软结构先验,实现专家路由与可解释时间结构对齐,在GIFT-Eval基准上实现精度-效率权衡,并在M5微调中展现更稳定的专家专业化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24904 2026-05-26 cs.CL

Quantifying the Impact of Translation Errors on Multilingual LLM Evaluation

量化翻译错误对多语言大语言模型评估的影响

Klaudia-Doris Thellmann, Bernhard Stadler, Michael Färber, Jens Lehmann

机构 * TUD Dresden University of Technology and ScaDS.AI(德累斯顿技术大学和ScaDS.AI) InfAI e.V.(InfAI协会) Amazon(亚马逊)

AI总结 研究机器翻译基准中的翻译错误如何影响多语言LLM评估的可靠性,通过自动错误跨度检测和准确性下降分析揭示翻译错误与评估指标之间的关联。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24703 2026-05-26 cs.CL cs.AI

TS-Skill: A Benchmark for Evaluating Analytical Skills in Time-Series Question Answering

TS-Skill: 用于评估时间序列问答中分析技能的基准

Liying Han, Kang Yang, Oliver Wang, Jason Wu, Pengrui Quan, Gaofeng Dong, Ozan Baris Mulayim, Sizhe Ma, Yuyang Yuan, Dezhi Hong, Mario Berges, Mani Srivastava

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Samsung Research America(三星美国研究院) Carnegie Mellon University(卡内基梅隆大学) Microsoft(微软) Amazon(亚马逊)

AI总结 提出TS-Skill基准,通过三种可组合的分析技能(时间尺度选择、时间定位和跨区间整合)来诊断时间序列问答中模型的信号级能力,并开发SKEvol框架自动构建基准,实验揭示不同技能上的能力差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24642 2026-05-26 cs.CV cs.RO

Understanding the Impact of Geometric Foundation Models on Vision-Language-Action Models

理解几何基础模型对视觉-语言-动作模型的影响

Yurou Yang, Muyuan Lin, Roberto Martin-Martin, Martin Labrie, Shreekant Gayaka, Cheng-Hao Kuo, Luca Carlone

机构 * Amazon Personal Robotics Group(亚马逊个人机器人小组) University of Texas at Austin(德克萨斯大学奥斯汀分校) Massachusetts Institute of Technology(麻省理工学院)

AI总结 本文通过线性探测分析量化了视觉-语言-动作模型(VLA)与几何基础模型(GFM)之间的“几何差距”,比较了三种注入几何信息的架构,并研究了非架构因素对几何VLA性能的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12673 2026-05-26 cs.CV

MambaBEV: An EV-based 3D detection model with Mamba2

MambaBEV:基于Mamba2的BEV三维检测模型

Zihan You, Ni Wang, Hao Wang, Qichao Zhao, Jinxiang Wang

机构 * School of Instrument Science and Engineering, Southeast University, China(仪器科学与工程学院,东南大学,中国) Amazon Development Center Germany GmbH, Germany(亚马逊德国开发中心,德国) T3CAIC Technology, China(T3CAIC技术,中国) School of Mechanical Engineering, Southeast University, China(机械工程学院,东南大学,中国)

AI总结 提出MambaBEV模型,利用Mamba2状态空间模型通过TemporalMamba时序融合模块和Mamba-based DETR头增强全局上下文建模,提升自动驾驶中大型物体的3D检测精度。

Comments ICPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24218 2026-05-26 cs.CL

QUEST: Training Frontier Deep Research Agents with Fully Synthetic Tasks

QUEST:使用完全合成任务训练前沿深度研究代理

Jian Xie, Tianhe Lin, Zilu Wang, Yuting Ning, Yuekun Yao, Tianci Xue, Zhehao Zhang, Zhongyang Li, Kai Zhang, Yufan Wu, Shijie Chen, Boyu Gou, Mingzhe Han, Yifei Wang, Vint Lee, Xinpeng Wei, Xiangjun Wang, Yu Su, Huan Sun

机构 * The Ohio State University(俄亥俄州立大学) Amazon AGI SF Lab(亚马逊人工智能SF实验室)

AI总结 提出QUEST系列模型,通过统一规则树合成训练数据,结合中训练、监督微调和强化学习,使开放模型在深度研究任务上接近或超越闭源前沿代理。

Comments Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24117 2026-05-26 cs.AI

SkillEvolBench: Benchmarking the Evolution from Episodic Experience to Procedural Skills

SkillEvolBench:从情景经验到程序性技能的演化基准测试

Yingtie Lei, Zhongwei Wan, Jiankun Zhang, Samiul Alam, Zixuan Zhong, Peizhou Huang, Xin Wang, Jingxuan Zhang, Donghao Zhou, Yunta Hsieh, Zhihao Dou, Hui Shen, Yan Xu, Dimitrios Dimitriadis, Tuo Zhang, Mi Zhang

机构 * The Ohio State University(俄亥俄州立大学) The University of Chicago(芝加哥大学) University College London(伦敦大学学院) University of Michigan(密歇根大学) The Chinese University of Hong Kong(香港中文大学) Case Western Reserve University(凯斯西储大学) Amazon(亚马逊)

AI总结 提出SkillEvolBench基准,通过六个真实环境中的180个任务,评估大语言模型代理能否将情景经验提炼为可复用的程序性技能,发现当前代理难以形成稳健的技能,且原始轨迹复用优于蒸馏技能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23944 2026-05-26 cs.AI math.PR

Right-Sizing Communication and Recommendation Set Size in AI-Assisted Search

AI辅助搜索中的通信与推荐集规模合理设定

Jing Dong, Prakirt Raj Jhunjhunwala, Yash Kanoria

机构 * Columbia Business School, Columbia University(哥伦比亚大学商学院) Amazon.com Inc.(亚马逊公司)

AI总结 通过建模用户与AI推荐系统的交互,研究在考虑通信成本和搜索成本时,如何优化消息精度和推荐集大小以最大化用户期望收益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02037 2026-05-26 cs.RO cs.AI

VILAS: A VLA-Integrated Low-cost Architecture with Soft Grasping for Robotic Manipulation

VILAS:一种集成软抓取的VLA低成本机器人操作架构

Zijian An, Hadi Khezam, Bill Cai, Ran Yang, Shijie Geng, Yiming Feng, Yue Zheng, Lifeng Zhou

机构 * Drexel University(德雷塞尔大学) Virginia Seafood Agricultural Research and Extension Center(弗吉尼亚海鲜农业研究与推广中心) Amazon Store Foundation AI (SFAI)(亚马逊商店基金会人工智能(SFAI))

AI总结 提出VILAS低成本模块化机器人操作平台,集成软抓取机构,支持端到端VLA策略学习与部署,并在葡萄抓取任务中验证有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03955 2026-05-26 cs.AI cs.MA

AgentArk: Distilling Multi-Agent Intelligence into a Single LLM Agent

AgentArk:将多智能体智能蒸馏到单个LLM智能体中

Yinyi Luo, Yiqiao Jin, Weichen Yu, Mengqi Zhang, Srijan Kumar, Xiaoxiao Li, Weijie Xu, Xin Chen, Jindong Wang

机构 * Carnegie Mellon University(卡内基梅隆大学) William & Mary(威廉与玛丽学院) Georgia Institute of Technology(佐治亚理工学院) Amazon(亚马逊) University of British Columbia(不列颠哥伦比亚大学)

AI总结 提出AgentArk框架,通过三种分层蒸馏策略将多智能体系统的交互动态蒸馏到单个模型权重中,使单个智能体具备多智能体的推理和自校正能力,同时保持计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20273 2026-05-26 cs.DC cs.CV

SwiftFusion: Scalable Sequence Parallelism for Distributed Inference of Diffusion Transformers on GPUs

SwiftFusion: 面向GPU上扩散Transformer分布式推理的可扩展序列并行

Jiacheng Yang, Jun Wu, Yaoyao Ding, Zhiying Xu, Yida Wang, Gennady Pekhimenko

机构 * University of Toronto \&\ Institute Amazon University of Toronto \& Vector Institute \& NVIDIA

AI总结 针对扩散Transformer推理中序列并行方法的通信和同步瓶颈,提出拓扑感知的StreamFusion引擎,通过Torus Attention和单边通信实现平均1.35倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02589 2026-05-26 cs.CL cs.AI

FlowPlan-G2P: A Structured Generation Framework for Transforming Scientific Papers into Patent Descriptions

FlowPlan-G2P:一种将科学论文转化为专利描述的结构化生成框架

Kris W Pan, Yongmin Yoo

机构 * Amazon(亚马逊公司) Macquarie University(麦考瑞大学)

AI总结 提出FlowPlan-G2P图介导生成框架,通过概念图归纳、章节级规划和图条件生成三阶段分解,将科学论文转化为符合专利规范的描述,在领域评估中优于大型专有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏