arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Amazon(亚马逊)

共收录 1075
2608.16697 2026-08-18 cs.AI 新提交

FabriMAE I Trust Myself? Self-Evaluating VLA Action Generation with Markov Attention Entropy

FabriMAE:我相信自己吗?基于马尔可夫注意力熵的视觉-语言-动作模型动作自评估

Aniri, Chen Yilin, Jinhe Bi, Junfei Guo, Donglai Ran, Xu Bian, Zengjie Jin, Yujun Wang, Yijun Tian, Volker Tresp, Fei Shen, Tat-Seng Chua, Yunpu Ma

机构 * National University of Singapore(新加坡国立大学) Ludwig Maximilian University of Munich(慕尼黑大学) Munich Center for Machine Learning(慕尼黑机器学习中心) Amazon(亚马逊) East China University of Science and Technology(华东理工大学) Mese Technology Limited Co., Ltd.(迈泽科技有限公司) FabriX team at Youibot Robotics Co., Ltd.(优必科技有限公司FabriX团队)

AI总结 本研究针对视觉-语言-动作模型的动作自评估难题,提出基于马尔可夫注意力熵(MAE)的自评估框架,构建LIBERO-Reflect基准,实验显示MAE性能优于现有方法,还提升了PI系列动作选择的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15662 2026-08-18 cs.LG 新提交

Sequential Multimodal Evidence Optimization for Product Media Ranking in E-Commerce

电商中产品媒体排序的序列多模态证据优化

Prasenjit Dey, Frank McIntyre, Arnab Sinha

机构 * Amazon.com Inc.(亚马逊公司)

AI总结 针对电商产品媒体排序问题,本文提出SMEO框架,通过轨迹效用模型和生存加权自回归策略优化,提升转化率并减少消费者划动次数。

Comments Proceedings of the 35th ACM International Conference on Information and Knowledge Management (CIKM 2026), Rome, Italy

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15594 2026-08-18 cs.AI 新提交

TRACE: Trajectory Aware Reasoning for Multi-Turn Adversarial Conversation Evaluation

TRACE:面向多轮对抗对话评估的轨迹感知推理

Md Messal Monem Miah, Adrita Anika, Zhiyuan Yu, Ruihong Huang

机构 * Texas A&M University(德克萨斯农工大学) Amazon(亚马逊公司)

AI总结 针对LLM多轮越狱攻击,提出具备轨迹感知推理的Trace防御方法,训练Llama-3.1-8B-Instruct实现安全与实用平衡,在多轮攻击基准中显著降低攻击成功率并提升合规率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15472 2026-08-18 cs.LG cs.AI stat.ML 新提交

Optimal Lower Bounds for Networked Information Aggregation

网络化信息聚合的最优下界

Ambar Pal

机构 * Amazon(亚马逊) Amazon Responsible AI(亚马逊负责任人工智能部门)

AI总结 针对Kearns等人2026年提出的网络化信息聚合问题中MSE上下界存在的研究空白,该研究利用预测器结构不变性,将下界结论推广至满足正则条件的凸损失函数,成功闭合了相关研究的误差界差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15440 2026-08-18 cs.RO 新提交

Accelerating Mixed Discrete-Continuous Motion Planning via Neural Graphs of Convex Sets

通过凸集神经图加速混合离散-连续运动规划

Ananya Trivedi, Sarvesh Prajapati, Mohamed Khalid M Jaffar, Zhexin Xu, David Rosen, Taskin Padir

机构 * Northeastern University(东北大学) University of Maryland(马里兰大学) Amazon(亚马逊公司)

AI总结 本研究针对混合离散-连续运动规划的计算瓶颈,提出基于图注意力网络的凸集神经图策略,实现最高两个数量级加速且保持100%成功率,适用于多种机器人任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14929 2026-08-18 cs.CL cs.LG 新提交

Training Leaves Traces: Centered Residual Signatures for Language Model Lineage Verification

训练留下痕迹:用于语言模型谱系验证的中心化残差特征

Aman Singh Thakur, Rayan Khoury

机构 * Amazon(亚马逊) Massachusetts Institute of Technology(麻省理工学院)

AI总结 本研究提出中心化残差特征方法,通过移除残差训练产生的共享身份对齐组件,对比残差块特有结构得到谱系分数,可高效准确验证开源权重语言模型检查点的谱系

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10706 2026-08-18 cs.CV cs.MM 版本更新

MMArt: A Multi-Perspective Multimodal Dataset for Visual Art Understanding

MMArt:用于视觉艺术理解的多视角多模态数据集

Shuai Wang, Wangyuan Ding, Yixian Shen, Jia-Hong Huang, Stevan Rudinac, Monika Kackovic, Nachoem Wijnberg, Marcel Worring

机构 * University of Amsterdam(阿姆斯特丹大学) Amazon AGI(亚马逊AGI) College of Business and Economics, University of Johannesburg(约翰内斯堡大学经济与商学院)

AI总结 针对现有艺术数据集单视角局限,推出含74234幅WikiArt画作的多视角多模态数据集MMArt,通过分析各视角特性证实多视角设计的必要性,为视觉艺术理解提供支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07370 2026-08-18 cs.CL 版本更新

LitTraceQA: A Benchmark for Multi-Stage Grounding and Verification in Scientific Question Answering

LitTraceQA:面向科学问答的多阶段溯源与验证基准

Xuye Liu, Yimu Wang, Peng Shi, Bo Xue, Xiangrui Ke, Songcheng Cai, Kath Choi, Di Wu, Freda Shi, Krzysztof Czarnecki

机构 * University of Waterloo(滑铁卢大学) Amazon(亚马逊公司) City University of Hong Kong(香港城市大学) University of Amsterdam(阿姆斯特丹大学)

AI总结 该研究提出LitTraceQA基准,用于科学问答的多阶段溯源与验证,提供含多类型证据的问答数据,可评估系统的论文检索、证据溯源及答案准确性,助力生成可验证的科学问答结果。

Comments Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13163 2026-08-18 cs.CR cs.CV cs.LG

LoREnc: Low-Rank Encryption for Securing Foundation Models and LoRA Adapters

LoREnc:低秩加密用于保护基础模型和LoRA适配器

Beomjin Ahn, Jungmin Kwon, Chanyong Jung, Jaewook Chung

机构 * Samsung Research(三星研究院) Samsung Electronics(三星电子) Amazon Web Services(亚马逊网络服务) University of Michigan(密歇根大学)

AI总结 LoREnc通过谱截断和补偿技术,在不重新训练的情况下保护基础模型和LoRA适配器,防止模型恢复攻击和知识产权泄露,实验表明其在1%计算开销下有效。

Comments Accepted to ICIP 2026

Journal ref 2026 IEEE International Conference on Image Processing (ICIP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05635 2026-08-18 cs.LG 版本更新

From Uniform to Learned Knots: A Study of Spline-Based Numerical Encodings for Tabular Deep Learning

从均匀到学习的结:对基于样条的数值编码在表格深度学习中的研究

Manish Kumar, Anton Frederik Thielmann, Christoph Weisser, Benjamin Säfken

机构 * BASF(巴斯夫) Clausthal University of Technology(克劳斯塔尔工业大学) Amazon Music(亚马逊音乐) Bielefeld School of Business, Hochschule Bielefeld (HSBI)(比勒费尔德商学院,比勒费尔德应用科学大学)

AI总结 本文研究了基于样条的数值编码在表格深度学习中的应用,探讨了不同样条家族在不同编码策略下的表现,发现编码效果依赖于任务、输出大小和模型结构,学习结变体在稳定性上表现良好但训练成本较高。

Comments 20, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14349 2026-08-17 cs.LG 新提交

Non-Parametric Spatiotemporal Trajectory Prediction via State-Conditioned Transition Sampling

基于状态条件转移采样的非参数时空轨迹预测

Michael Fore, Akshay Jain, Justin Downes, Rohan Pradhan, Duncan Botti

机构 * Amazon Web Services(亚马逊网络服务)

AI总结 该研究提出一种无训练的非参数时空轨迹预测方法,无需GPU和学习参数,在数据充足时精度与57M参数Transformer相当,数据稀缺时性能显著更优,可从少量历史数据部署到新区域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02345 2026-08-17 cs.CL cs.AI stat.AP 版本更新

Can AI Agents Simulate A/B Test Outcomes? A Validation Framework for Agentic Experimentation

AI智能体能模拟A/B测试结果吗?智能体实验的验证框架

Stefan Hut, Lorenzo Masoero

机构 * Amazon(亚马逊公司)

AI总结 该研究提出智能体实验的验证框架S-RCT,用AI智能体模拟A/B测试结果,经67个营销A/B测试验证,校准后可降低预测误差,为实验者提供智能体信号支持。

Comments Accepted as a workshop paper at https://www.aiagentbehavior.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13522 2026-08-14 cs.LG cs.AI cs.LO cs.PL cs.SE 新提交

Vero: Can AI Agents Build Formally Verified Software Repositories?

Vero:AI智能体能否构建形式化验证的软件仓库?

Zhe Ye, Hantao Lou, Yuechun Sun, Peiyang Song, Zhengxu Yan, Timothe Kasriel, Qingyang Zhang, Kaiyu Yang, Soonho Kong, Jingxuan He, Dawn Song

机构 * University of Chicago(芝加哥大学) California Institute of Technology(加州理工学院) Stanford University(斯坦福大学) UC Berkeley(加州大学伯克利分校) Amazon Web Services(亚马逊云计算服务) Apodex

AI总结 研究推出首个仓库级验证软件综合基准Vero,含43个多模块实例,评估发现前沿智能体仅解决27个实例,为相关研究提供测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12585 2026-08-14 cs.AI 新提交

Reasoning Jury: Multi-Model Consensus for Evaluating Reasoning Traces

推理评审团:用于评估推理轨迹的多模型共识机制

Congchao Wang, Diwakar Singh, Qiaozi Gao, Spyros Matsoukas, Yang Liu, Mahdi Namazifar

机构 * Amazon AGI(亚马逊AGI)

AI总结 本研究提出Reasoning Jury系统,以多LLM评审团及调控共识机制替代单模型评审员,其识别推理缺陷的准确率显著优于前沿模型,且开销仅为后者的8%-15%,还可用于理解推理LLM的失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12574 2026-08-14 cs.AI cs.FL 新提交

Trie Automata for Constrained Decoding over Large Finite Sets

用于大有限集上约束解码的Trie自动机

Xingzi Xu, Karim Bouyarmane

机构 * Amazon(亚马逊公司)

AI总结 针对大型语言模型有限集约束解码的速度瓶颈,提出Trie自动机机制,通过预计算token掩码实现高效解码,在批量服务中吞吐量较XGrammar提升29倍,且编译与计算效率显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12564 2026-08-14 cs.LG 新提交

Scaling Automatic Research Agents via World Models

通过世界模型扩展自动研究智能体

Xiyuan Yang, Sheikh Sarwar, Jingru Cheng, Zhan Shi, Duanshun Li, Huiyuan Chen, Haiyang Zhang, Chenlei Guo, Jingrui He, Zhenyu Liao

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon(亚马逊公司)

AI总结 针对自动研究智能体扩展时的训练瓶颈,提出WMRL方法,结合两种缓解措施提升收敛性,训练加速3-4倍且性能优于更大规模智能体,还可迁移至多类任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11977 2026-08-13 cs.AI 新提交

Retry, Switch, or Abstain? Learning Strategy-Aware Tool-Use Policies via Controlled Error Injection

重试、切换还是弃权?通过受控错误注入学习策略感知的工具使用策略

Chaoran Chen, Vy Nguyen, Ziji Zhang, Abhinav Gullapalli, Ziyi Wang, Yuxuan Lu, Dakuo Wang, Jing Huang, Zhou Yu, Jin Lai

机构 * Amazon(亚马逊)

AI总结 该研究提出BENCH2ROBUST框架,结合BTM与课程强化学习,提升LLM智能体在工具故障下的稳健性,在零售任务中BTM可提稳健性16.8个百分点,二者结合达40.8-45.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11715 2026-08-13 cs.CL cs.AI 新提交

When the API Speaks the Wrong Language: Revisiting Post-Training for Multilingual Tool Use

当API“说错”语言:重新审视多语言工具使用的后训练

Siddharth Chauhan, Thomas Butler, Abhishek Singhania, Pankaj Porwal, Honey Gupta

机构 * Amazon(亚马逊)

AI总结 针对多语言API调用中存在的参数语言不匹配问题,研究发现监督微调可实现接近或优于复杂强化学习方法的性能,强化学习仅能提供渐进式改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12236 2026-08-13 cs.RO cs.AI cs.LG 版本更新

TMRL: Diffusion Timestep-Modulated Pretraining Enables Exploration for Efficient Policy Finetuning

TMRL: 差分时间步调节预训练实现高效策略微调的探索

Matthew M. Hong, Jesse Zhang, Anusha Nagabandi, Abhishek Gupta

机构 * University of Washington(华盛顿大学) Amazon FAR(亚马逊FAR)

AI总结 本文提出TMRL框架,通过结合行为克隆预训练与强化学习微调,解决预训练中动作分布狭窄的问题,提升机器人策略微调的样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07341 2026-08-13 cs.SE cs.LG 版本更新

ReCodeAgent: A Multi-agent Workflow for Language-Agnostic Translation and Validation of Large-Scale Repositories

ReCodeAgent:一种多智能体工作流用于语言无关的大规模仓库翻译与验证

Ali Reza Ibrahimzada, Brandon Paulsen, Daniel Kroening, Reyhaneh Jabbarvand

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon(亚马逊)

AI总结 ReCodeAgent通过多智能体方法实现大规模仓库代码翻译与验证的语言无关性,提升翻译正确率并降低成本,验证其效率和设计影响。

Comments Published in ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11171 2026-08-12 cs.CL cs.AI cs.CY 新提交

From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop

从可解释性到控制:TrustNLP研讨会六年的启示

Rahul Gupta, Abhinav Mohanty, Anaelia Ovalle, Anil Ramakrishna, Anubrata Das, Apurv Verma, Jwala Dhamala, Ninareh Mehrabi, Tharindu Kumarage, Yada Pruksachatkun, Yang Trista Cao, Kai-Wei Chang, Aram Galstyan

机构 * Meta Autodesk(欧特克公司) New Jersey Institute of Technology(新泽西理工学院) Salesforce(salesforce公司) University of California, Los Angeles(加州大学洛杉矶分校) Amazon AGI(亚马逊AGI)

AI总结 该研究基于TrustNLP研讨会六年论文,分析NLP可信领域从可解释性到生成式系统控制的转变,明确各信任维度的发展趋势及与领域整体的关联性,提出结构性见解与研究方向。

Comments 17 pages, 2 figures, 3 tables. Submitted to ACL ARR August 2026 cycle (EACL 2027)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10605 2026-08-12 cs.LG cs.AI 新提交

Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts

计算最优并非集群最优:面向稀疏混合专家模型的系统感知缩放

Soumajyoti Sarkar, Yuxin Tang, Sheng Zha

机构 * Amazon AGI Foundations(亚马逊AGI基础研究部门)

AI总结 本研究开发MOSAIC框架,将稀疏MoE模型的架构与系统协同设计建模为优化问题,发现计算最优与集群最优稀疏性存在差异,主张统一架构与系统协同设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22012 2026-08-12 cs.LG 版本更新

Putting a Face to Forgetting: Continual Learning meets Mechanistic Interpretability

为遗忘赋予面孔:持续学习与机制可解释性相遇

Sergi Masip, Gido M. van de Ven, Javier Ferrando, Tinne Tuytelaars

机构 * KU Leuven(根特大学) University of Groningen(Groningen大学) Amazon(亚马逊)

AI总结 本文提出一个机制框架,从几何角度解释持续学习中的灾难性遗忘,通过玩具模型分析并验证了深度对遗忘的影响,展示了如何利用Crosscoders分析实际模型。

Comments To appear in the Proceedings of the Fifth Conference on Lifelong Learning Agents (CoLLAs), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09351 2026-08-11 cs.LG cs.AI stat.ML 新提交

Test-Time Augmentation for LLMs: When Input Diversity Beats Output Diversity at Matched Compute

大语言模型的测试时增强:在计算资源匹配时输入多样性优于输出多样性

Nikita Kozodoi, Zainab Afolabi, Jack Butler

机构 * Amazon Web Services(亚马逊网络服务)

AI总结 本研究提出测试时增强(TTA),经匹配计算对比发现,中端大语言模型采用语义复述的TTA策略,比自洽性更高效地将计算转化为准确率,每美元准确率约为自洽性的1.8倍。

Comments Published at the COLM 2026 Workshop on Efficient Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09153 2026-08-11 cs.AI cs.LG 新提交

TRACE: TRajectory Attribution for Automated Context Engineering

TRACE:用于自动化上下文工程的轨迹归因

Yikai Zhao, Pradeep Kumar Misra, Saurabh Pandey

机构 * Amazon(亚马逊公司)

AI总结 TRACE是利用历史智能体轨迹挖掘上下文故障的自动化反馈循环,可在上下文层诊断修复超80%的生产AI智能体故障,归因率72.7%、修复有效性82%。

Comments 21 pages, 5 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07965 2026-08-11 cs.AI 新提交

CyberAGENTS: Structured Autonomy for Agentic Gamified Learning in Cybersecurity

CyberAGENTS:面向网络安全领域智能体游戏化学习的结构化自主机制

Ivan Hornung, Deepthi Marasinghe Arachchige, Tharindu Kumarage, Garima Agrawal, Yuli Deng, Ying-Chih Chen, Huan Liu

机构 * Arizona State University(亚利桑那州立大学) Amazon AGI(亚马逊AGI)

AI总结 本研究提出CyberAGENTS框架,通过结构化自主机制实现游戏化网络安全学习,经课堂评估验证其可提升学习者参与度与对AI响应的信任度,为相关系统设计提供蓝图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20497 2026-08-11 cs.AI 版本更新

From Errors to Rules: Iterative Prompt Optimization for Text Classification

从错误到规则:文本分类的迭代提示优化

Yueying Cui, Renhao Xue, Yi Zhang, Mukul Prasad

机构 * Amazon Web Services(亚马逊网络服务公司)

AI总结 研究文本分类的提示优化方法,提出错误引导优化(ERGO)方法,通过诊断-规定-重写反馈循环迭代训练集。该方法在特定任务上准确率最高,能生成可解释规则,还提供了任务特征与最优范式选择的互补框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26453 2026-08-11 cs.LG 版本更新

Optimizing CUDA like a Human: Micro-Profiling Tools as Expert Surrogates for LLM-Based GPU Kernel Optimization

像人类一样优化CUDA:微剖析工具作为基于LLM的GPU内核优化的专家替代品

Jiading Gai, Shuai Zhang, Kaj Bostrom, Jin Huang, Vihang Patil, Haoyang Fang, Bernie Wang, Huzefa Rangwala, George Karypis

机构 * Amazon(亚马逊) Siemens(西门子) University of Minnesota(明尼苏达大学)

AI总结 提出KernelPro闭环多智能体系统,通过LLM代码生成与硬件剖析反馈及可插拔瓶颈检测工具迭代优化GPU内核,在KernelBench上实现2.42x/4.69x/5.30x加速比,并首次兼顾能效优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12691 2026-08-11 cs.LG cs.AI cs.SY eess.SY math.OC stat.ML 版本更新

Two-Layer Linear Auto-Regressive Models Estimate Latent States

两层线性自回归模型估计潜在状态

Yahya Sattar, Sunmook Choi, Leo Maynard-Zhang, Yassir Jedra, Maryam Fazel, Sarah Dean

机构 * Cornell(康奈尔大学) Washington(华盛顿大学) Imperial College London(伦敦帝国理工学院) Amazon(亚马逊)

AI总结 本文证明两层线性自回归模型通过经验风险最小化训练时,能近似卡尔曼滤波,恢复潜在状态估计,并提供有限样本保证。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20739 2026-08-11 cs.CR cs.LG cs.SE 版本更新

Learning to Triage Vulnerability Reports from Program Analysis: An Empirical Study in Node.js

学习对程序分析生成的漏洞报告进行分类:针对Node.js的实证研究

Ronghao Ni, Aidan Z. H. Yang, Min-Chien Hsu, Nuno Sabino, Limin Jia, Ruben Martins, Darion Cassel, Kevin Cheang

机构 * Carnegie Mellon University(卡内基梅隆大学) Amazon Web Services(亚马逊网络服务)

AI总结 本文针对Node.js,基于程序分析工具数据训练机器学习模型,实现漏洞报告优先级排序,最优模型在召回90%可利用报告时可排除75%良性报告,具备实用潜力。

Comments Accepted at the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026). The version of record is available at https://doi.org/10.1145/3832783.3837503

详情

展开后加载摘要…

URL PDF HTML 收藏