arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Amazon(亚马逊)

共收录 1846
2609.03874 2026-09-04 cs.AI 新提交

STAIR (STructure Aware Information Retriever): A novel dataset and LLM based retriever for document structure augmentation

STAIR(结构感知信息检索器):用于文档结构增强的新型数据集与基于大语言模型的检索器

Vineet Kumar, Meghanadh Pulivarthi, vishwajeet kumar, Jaydeep Sen, Riyaz Ahmad Bhat, Sachindra Joshi

机构 * IBM(国际商业机器公司) Amazon Books Science(亚马逊图书科学部门)

AI总结 本研究提出新型检索系统STA IR及基准SearchTome,利用语料库目录增强检索,在SearchTome上的Recall@1达82.6%,显著优于DSI、BM25等基线,可构建低幻觉IR系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.03239 2026-09-04 cs.LG 新提交

B2B Customer Conversion Prediction: A Document Representation, Graph Theory, and CatBoost Driven Methodology

B2B客户转化预测:一种基于文档表示、图论与CatBoost的方法

Tianqi Wang, Sheikh Shams Azam, Wan Eih Huang, Anton Wiranata, Christopher G. Brinton, Jan P. Allebach

机构 * Purdue University(普渡大学) Apple(苹果公司) Amazon(亚马逊公司) HP Inc.(惠普公司)

AI总结 针对B2B客户转化预测问题,该研究提出结合文档表示、图论与CatBoost的方法,实现91%的预测准确率,并探讨了个性化营销活动推荐方案。

Comments 10 pages, 6 figures. Presented at the 2nd Workshop on End-End Customer Journey Optimization at KDD 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.03235 2026-09-04 cs.CL 新提交

SGD-KV: Summarization Guided KV Cache Compression

SGD-KV:基于摘要引导的键值缓存压缩

Zeyu Liu, Woomin Song, Xuandi Fu, Sai Muralidhar Jayanthi, Vivek Govindan, Aram Galstyan, Sravan Babu Bodapati, Srikanth Ronanki

机构 * USC(南加州大学) KAIST(韩国科学技术院) Amazon AGI(亚马逊AGI)

AI总结 针对LLMs长上下文推理的KV缓存内存瓶颈,提出SGD-KV框架,通过分块摘要诊断任务识别分层信息聚合的注意力头,在Qwen2.5模型上实现1M token上下文的SOTA性能,同时降低75%内存使用,达成更优效率-精度权衡。

Comments Accepted in NeurIPS2026 Efficient Reasoning Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00382 2026-09-04 cs.CV 版本更新

Vitality-Aware Compression for Efficient Image-to-Shape Diffusion Transformers

活力感知压缩:面向高效图像到形状扩散Transformer

Jaeah Lee, Hyunjin Kim, Jaewoong Cho, Gihyun Kwon

机构 * KRAFTON AI, Republic of Korea(KRAFTON AI, 韩国) Amazon, Australia(亚马逊, 澳大利亚)

AI总结 提出首个针对图像到形状扩散Transformer的压缩方法,通过活力引导的结构化剪枝、自适应量化和微调,在保持几何保真度下实现高达66%的模型尺寸缩减。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18388 2026-09-04 cs.LG cs.AI cs.CL cs.MA 版本更新

LLMZero: Discovering Adaptive Training Strategies for RL Post-Training via LLM Agents

LLMZero: 通过LLM智能体发现RL后训练的自适应训练策略

Haoyang Fang, Wei Zhu, Boran Han, Alex Zhang, Zhenyu Pan, Shuo Yang, Shuai Zhang, Jiading Gai, Peng Tang, Cuixiong Hu, Xuan Zhu, Huzefa Rangwala, George Karypis, Bernie Wang

机构 * Amazon(亚马逊)

AI总结 提出LLMZero系统,利用LLM智能体通过树搜索发现多阶段RL后训练的自适应策略,揭示容量参数单调累积、正则化参数振荡的规律,在4个GRPO任务上相对基线提升9%-140%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01658 2026-09-04 cs.AI 版本更新

CORAL: Towards Autonomous Multi-Agent Evolution for Open-Ended Discovery

CORAL:迈向自主多智能体进化以实现开放性发现

Ao Qu, Han Zheng, Zijian Zhou, Yihao Yan, Yihong Tang, Shao Yong Ong, Fenglu Hong, Kaichen Zhou, Chonghe Jiang, Minwei Kong, Jiacheng Zhu, Xuan Jiang, Sirui Li, Cathy Wu, Bryan Kian Hsiang Low, Jinhua Zhao, Paul Pu Liang

机构 * MIT(麻省理工学院) NUS(新加坡国立大学) MiniMax McGill(麦吉尔大学) Stanford(斯坦福大学) SambaNova Meta Singapore-MIT Alliance for Research and Technology(新加坡-麻省理工联合研究技术联盟) Amazon(亚马逊) Microsoft(微软)

AI总结 本文提出CORAL框架,通过自主多智能体进化方法,实现了在开放性问题上的发现,展示了智能体自主性和多智能体进化对提升开放性发现的显著效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.02817 2026-09-03 cs.LG 新提交

Cliff: Learning Process Rewards from the First Mistake

Cliff:从首次错误中学习过程奖励

Peixuan Han, Runhui Wang, Ketan Ramaneti, Jie Hao, Gerald Friedland, Chris Kong

机构 * Amazon Web Services(亚马逊网络服务) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 Cliff是一种利用现成LLM识别推理轨迹首次错误的奖励塑形策略,在12种场景下可提升推理性能,比策略蒸馏高15%、比标准GRPO高7%,为RLVR提供细粒度监督。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.02776 2026-09-03 cs.CV 新提交

Video-Based Palm-Vein Authentication under Challenging Conditions

挑战性条件下基于视频的掌纹认证

Xiaofeng Yan, Kechen Liu, Abhilash Venkatesh, Cathy Zhang, Xia Zhou, Salvatore Stolfo

机构 * Columbia University(哥伦比亚大学) Princeton University(普林斯顿大学) Stanford University(斯坦福大学) Amazon.com Services LLC(亚马逊服务有限责任公司)

AI总结 该研究推出首个公开视频掌纹数据集CUP,提出融合时间共识与空间区域匹配的鲁棒认证方法,在脏污等挑战性条件下大幅降低EER,还发现温暖条件下与身体水分、性别相关的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.02054 2026-09-03 cs.CL 新提交

A Tri-Agent Framework for Evaluating and Aligning Question Clarification Capabilities of Large Language Models

用于评估和对齐大语言模型问题澄清能力的三智能体框架

Yikai Zhao, Saurabh Pandey, Pradeep Kumar Misra

机构 * Amazon(亚马逊公司)

AI总结 本文提出三智能体框架,用于评估大语言模型的问题澄清能力,通过三个不同LLM智能体及多维度指标开展评估,为提升对话式LLM应用的澄清能力提供了结构化方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.02042 2026-09-03 cs.LG 新提交

Act More, Decide Less: Skill-Guided Adaptive Action Chunking for Long-Horizon LLM Agents

多行动,少决策:面向长 horizon 大语言模型智能体的技能引导自适应动作分块

Yanting Yang, Can Jin, Jinman Zhao, Jiahao Wu, Yang Zhou, Zhepeng Wang, Zhendong Wang, Mu Zhou, Dimitris N. Metaxas

机构 * Rutgers University(罗格斯大学) University of Toronto(多伦多大学) The Hong Kong Polytechnic University(香港理工大学) Amazon(亚马逊公司) Microsoft(微软公司)

AI总结 本文提出 SPACE 方法,通过从成功轨迹的编程技能中提炼分块边界监督,优化 LLM 智能体的动作分块策略,在 ALFWorld 和 ScienceWorld 上提升了长 horizon 任务的成功率并减少了决策轮次。

Comments EMNLP 2026 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01861 2026-09-03 cs.AI 新提交

Belief-Calibrated Optimization: An Explicit World Model for Agentic Optimization

信念校准优化:智能体优化的显式世界模型

Yuhan Chen, Zhihua Tian, Mahavir Dabas, Charith Peris, Rahul Gupta, Ming Jin, Feiyang Kang, Siyuan Zhang, Nan Wang, Ruoxi Jia

机构 * Virginia Tech(弗吉尼亚理工大学) Amazon(亚马逊公司)

AI总结 本文提出信念校准优化(BCO)方法,将智能体的隐式信念转化为显式持久上下文文档作为世界模型,在5类基准测试中提升了LLM智能体的训练通过率,且其内容具备可复用价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29270 2026-09-03 cs.CL cs.AI 版本更新

SHADOWBENCH: Toward Reliable Automatic Evaluation of Semantic Alignment in Autoformalization

SHADOWBENCH:迈向自动形式化中语义对齐的可靠自动评估

Hojae Han, Jongyoon Kim, Sanghyeok Park, Dongwook Cheon, Yeachan Park, Myung Jae Jeon, Sunjong Choe, Soonho Kong, Wonseok Hur, Seung-won Hwang, Donghoon Hyeon

机构 * Electronics and Telecommunications Research Institute(电子通信研究院) Seoul National University(首尔大学) University of Maryland, College Park(马里兰大学帕克分校) Amazon Web Services(亚马逊网络服务)

AI总结 针对自动形式化评估的缺陷,该研究提出SA-Pass方法并构建ShadowBench基准,实验显示其与专家判断一致性达98.8%,且被用作ICML 2026 AI4Math挑战赛第4赛道基准。

Comments EMNLP 2026

Journal ref The 2026 Conference on Empirical Methods in Natural Language Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02028 2026-09-03 cs.AI 版本更新

Edit Knowledge, Not Just Facts via Multi-Step Reasoning over Background Stories

编辑知识,而不仅仅是事实:基于背景故事的多步推理

Ya Gao, Kalle Kujanpää, Pekka Marttinen, Harri Valpola, Alexander Ilin

机构 * Aalto University(阿莱大学) Amazon.com(亚马逊公司) System 2 AI(系统2人工智能)

AI总结 提出将知识更新视为推理问题,通过背景故事引入新知识、自生成多跳问题训练和知识蒸馏,使模型在多步推理中灵活运用新信息。

Comments Accepted by EMNLP 2026; Code available at: https://github.com/yagao403/KnowledgeEdit-EMNLP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01564 2026-09-02 cs.CL cs.AI 新提交

From Confusion to Clarity: Confusion-Aware Retrieval and Knowledge Injection for Text Classification

从混淆到清晰:面向文本分类的混淆感知检索与知识注入

Manish Gupta, Chaitanya Giri, Jayasimha Talur

机构 * Amazon(亚马逊)

AI总结 针对LLM在文本分类中区分相似标签的难题,提出混淆感知检索与知识注入框架,无需微调即可生成可迁移规则,在多个基准上显著提升Macro F1。

Comments EMNLP 2026 (Industry Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01139 2026-09-02 cs.CL 新提交

Does task decomposition improve automatic NLG evaluation?

任务分解是否能改进自动自然语言生成(NLG)评估?

Sebastian Steindl, Nikos Voskarides, Alberto Gasparin, Diego Marcheggiani

机构 * Amazon(亚马逊)

AI总结 该研究在多个NLG数据集上对比了有无任务分解的LLMaJ方法,发现任务分解本身不会提升LLMaJ性能,其此前的性能提升源于人工标签训练,无分解的LLMaJ在有人工标签时可与人类标注者表现相当。

Comments Accepted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01073 2026-09-02 cs.CL 新提交

Post-hoc Alignment of LLM-judges to Human Judgment Distribution

大语言模型评判器(LLM-judges)与人类判断分布的事后对齐

Sebastian Steindl, Nikos Voskarides, Alberto Gasparin, Diego Marcheggiani

机构 * Amazon(亚马逊公司)

AI总结 该研究针对LLM评判器预测人类判断分布(软标签)性能差的问题,提出NAPHA方法,可提升软标签预测性能,尤其对高熵实例效果显著。

Comments Accepted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01038 2026-09-02 cs.AI 新提交

Data-Driven Persona-Conditioned Agents for A/B Test Simulation

数据驱动的角色条件智能体用于A/B测试模拟

Ziyad Benomar, Weronika Łajewska, Leonardo Perelli, Saab Mansour

机构 * Amazon(亚马逊)

AI总结 该研究提出基于数据驱动角色的LLM智能体模拟A/B测试,通过研究多方面因素,在40项A/B测试基准上达到0.75-0.90方向准确率,为低成本实验预筛选提供可行路径。

Comments Work accepted at EMNLP 2026 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.00961 2026-09-02 cs.AI 新提交

Few-Shot Out of Domain Intent Detection with Covariance Corrected Mahalanobis Distance

基于协方差校正马氏距离的小样本域外意图检测

Jayasimha Talur, Oleg Smirnov, Paul Missault

机构 * Amazon(亚马逊)

AI总结 本文针对现有马氏距离法在小样本域外意图检测中性能不及基线的问题,分析原因并提出协方差校正马氏距离法,以提升小样本场景下的域外意图检测性能。

Comments 1st AAAI Workshop on Uncertainty Reasoning and Quantification in Decision Making

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.00891 2026-09-02 cs.AI 新提交

CacheBridge: Efficient Cross-Model KV Cache Transfer

CacheBridge:高效的跨模型KV缓存迁移

Xingyu Qu, Siyuan Lu, Zhiyu Chen, Sheng Wang, Tao Lin

机构 * Westlake University(西湖大学) Wuhan University(武汉大学) Amazon(亚马逊公司)

AI总结 CacheBridge是一种高效的跨模型KV缓存迁移方法,通过架构索引映射器等设计,在Qwen3等模型上实现了存储、速度与精度的优化,解决了全头映射的缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.00494 2026-09-02 cs.CL 新提交

Human-Anchored Factuality Evaluation with Strategic Annotation

基于人类锚定的事实性评估与策略性标注

Yu Wang, Craig Erickson, Kevin Small

机构 * Amazon AGI(亚马逊AGI)

AI总结 本文针对LLM事实性评估的系统性偏差问题,提出基于失败空间分析(FSA)的标注策略,在AutoFA和RAGTruth数据集上分别实现40.3%、27.1%的有效样本量提升,提升了有限预算下的人类锚定事实性评估效率。

Comments Accepted as a conference paper for Industrial Track of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.00444 2026-09-02 cs.LG cs.CL 新提交

Group Adaptive Clipping Policy Optimization

分组自适应裁剪策略优化

Sheng Jia, Xiao Wang, Shiva Prasad Kasiviswanathan, Rein Houthooft

机构 * University of Toronto(多伦多大学) Amazon(亚马逊公司)

AI总结 该研究针对GRPO的固定裁剪局限,提出GAPO方法,通过自适应调整裁剪边界提升了Qwen、Llama模型在低通过率数学推理与编码任务上的Pass@1和Pass@k指标。

Comments Accepted at EMNLP 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.00441 2026-09-02 cs.AI 新提交

Conversation Coach: A Voice-enabled AI System that Helps Practice Difficult Workplace Conversations

对话教练:一种支持语音功能的AI系统,助力练习高难度职场对话

Fanyou Wu, Suraj Maharjan, Ainur Yessenalina, Dennis Xu Chen, Rahul Srivastava, Srinivasan H. Sengamedu

机构 * Amazon(亚马逊)

AI总结 本研究提出以语音优先的AI系统Conversation Coach,解决管理者职场对话练习的成本问题,对比端到端与级联语音模型并部署落地,获4万余名管理者使用。

Journal ref EMNLP 2026 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.00082 2026-09-02 cs.CL cs.AI 新提交

KItCAT: Knowledge Injection via Input Corruption for Auto-regressive Training

KItCAT:通过输入损坏进行知识注入的自回归训练

Meghanadh Pulivarthi, Kushagra Bhushan, Vineet Kumar, Gaurav Pandey, Jaydeep Sen, Dinesh Raghu, Sachindra Joshi, Yatin Nandwani

机构 * IBM(国际商业机器公司) Amazon Books Science(亚马逊图书科学部门)

AI总结 本研究提出轻量级知识注入策略KItCAT,通过随机损坏输入序列实现低成本数据增强,在多个数据集和模型系列上的表现优于持续预训练。

Comments 18 pages. Accepted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14349 2026-09-02 cs.LG 版本更新

Non-Parametric Spatiotemporal Trajectory Prediction via State-Conditioned Transition Sampling

基于状态条件转移采样的非参数时空轨迹预测

Michael Fore, Akshay Jain, Justin Downes, Rohan Pradhan, Duncan Botti

机构 * Amazon Web Services(亚马逊网络服务)

AI总结 该研究提出一种无训练的非参数时空轨迹预测方法,无需GPU和学习参数,在数据充足时精度与57M参数Transformer相当,数据稀缺时性能显著更优,可从少量历史数据部署到新区域。

Comments Accepted at the 34th ACM SIGSPATIAL International Conference on Advances in Geographic Information Systems (SIGSPATIAL '26), Riverside, CA, USA, November 3-6, 2026. 4 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29093 2026-09-02 cs.CL cs.AI cs.IR 版本更新

APEX-EM: Non-Parametric Online Learning for Autonomous Agents via Structured Procedural-Episodic Experience Replay

APEX-EM:通过结构化程序-经验经验回放实现自主代理的非参数在线学习

Pratyay Banerjee, Masud Moshtaghi, Ankit Chadha

机构 * Amazon, AGI / Sunnyvale, USA(亚马逊 AGI / 美国森尼韦尔)

AI总结 本文提出APEX-EM框架,通过结构化经验表示和PRGII工作流,实现自主代理的非参数在线学习,提升跨领域任务的性能。

Comments 22 pages, 6 figures, Accepted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.31167 2026-09-01 cs.RO cs.AI 新提交

SUN: Persistent Programs For Language-Grounded Control-to-Learning-to-Real Policies

SUN:用于语言接地控制学习到真实策略的持久程序

Weiqi Wang, Zhi Li, Yudong Lei, David Martinez, Xiaofeng Gao, Yuxin Jiang, Chenfanfu Jiang, Yingnian Wu, Demetri Terzopoulos, Ran Gong

机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校) University of California, Santa Barbara(加利福尼亚大学圣巴巴拉分校) Amazon(亚马逊公司) Robotics and AI Institute(机器人与人工智能研究院)

AI总结 本文提出语义统一(SUN)程序及系统Kuafu,由大型视觉语言系统自动合成,在9项任务中实现82.03%宏观成功率,优于相关基准,可将控制摊销为鲁棒策略,实现符号规划与数据驱动执行的统一。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30614 2026-09-01 cs.CL 新提交

TaxCE : A Framework for Automated Taxonomy Construction and Evaluation at Scale

TaxCE:大规模自动分类法构建与评估框架

Sandeep Sricharan Mukku, Albert Aristotle Nanda, Rohit Pyati

机构 * Amazon(亚马逊)

AI总结 针对大规模非结构化反馈文本分类法构建的挑战,本文提出TaxCE框架,结合EEG指标的闭环迭代优化机制,在分类法质量上优于现有基线方法。

Comments EMNLP 2026 - Industry

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30258 2026-09-01 cs.CL cs.AI 新提交

Stratified Consistency Distillation for Natural Language Formalization

面向自然语言形式化的分层一致性蒸馏

Zhichao Hou, Ferhat Erata, Joe Lilien, MohamadAli Torkamani

机构 * North Carolina State University(北卡罗来纳州立大学) Amazon Web Services(亚马逊网络服务)

AI总结 该研究针对自然语言到逻辑公式翻译准确率提升难题,提出分层一致性蒸馏方法,经实验在Pass@K与等价逻辑相似度指标上获显著稳定提升,推进了逻辑翻译技术发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29513 2026-09-01 cs.LG cs.AI 新提交

On the Plasticity Collapse in Continual Machine Unlearning

持续机器遗忘中的可塑性崩溃

Yingdan Shi, Xiang Xu, Kaize Ding, Alfred O. Hero, Ren Wang

机构 * Illinois Institute of Technology(伊利诺伊理工学院) Amazon(亚马逊公司) Northwestern University(西北大学) University of Michigan(密歇根大学)

AI总结 本研究发现持续机器遗忘场景存在可塑性崩溃的固有问题,通过理论分析和多组实验证实其普遍性,为开发保可塑性遗忘算法提供了依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28931 2026-09-01 cs.IR cs.LG 新提交

MERIT: Mitigating Exposure Bias in Generative XMC for User-Interest Propensity Modeling

MERIT:缓解生成式极端多标签分类(XMC)中用户兴趣倾向建模的曝光偏差

Abhinav Mahajan, Arindam Sarkar, Prakash Mandayam Comar

机构 * Carnegie Mellon University(卡内基梅隆大学) Amazon(亚马逊公司)

AI总结 针对电商用户兴趣匹配的曝光偏差问题,提出MERIT框架,通过自校正目标缓解偏差,在25万+兴趣类数据集上提升召回率等指标,生产中用户转化率提升0.26%。

Comments Accepted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏