arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Amazon(亚马逊)

2026-04-06 至 2026-04-06 共收录 8
2604.03157 2026-04-06 cs.AI

Chart-RL: Policy Optimization Reinforcement Learning for Enhanced Visual Reasoning in Chart Question Answering with Vision Language Models

Chart-RL: 通过强化学习优化策略以提升基于视觉语言模型的图表问答中的视觉推理

Yunfei Bai, Amit Dhanda, Shekhar Jain

机构 * Amazon(亚马逊)

AI总结 本文提出Chart-RL框架,通过反馈驱动的策略优化提升视觉语言模型在复杂数据可视化中的推理能力,实现更高的准确率和更高效的推理速度。

Comments In Proceedings of the 32nd ACM-SIGKDD Conference on Knowledge Discovery and Data Mining (KDD 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02733 2026-04-06 cs.AI

DeltaLogic: Minimal Premise Edits Reveal Belief-Revision Failures in Logical Reasoning Models

DeltaLogic: 最小前提编辑揭示逻辑推理模型中的信念修正失败

Amit Dhanda

机构 * Amazon(亚马逊)

AI总结 DeltaLogic通过最小证据变化评估逻辑推理模型的信念修正能力,发现初始推理能力强并不等于修正行为强,Qwen3-4B在修正任务中仍存在惯性失败,Phi-4-mini-instruct表现更优但仍有非 trivial 抽象问题。

Comments ICLR 2026 Workshop on Logical Reasoning of Large Language Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02447 2026-04-06 cs.CV cs.AI cs.LG

PlayGen-MoG: Framework for Diverse Multi-Agent Play Generation via Mixture-of-Gaussians Trajectory Prediction

PlayGen-MoG:基于高斯混合轨迹预测的多智能体多样化play生成框架

Kevin Song

机构 * Amazon Web Services(亚马逊云服务)

AI总结 本文提出PlayGen-MoG框架,通过高斯混合输出头、相对空间注意力和非自回归预测方法,解决多智能体轨迹生成中的多样性与空间协调问题,实现从单一静态阵型生成真实play。

Comments 9 pages, 4 figures, 2 tables. Accepted to CVPRW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02349 2026-04-06 cs.LG cs.AI

OPRIDE: Offline Preference-based Reinforcement Learning via In-Dataset Exploration

OPRIDE: 通过数据集内探索实现离线偏好驱动强化学习

Yiqin Yang, Hao Hu, Yihuan Mao, Jin Zhang, Chengjie Wu, Yuhua Jiang, Xu Yang, Runpeng Xie, Yi Fan, Bo Liu, Yang Gao, Bo Xu, Chongjie Zhang

机构 * The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所复杂系统认知与决策智能重点实验室) Tsinghua University(清华大学) Moonshot AI(月之暗面) Amazon(亚马逊) University of Arizona(亚利桑那大学) Washington University in St. Louis(圣路易斯华盛顿大学)

AI总结 本文提出OPRIDE算法,通过改进探索策略和折扣调度机制提升离线偏好驱动强化学习的查询效率,实验表明其在多种任务中表现优异。

Journal ref ICLR-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02341 2026-04-06 cs.LG cs.AI

LLM Reasoning with Process Rewards for Outcome-Guided Steps

基于过程奖励的大型语言模型推理

Mohammad Rezaei, Jens Lehmann, Sahar Vahdati

机构 * Amazon Science(亚马逊科学)

AI总结 PROGRS框架通过过程奖励相对偏好优化,提升数学推理准确性,减少错误引导,优于仅基于结果的基线方法。

Comments 8 pages, 3 figures, 2 tables, submitted to IJCNN 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29093 2026-04-06 cs.CL cs.AI cs.IR

APEX-EM: Non-Parametric Online Learning for Autonomous Agents via Structured Procedural-Episodic Experience Replay

APEX-EM:通过结构化程序-经验经验回放实现自主代理的非参数在线学习

Pratyay Banerjee, Masud Moshtaghi, Ankit Chadha

机构 * Amazon, AGI / Sunnyvale, USA(亚马逊 AGI / 美国森尼韦尔)

AI总结 本文提出APEX-EM框架,通过结构化经验表示和PRGII工作流,实现自主代理的非参数在线学习,提升跨领域任务的性能。

Comments 17 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21584 2026-04-06 cs.CV

TARS: MinMax Token-Adaptive Preference Strategy for Hallucination Reduction in MLLMs

TARS:最小最大令牌自适应偏好策略用于减少多模态大语言模型中的幻觉

Kejia Zhang, Keda Tao, Zhiming Luo, Chang Liu, Jiasheng Tang, Huan Wang

机构 * Xiamen University(厦门大学) Westlake University(西湖大学) DAMO Academy, Alibaba Group(阿里巴巴达摩院) AWS AI Lab, Amazon(亚马逊AWS AI实验室) Hupan Laboratory(湖畔实验室)

AI总结 TARS通过最小最大优化问题重构直接偏好优化,通过对抗性令牌扰动减少多模态大语言模型中的幻觉,通过频域对齐损失提升隐藏表征,优于标准DPO并超越数据增强方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.15314 2026-04-06 cs.LG

Output-Constrained Decision Trees

输出约束决策树

Hüseyin Tunç, Doğanay Özese, Ş. İlker Birbil, Donato Maragno, Marco Caserta, Mustafa Baydoğan

机构 * Social Sciences University of Ankara(安卡拉社会科学大学) Uber Amsterdam(优步阿姆斯特丹) University of Amsterdam(阿姆斯特丹大学) Amazon(亚马逊) Boğaziçi University(博阿齐奇大学)

AI总结 本文提出三种输出约束回归树方法,解决传统决策树在受约束多目标回归任务中的局限,通过混合整数规划、穷举搜索和事后优化提升预测准确性与可行性。

Comments 27 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏