arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Amazon(亚马逊)

2026-07-27 至 2026-07-27 共收录 4
2607.21780 2026-07-27 cs.CL cs.AI cs.CV 新提交

Khondo: A Multimodal Benchmark for Document Packet Splitting of Bangla Forms

Khondo:孟加拉语表格文档分组拆分的多模态基准测试

Abu Tyeb Azad, Fahim Ahmed, Ishita Sur Apan, Ezharuddin Jubaer, Sumaiya Karim Katha, Armun Alam, Amin Ahsan Ali, Aman Chadha, Md Mofijul Islam, AKM Mahbubur Rahman

机构 * Wichita State University(威奇托州立大学) CCDS, Independent University, Bangladesh(孟加拉国独立大学计算与通信科学系) Amazon GenAI(亚马逊生成式人工智能)

AI总结 研究针对孟加拉语表格文档分组拆分难的问题,引入多模态基准测试Khondo,涵盖多种拼接方案和行政领域。通过对语言模型零样本评估及对照分析,发现页面排列是主要挑战,语言有影响,确立页面顺序重建问题并提供基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21722 2026-07-27 cs.CV 新提交

Be Consistent! Enhancing Robust Visual Reasoning in LVLMs with Consistency Constraints

保持一致!利用一致性约束增强大视觉语言模型中的鲁棒视觉推理

Liqiang Jing, Xiong Zhou, Siddharth Varia, Neha Anna John, Xinya Du, Vassilis N. Ioannidis

机构 * University of Texas at Dallas(德克萨斯大学达拉斯分校) Amazon Web Services(亚马逊网络服务公司)

AI总结 研究针对LVLMs在视觉推理任务中较脆弱的问题,引入ConVBench基准及逻辑一致性等评估指标,提出ConVLM,通过基于GRPO的强化学习及一致性奖励改进LVLM推理,利用自动生成的问答对和双重奖励设计提升模型表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21625 2026-07-27 cs.AI 新提交

Trajectory-Aware Retrieval Agents for Temporal Decision- Making

用于时间决策的轨迹感知检索代理

Jing Wang, Jie Shen, Xing Niu

机构 * Amazon(亚马逊)

AI总结 研究用大语言模型代理从长篇时间结构化文本中决策的问题,针对标准RAG丢弃时间结构缺陷,引入闭环代理框架TLM,其关键技术是LGCM,在医学问答、收益电话会议惊喜预测和隔夜股票缺口预测任务中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21623 2026-07-27 cs.LG 新提交

Cloud-Native Evaluation-as-a-Service: A Microservices Architecture for Scalable AI Monitoring with Conformal Guarantees

云原生评估即服务:一种具有共形保证的可扩展人工智能监测微服务架构

Lei Yang

机构 * Amazon Web Services(亚马逊网络服务公司)

AI总结 研究提出云原生评估即服务EaaS架构,将人工智能评估方法化为六个微服务。验证了方法的关键问题,如覆盖率、插补影响、漂移检测能力和公平性监测等。给出了相关实验结果,且与开源工具比较,表明该架构有创新性。

Comments 23 pages, 15 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏