arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

大厂专区

2026-05-20 至 2026-05-20 共收录 12
2605.19892 2026-05-20 cs.DC cs.AI cs.ET cs.NI

Deep Tech to Space: Space Data Centers and AI Revolution at the Edge

深科技向太空:太空数据中心与边缘AI革命

Jonas Weiss, Patricia Sagmeister, Gabriel Maiolini Capez, Dinesh Verma, Roberto Garello, Alberto Perotti, Dawid Lazaj, Alicja Musial, Jakub Nalepa, Thomas Morf, Martin Schmatz, Marek Krawczyk, Mateusz Przeliorz, Kevin Roche, Sagar Tayal, Mahalakshmi Lakshminarayanan, Nicolas Longépé, Pierre-Philippe Mathieu, Agata Wijata

机构 * IBM Research Europe(IBM欧洲研究院) Politecnico di Torino(都灵理工大学) Vyoma GmbH(Vyoma公司) IBM Research(IBM研究院) KP Labs(KP实验室) Silesian University of Technology(西里西亚技术大学) Meguro Space(Meguro空间) IBM ESA Φ \Phi -lab(欧洲航天局Φ实验室)

AI总结 随着私人部门创新带来的成本大幅下降,轨道上的卫星数量迅速增加,随之而来的太空生成数据量也大幅上升。传输大量数据到地球进行处理可能变得越来越昂贵和具有挑战性,因为空间到地球链路拥堵和延迟增加。此外,传统地面站网络可能难以应对增长的数据流和工作负载,因为容量限制、复杂的调度物流和受限的可见窗口可能会限制扩展性。太空数据中心(SDCs)——一种软件驱动、多租户的人工智能服务平台,能够处理轨道上的数据以生成可操作的见解,为客户卫星和地面用户服务——代表了解决这些挑战的一种有前景的方法。

Comments 7 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19866 2026-05-20 cs.CV

Structured Layout Priors for Robust Out-of-Distribution Visual Document Understanding

用于鲁棒性文档理解的结构化布局先验

Peter El Hachem, Ahmed Nassar, A. Said Gurbuz, Christoph Auer, Peter W. J. Staar

机构 * ETH Zurich(苏黎世联邦理工学院) IBM Research(IBM研究院)

AI总结 本文提出了一种结构化布局先验,通过在解码器之外运行轻量级RT-DETR检测器,将检测结果转换为解析器的DocTags词汇,并注入到提示中,以解决文档布局解析中的两跳瓶颈问题,从而提升文档理解的鲁棒性。

Comments 18 pages, 7 figures. Main text: 9 pages (4 figures); Appendix: 9 pages (3 figures)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19282 2026-05-20 cs.LG

Rethinking Muon Beyond Pretraining: Spectral Failures and High-Pass Remedies for VLA and RLVR

重新思考Muon超越预训练:VLA和RLVR中的频谱失败及高频修复

Chongyu Fan, Gaowen Liu, Mingyi Hong, Ramana Rao Kompella, Sijia Liu

机构 * Michigan State University(密歇根州立大学) Cisco(思科) University of Minnesota(明尼苏达大学) IBM Research(IBM研究院)

AI总结 本文研究了Muon优化器在预训练之外的局限性,提出Pion通过高频NS迭代机制改进VLA和RLVR任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19196 2026-05-20 cs.CL

Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?

时间到REFLECT:我们能否信任LLM裁判来评估基于证据的研究代理?

Leyao Wang, Yanan He, Peng Chen, Asaf Yehudai, Yixin Liu, Rex Ying, Michal Shmueli-Scheuer, Arman Cohan

机构 * Yale University(耶鲁大学) IBM Research(IBM研究院)

AI总结 本文提出REFLECT基准,用于评估LLM裁判在代理环境中的细粒度失败检测,揭示当前LLM裁判在推理、工具使用和报告质量上的可靠性不足,为构建更可靠的评估流程提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19150 2026-05-20 cs.LG cs.AI

Flash PD-SSM: Memory-Optimized Structured Sparse State-Space Models

Flash PD-SSM: 一种内存优化的结构稀疏状态空间模型

Aleksandar Terzić, Francesco Carzaniga, Nicolas Menet, Yannick Biehl, Michael Hersche, Thomas Hofmann, Abbas Rahimi

机构 * IBM Research – Zurich(IBM瑞士研究中心) Department of Computer Science, ETH Zürich(苏黎世联邦理工学院计算机科学系)

AI总结 本文提出Flash PD-SSM,一种内存优化的结构稀疏状态空间模型,通过在保持高效的同时提升表达能力,实现了与传统结构化状态空间模型相当的吞吐量,并在多个任务中展示了更高的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19111 2026-05-20 cs.CV cs.AI

FAGER: Factually Grounded Evaluation and Refinement of Text-to-Image Models

FAGER:基于事实的文本到图像模型评估与改进

Youngsun Lim, Cusuh Ham, Pin-Yu Chen, Deepti Ghadiyaram

机构 * Boston University(波士顿大学) Adobe(Adobe公司) IBM Research(IBM研究院)

AI总结 本文提出FAGER框架,用于评估和改进文本到图像模型的事实准确性,通过结合LLM生成事实和参考引导的视觉事实提取与验证,构建结构化事实评估标准,并通过VLM进行评估,验证FAGER在事实性测试中优于现有方法,并能无训练改进T2I输出。

Comments It was accepted for an oral presentation at the 2nd Workshop on the Evaluation of Generative Foundation Models (EVGENFM2026) at CVPR 2026. Total 8 pages (1 page for references). 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18413 2026-05-20 cs.CV

Cracks in the Foundation: A Civil Infrastructure Dataset to Challenge Vision Foundation Models

基础的裂缝:一个挑战视觉基础模型的民用基础设施数据集

Nicola Farronato, Niccolo Avogaro, Thomas Frick, Mattia Rigotti, Rizwan Ullah Khan, Michele Magno, Konrad Schindler, Cristiano Malossi, Florian Scheidegger

机构 * IBM Research(IBM研究院) ETH Zürich(苏黎世联邦理工学院) University of Twente(特文特大学)

AI总结 本文提出Cracks in the Foundation数据集,通过高分辨率图像挑战视觉基础模型在民用基础设施中的密集图像理解能力,揭示了现有模型在真实世界中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13466 2026-05-20 cs.CL cs.AI cs.LG

Language Model Memory and Memory Models for Language

语言模型记忆与记忆模型用于语言

Benjamin L. Badger

机构 * IBM(IBM公司)

AI总结 研究探讨了语言模型和记忆模型在信息存储中的能力差异,发现语言模型的嵌入向量信息较少,而自编码器在输入再生训练中能形成接近完美的记忆,提出了一种可并行的编码器-解码器记忆模型架构,并通过结合因果和信息保留目标函数来提升记忆形成和解码能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11767 2026-05-20 cs.AI cs.CL cs.LG

TSR: Trajectory-Search Rollouts for Multi-Turn RL of LLM Agents

TSR:用于LLM代理多轮RL的轨迹搜索

Aladin Djuhera, Swanand Ravindra Kadhe, Farhan Ahmed, Syed Zawad, Heiko Ludwig, Holger Boche

机构 * Technical University Munich(慕尼黑技术大学) IBM Research(IBM研究院)

AI总结 本文提出TSR,一种在训练时改进每轮轨迹生成的方法,通过轻量级树状搜索构造高质量轨迹,提升rollout质量和学习稳定性,适用于多轮RL任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04998 2026-05-20 cs.LG cs.AI cs.CL

Learning Rate Matters: Vanilla LoRA May Suffice for LLM Fine-tuning

学习率至关重要:Vanilla LoRA可能足以用于LLM微调

Yu-Ang Lee, Ching-Yun Ko, Pin-Yu Chen, Mi-Yen Yeh

机构 * National Taiwan University(国立台湾大学) IBM Research(IBM研究院) Academia Sinica(台湾“学术院”)

AI总结 本文通过广泛的超参数搜索重新评估了九种代表性的LoRA变体和Vanilla LoRA,在数学推理、常识推理、代码生成和指令遵循等任务上,发现不同的LoRA方法偏好不同的学习率范围。当学习率正确调整时,所有方法都能达到相似的峰值性能,这表明Vanilla LoRA仍然是一个有竞争力的基线,而单一训练配置下的改进可能并不反映一致的方法优势。

Comments Project page: https://github.com/yuang-lee/lr-matters-lora

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22478 2026-05-20 cs.LG

Transformation-Augmented GRPO for Enhancing Exploration in Reasoning of Large Language Models

增强推理探索的变换增强GRPO

Khiem Le, Phuc Nguyen, Youssef Mroueh, Chi-Heng Lin, Shangqian Gao, Ting Hua, Nitesh V. Chawla

机构 * University of Notre Dame(诺特大学) IBM Research(IBM研究院) Meta AI Florida State University(佛罗里达州立大学)

AI总结 本文提出变换增强GRPO(TA-GRPO)方法,通过问题重述解决大语言模型强化学习中梯度消失和多样性崩溃问题,提升模型在推理任务中的探索能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18827 2026-05-20 cs.IR cs.LG cs.PL

Code-Guided Reasoning for Small Language Models: Evaluating Executable MCQA Scaffolds

为小型语言模型引导的推理:评估可执行的多项选择题问答框架

Prateek Biswas, Dhaval Patel, Vedant Khandelwal, Shuxin Lin, Amit Sheth

机构 * IBM New York City,NY(IBM纽约市) University of South Carolina(南卡罗来纳大学) Artificial Intelligence Institute at University of South Carolina(南卡罗来纳大学人工智能学院)

AI总结 本文提出Code-Guided Reasoning(CGR)评估协议和生成程序资源,用于衡量可执行推理框架如何提升小型语言模型在多项选择题问答任务中的表现,通过实验展示了使用可执行框架带来的性能提升。

Comments 28 Pages, 18 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏