arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

大厂专区

2026-05-04 至 2026-05-04 共收录 6
2602.14276 2026-05-04 cs.CV

ScreenParse: Moving Beyond Sparse Grounding with Complete Screen Parsing Supervision

ScreenParse:超越稀疏标注的完整屏幕解析监督

A. Said Gurbuz, Sunghwan Hong, Ahmed Nassar, Marc Pollefeys, Peter Staar

机构 * IBM Research Zurich, Zurich, Switzerland(IBM苏黎世研究实验室,瑞士苏黎世) ETH Zurich, Computer Vision(苏黎世联邦理工学院,计算机视觉) ETH AI Center, Switzerland(苏黎世联邦理工学院人工智能中心,瑞士) ETH Zurich, Photogrammetry(苏黎世联邦理工学院,摄影测量学) Microsoft, Switzerland(微软公司,瑞士)

AI总结 ScreenParse通过大规模完整屏幕解析标注,训练出性能优异的ScreenVLM模型,显著提升了密集解析能力和迁移表现。

Comments Accepted at ICML 2026. 28 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16762 2026-05-04 cs.LG

NRGPT: An Energy-based Alternative for GPT

NRGPT:一种基于能量的GPT替代方案

Nima Dehmamy, Benjamin Hoover, Bishwajit Saha, Leo Kozachkov, Jean-Jacques Slotine, Dmitry Krotov

机构 * IBM Research(IBM研究院) Georgia Tech(佐治亚理工学院) Brown University(布朗大学) MIT(麻省理工学院)

AI总结 NRGPT通过最小化修改将GPT与能量基模型框架统一,其推理过程被视为在能量景观上探索,实验证明在特定条件下可转化为梯度下降,适用于简单语言、代数任务和更复杂的语言建模。

Comments Accepted to ICLR 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00119 2026-05-04 cs.CL cs.AI

Cultural Benchmarking of LLMs in Standard and Dialectal Arabic Dialogues

阿拉伯语言模型的文化基准测试:标准阿拉伯语与方言对话

Muhammad Dehan Al Kautsar, Saeed Almheiri, Momina Ahsan, Bilal Elbouardi, Younes Samih, Sarfraz Ahmad, Amr Keleg, Omar El Herraoui, Kareem Elzeky, Abed Alhakim Freihat, Mohamed Anwar, Zhuohan Xie, Junhong Liang, Mohammad Rustom Al Nasar, Preslav Nakov, Fajri Koto

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) IBM Research AI(IBM人工智能研究) American University in the Emirates(阿联酋美国大学)

AI总结 本文提出ArabCulture-Dialogue数据集,涵盖13国阿拉伯语及方言,通过三种任务评估模型在文化推理、翻译和方言引导生成中的表现,发现方言设置下模型性能仍低于标准阿拉伯语。

Comments 23 pages, 7 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25719 2026-05-04 cs.AI cs.AR cs.LG

Agent Factories for High Level Synthesis: How Far Can General-Purpose Coding Agents Go in Hardware Optimization?

用于高级综合的代理工厂:通用编程代理在硬件优化中能走多远?

Abhishek Bhandwaldar, Mihir Choudhury, Ruchir Puri, Akash Srivastava

机构 * IBM Corporation(IBM公司)

AI总结 本文研究通用编程代理在无硬件特定训练下优化硬件设计的能力,提出代理工厂流程,通过分阶段优化子内核并协调多个自主优化代理,实现全局优化,实验显示代理数量增加可显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14255 2026-05-04 cs.LG

Graph Concept Bottleneck Models

图概念瓶颈模型

Haotian Xu, Tsui-Wei Weng, Lam M. Nguyen, Tengfei Ma

机构 * Department of Applied Mathematics & Statistics(应用数学与统计学系) State University of New York at Stony Brook(石溪州立大学) Halıcıoğlu Data Science Institute(Halıcıoğlu数据科学研究所) University of California, San Diego(加州大学圣地亚哥分校) Thomas J. Watson Research Center(汤普森·J·沃森研究中心) IBM Research(IBM研究院) Department of Biomedical Informatics(生物医学信息学系)

AI总结 图概念瓶颈模型通过构建潜在概念图来增强概念关系,提升模型性能和可解释性,实验证明其在图像分类中具有更高的准确性与鲁棒性。

Comments TMLR March 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01946 2026-05-04 q-bio.QM cs.LG math.DS q-bio.NC

Characterizing control between interacting subsystems with deep Jacobian estimation

通过深度雅可比估计表征相互作用子系统的控制特性

Adam J. Eisen, Mitchell Ostrow, Sarthak Chandra, Leo Kozachkov, Earl K. Miller, Ila R. Fiete

机构 * Brain and Cognitive Sciences MIT(麻省理工学院脑科学与认知科学系) IBM Thomas J. Watson Research Center(IBM沃森研究中心) International Centre for Theoretical Sciences(国际理论科学研究院) Brown University(布朗大学)

AI总结 本文提出一种基于深度学习的非线性控制理论框架,通过动态雅可比估计表征子系统交互,展示了在高维混沌系统中优于传统方法的性能,并通过多区域RNN模型验证了控制方向的动态变化及行为操控能力。

Comments 10 pages, 6 figures

Journal ref Advances in Neural Information Processing Systems 38 (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏