arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

2026-09-01 至 2026-09-01 共收录 8
2608.31067 2026-09-01 cs.LG 新提交

Universal Transformers for Circuit Computations: Perfect Length Generalization in Tiny Transformers

用于电路计算的通用Transformer:小型Transformer中的完美长度泛化

Takuya Ito, Ruchir Puri, Murray Campbell, Parikshit Ram

机构 * IBM Research(IBM研究院)

AI总结 该研究提出一种仅需280个参数的通用Transformer,将算法任务建模为电路模型,结合特定位置编码与自主终止准则,在布尔运算、模运算等基准测试上实现了完美长度泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29953 2026-09-01 cs.AI 新提交

SearchWiki: Learning to Build and Navigate Knowledge Wikis for Active Information Seeking

SearchWiki:学习构建与导航知识Wiki以支持主动信息检索

Guransh Singh, Vishwajeet Kumar, Arkadeep Acharya, Adnan Qidwai, Jaydeep Sen, Sachindra Joshi

机构 * IBM(国际商业机器公司)

AI总结 该研究提出SearchWiki框架,将语料库合成分层可导航Wiki,训练WikiResearcher-9B智能体经强化学习优化导航策略,在多基准测试中表现优于同规模模型,证实结构化语料库学习式导航优于扁平检索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29951 2026-09-01 cs.AI cs.IR 新提交

Spatial Matryoshka Training for Multi-Granularity Visual Document Retrieval

面向多粒度视觉文档检索的空间嵌套训练

Trishan Singha Roy, Arkadeep Acharya, Vishwajeet Kumar, Jaydeep Sen, Sachindra Joshi

机构 * IBM(国际商业机器公司)

AI总结 针对视觉文档检索的多模态晚期交互检索器存储成本高、压缩级别固定的问题,提出ColSNAP训练方法,可生成嵌套压缩层级,实现灵活的精度-存储权衡,大幅压缩下仍保持检索性能并可迁移至多类骨干网络。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07926 2026-09-01 cs.CL

Comprehensiveness Metrics for Automatic Evaluation of Factual Recall in Text Generation

全面性指标用于文本生成中事实回忆的自动评估

Adam Dejl, James Barry, Alessandra Pascale, Javier Carnerero Cano

机构 * Department of Computing, Imperial College London(伦敦帝国学院计算机系) IBM Research(IBM研究院)

AI总结 本文提出三种自动评估指标以评估大语言模型生成文本的全面性,发现端到端方法在效果上优于复杂指标,但牺牲了鲁棒性和可解释性。

Comments ACL 2026 Findings

Journal ref Findings of the Association for Computational Linguistics: ACL 2026, 34931-34966. 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20994 2026-09-01 cs.CR cs.AI cs.CL 版本更新

Breaking MCP with Function Hijacking Attacks: Novel Threats for Function Calling and Agentic Models

打破MCP:函数劫持攻击:函数调用和代理模型的新威胁

Yannis Belkhiter, Giulio Zizzo, Sergio Maffeis, Seshu Tirupathi, John D. Kelleher

机构 * IBM Research Europe(IBM欧洲研究院) Trinity College Dublin(三一学院都柏林) Imperial College London(帝国理工学院伦敦) ADAPT Research Centre(ADAPT研究中心)

AI总结 本文提出了一种新的函数劫持攻击,通过操纵代理模型的工具选择过程,迫使调用特定攻击者选择的函数,展示了代理模型在函数调用接口上的新漏洞。

Comments Accepted to TMLR (08/26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03828 2026-09-01 cs.AI cs.MA 版本更新

AssetOpsBench: Benchmarking AI Agents for Task Automation in Industrial Asset Operations and Maintenance

AssetOpsBench:工业资产运维任务自动化AI代理的基准测试

Dhaval Patel, Shuxin Lin, James Rayfield, Nianjun Zhou, Chathurangi Shyalika, Suryanarayana R Yarrabothula, Roman Vaculin, Natalia Martinez, Fearghal O'donncha, Jayant Kalagnanam

机构 * IBM University of South Carolina(南卡罗来纳大学) IBM Research(IBM研究院)

AI总结 本文提出AssetOpsBench,一个统一框架,用于协调和评估工业4.0中的领域专用代理。该框架包含四个领域代理目录、140+人工撰写的自然语言查询数据集及模拟的CouchDB后端物联网环境,通过三个关键指标分析工具-代理与计划-执行者范式的架构权衡,并系统化发现新兴故障模式。

Comments 25 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14056 2026-09-01 cs.CV cs.AI 版本更新

POCI-Diff: 3D-Layout Guided Diffusion for Controllable Synthetic Surveillance Data Generation

POCI-Diff: 通过3D布局引导扩散实现位置对象一致性和交互

Andrea Rigo, Luca Stornaiuolo, Weijie Wang, Mauro Martino, Bruno Lepri, Nicu Sebe

机构 * DISI, University of Trento(DISI,特伦托大学) Toretei S.r.l.(Toretei公司) Visual AI Lab, MIT-IBM Watson AI Lab(视觉人工智能实验室,MIT-IBM沃森人工智能实验室) Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会)

AI总结 POCI-Diff通过3D布局引导扩散实现一致性和交互性的物体位置控制,提升文本到图像生成的布局一致性和编辑质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08311 2026-09-01 cs.SE cs.AI 版本更新

Understanding Automated Program Repair Agents Through the Lens of Traceability: An Empirical Study

通过可追溯性视角理解自动化程序修复智能体:一项实证研究

Ira Ceka, Hailie Mitchell, Saurabh Pujar, Luca Buratti, Shyam Ramji, Junfeng Yang, Gail Kaiser, Baishakhi Ray

机构 * Columbia University(哥伦比亚大学) IBM Research(IBM研究院)

AI总结 本文通过追踪五个最先进的自动化程序修复智能体在500个真实世界修复任务中的决策流程,揭示了它们在逻辑密集型错误修复、测试生成和回归测试选择方面的关键局限性,并提出了改进方向。

Comments Accepted for publication (ISSTA '26). Camera ready

详情

展开后加载摘要…

URL PDF HTML 收藏