arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

共收录 739
2606.12289 2026-08-19 cs.LG cs.AI cs.NE 版本更新

The Standard Interpretable Model: A general theory of interpretable machine learning to deductively design interpretable methods using Lagrangian mechanics

标准可解释模型:一种基于拉格朗日力学的可解释机器学习通用理论,用于演绎设计可解释方法

Pietro Barbiero, Giovanni De Felice, Mateo Espinosa Zarlenga, Francesco Giannini, Filippo Bonchi, Mateja Jamnik, Giuseppe Marra, Ruggero Noris

机构 * IBM Research (CH)(IBM研究院(瑞士)) University of Oxford (UK)(牛津大学(英国)) University of Cambridge (UK)(剑桥大学(英国)) KU Leuven (BE)(鲁汶大学(比利时)) Institute of Physics of the Czech Academy of Sciences (CZ)(捷克科学院物理研究所(捷克))

AI总结 提出标准可解释模型(SIM),基于拉格朗日力学从前提演绎出可解释性对称性和约束,通过最小化拉格朗日函数得到最优可解释模型,解决现有方法局限性并指导新方法设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15303 2026-08-18 cs.AI 新提交

Divergent-Convergent Reasoning: Scaling Test-Time Compute through Structured Solution Synthesis

发散-收敛推理:通过结构化解决方案合成扩展测试时计算

Bo Wen, Yuhao Chen, Erhan Bilal, Carla Agurto Rios, Chen Wang, Junchen Jiang

机构 * School of Computing, Queen’s University(女王大学计算学院) IBM T.J. Watson Research Center(IBM T.J.沃森研究中心) University of Chicago(芝加哥大学) Tensormesh Inc.(Tensormesh公司)

AI总结 该研究提出发散-收敛推理(DCR),引入递归DCR方法,利用分歧信息优化测试时计算分配,在AIME 2024、2025数据集上实现高准确率且减少计算量,揭示LLM测试时推理的扩展规律。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14991 2026-08-18 cs.CV 新提交

Risk-Adaptive Edge--Cloud Visual Reasoning for Communication-Efficient Autonomous Driving

面向通信高效自动驾驶的风险自适应边云视觉推理

Meng Ma, Shuyang Li, Naigang Wang, Ruimin Ke

机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院) IBM T. J. Watson Research Center(IBM T. J. 沃森研究中心)

AI总结 本研究提出风险自适应边云视觉推理架构,通过车载交通评估触发云端VLM推理,在自动驾驶中减少54.1%云端请求量,同时保持任务成功率并降低AEB触发次数,实现通信效率与性能的平衡。

Comments 7 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12671 2026-08-14 cs.AI cs.CC 新提交

On the Expressive Power of Transformers

Transformer的表达能力研究

Phokion Kolaitis, Rik Sengupta

机构 * University of California Santa Cruz(加利福尼亚大学圣克鲁兹分校) IBM Research(IBM研究院)

AI总结 本文基于电路复杂性的概念与方法,概述了界定Transformer表达能力的部分精选研究结果,助力校准其作为语言识别器的表达能力。

Comments 13 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12282 2026-08-13 cs.AI 新提交

VAKRA: Evaluating Multi-Hop Reasoning Across APIs and Retrieval Under Tool-Use Policies

VAKRA:评估工具使用策略下跨API与检索的多跳推理能力

Ankita Rajaram Naik, Anupama Murthi, Benjamin Elder, Siyu Huo, Raavi Gupta, Abhinav Jain, Praveen Venkateswaran, Abdulhamid Adebayo, Danish Contractor

机构 * IBM(国际商业机器公司(IBM))

AI总结 本研究推出VAKRA基准评估工具使用策略下跨API与检索的多跳推理,发现现有最优模型在相关任务上性能随推理深度显著下降,失败集中于语言介导推理环节。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11905 2026-08-13 cs.AI cs.LG cs.SC 新提交

Policy-as-logic for robust reasoning over rules

作为逻辑的策略:针对规则的鲁棒推理

Rahul Nair, Bastian Lipka, Elizabeth Daly

机构 * IBM Research(IBM研究院) IBM(国际商业机器公司)

AI总结 该研究提出混合符号方法,将策略表示为形式逻辑,结合语言模型事实提取与答案集求解器推理,性能优于策略作为提示、策略作为代码方法,令牌用量减少约10倍,助力生成式AI系统做出鲁棒决策。

Comments RobustifAI Workshop at IJCAI-ECAI '26

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11694 2026-08-13 cs.CL cs.AI 新提交

The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance

措辞效应:量化大语言模型基准测试性能中的双向漂移

Shailja Thakur, Sungeun An, Chad DeLuca, Hima Patel

机构 * IBM Research India(IBM印度研究院) IBM Research Almaden(IBM阿尔马登研究院)

AI总结 该研究提出BenchDrift方法,通过生成基准问题的保义变体,发现大语言模型性能存在双向漂移,且漂移与重新措辞相关,模型性能提升未消除措辞敏感性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10694 2026-08-13 cs.LG cs.AI cs.CL cs.NE 版本更新

Optimize Cheap, Deploy Strong: Cost-Aware Cross-Tier Transfer for Evolutionary Optimization

优化低成本部署强模型:面向进化优化的成本感知跨层迁移

Tal Oved, Roi Pony, Oshri Naparstek, Udi barzelay

机构 * IBM Research(IBM研究院)

AI总结 该研究提出成本感知跨层迁移方法,解耦LLM角色,在低成本层级完成大部分搜索,跨层部署提示词,在多任务多模型上实现成本大幅降低且性能不劣于同层级优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08837 2026-08-13 cs.LG cs.AI 版本更新

Prompt-Driven Exploration

提示驱动的探索

Sunshine Jiang, John Marangola, David Zhang, Raghuram Kowdeed, Ruiyang Luo, Nitish Dashora, Richard Li, Pulkit Agrawal, Zhang-Wei Hong

机构 * Massachusetts Institute of Technology(麻省理工学院) MIT-IBM Computing Research Lab(麻省理工学院-IBM计算研究实验室) Improbable AI Lab(英普罗巴布尔人工智能实验室)

AI总结 研究针对强化学习中探索难的问题,提出提示驱动的探索策略(PDE),利用视觉-语言模型对轨迹视频推理,从弱策略轨迹中优化提示,实现后验采样,能让强化学习从零奖励起步学习成功策略并提升样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10172 2026-08-12 cs.LG 新提交

Intrinsic Structure: Spectral Identifiability for Mechanistic Interpretability

内在结构:机制可解释性的谱可识别性

Ashim Dhor, Pin-Yu Chen

机构 * IISER Bhopal(印度博帕尔科学教育与研究所) IBM Research(IBM研究院)

AI总结 本研究提出机制可解释性的谱可识别性定理,利用Koopman算子构建模型内在指纹,在GPT-2 small等模型上验证了谱的收敛性及相关性质,为机制可解释性的基础组件提供了首个可识别性理论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24287 2026-08-12 cs.CL cs.AI 版本更新

Do LLMs Benefit From Their Own Words?

大型语言模型是否受益于自身话语?

Jenny Y. Huang, Leshem Choshen, Wei Sun, Omar Khattab, Ramón Fernandez Astudillo, Mehul Damani, Tamara Broderick, Jacob Andreas

机构 * Department of Electrical Engineering and Computer Science, Massachusetts Institute of Technology(麻省理工学院电子工程与计算机科学系) MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室) IBM Research(IBM研究院)

AI总结 研究发现,省略大型语言模型自身历史上下文可提高响应质量并减少内存消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09921 2026-08-11 cs.AI 新提交

GENCO - A Unified Neural Solver Embedded in a Development Framework for Steady-State Grid Analysis

GENCO — 嵌入开发框架的稳态电网分析统一神经求解器

Alban Puech, Matteo Mazzonelli, Tamara R. Govindasamy, Mangaliso Mngomezulu, Héctor Maeso-García, Thomas Tolhurst, Javad Bayazi, Ali Moeini, Naomi Simumba, Celia Cintas, David Nelischer, Romeo Kienzler, Jonas Weiss, Anna Varbella, Florian Dörfler, Gabriela Hug, Martin Mevissen, Juan Bernabé-Moreno, François Mirallès, Hendrik F. Hamann, Etienne Vos, Thomas Brunschwiler

机构 * IBM Research(IBM研究院) Hydro-Québec Research Institute(魁北克水电研究院) ETH Zurich(苏黎世联邦理工学院) Stony Brook University(石溪大学) Brookhaven National Laboratory(布鲁克海文国家实验室)

AI总结 研究人员推出统一神经求解器GENCO及开源GridFM开发框架,其可处理电网PF、OPF、SE任务,在基准测试中提速显著且性能优于经典求解器,降低电网分析门槛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08639 2026-08-11 cs.AI 新提交

Smart Compaction: Predicting Compaction Utility from Lakehouse Table Metadata

智能压缩:从湖表元数据预测压缩效用

Jannic Cutura, Subash Prakash

机构 * European Central Bank(欧洲中央银行) European System of Central Banks(欧洲中央银行体系) IBM(国际商业机器公司)

AI总结 该研究针对开放湖表格式的小文件问题,提出模拟框架与XGBoost模型预测压缩效用,发现单一分区阈值可做二元压缩决策,验证了泛化性并揭示压缩对不同查询的影响,代码数据公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09251 2026-08-11 cs.AI 版本更新

DRBENCHER: Can Your Agent Identify the Entity, Retrieve Its Properties and Do the Math?

DRBENCHER:你的智能体能识别实体、检索其属性并进行数学运算吗?

Young-Suk Lee, Ramon Fernandez Astudillo, Radu Florian

机构 * IBM Research(IBM研究院)

AI总结 DRBENCHER通过综合评估浏览与计算能力,揭示了现有基准测试的不足,其四维标准确保了问题的可验证性、复杂性、难度和多样性,展示了智能体在动态数据环境下的性能限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17239 2026-08-11 cs.CL cs.AI

SafeMERGE: Preserving Safety Alignment in Fine-Tuned Large Language Models via Selective Layer-Wise Model Merging

SafeMERGE: 通过选择性层间模型融合在微调大语言模型中保持安全对齐

Aladin Djuhera, Swanand Ravindra Kadhe, Farhan Ahmed, Syed Zawad, Holger Boche

机构 * Technical University Munich(慕尼黑技术大学) IBM Research(IBM研究院)

AI总结 本文提出SafeMERGE,一种轻量级后微调框架,通过选择性融合层间模型来恢复安全对齐,同时保持下游性能,减少有害输出并提升实用性。

Journal ref Findings of the ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12843 2026-08-11 cs.CL 版本更新

Growing Pains: Extensible and Efficient LLM Benchmarking Via Fixed Parameter Calibration

成长之痛:通过固定参数校准实现可扩展且高效的LLM基准测试

Eliya Habba, Itay Itzhak, Asaf Yehudai, Yotam Perlitz, Elron Bandel, Michal Shmueli-Scheuer, Leshem Choshen, Gabriel Stanovsky

机构 * The Hebrew University of Jerusalem(海法大学) IBM Research(IBM研究院) MIT(麻省理工学院) Technion(技术学院) Allen Institute for AI(人工智能研究院)

AI总结 本文提出基于多维项目反应理论的框架,利用锚定项目校准新基准,保持原有参数固定,实现随时间扩展基准测试的同时保持评分可比性,且评估成本恒定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06522 2026-08-11 cs.CL cs.AI

Fixing It in Post: A Comparative Study of LLM Post-Training Data Quality and Model Performance

事后修复:对LLM事后训练数据质量和模型性能的比较研究

Aladin Djuhera, Swanand Ravindra Kadhe, Syed Zawad, Farhan Ahmed, Heiko Ludwig, Holger Boche

机构 * Technical University Munich(慕尼黑技术大学) IBM Research(IBM研究院)

AI总结 本文通过对比两个开源事后训练数据集,提出了一种系统化编纂方法,生成性能更优的TuluTalk数据集,提升模型表现。

Journal ref The Thirty-Ninth Annual Conference on Neural Information Processing Systems (NeurIPS), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00062 2026-08-11 cs.CY cs.CL cs.CR cs.LG

SafeCOMM: A Study on Safety Degradation in Fine-Tuned Telecom Large Language Models

SafeCOMM: 对于在电信领域微调的大型语言模型安全退化的研究

Aladin Djuhera, Swanand Ravindra Kadhe, Farhan Ahmed, Syed Zawad, Fernando Koch, Walid Saad, Holger Boche

机构 * Technical University Munich(慕尼黑技术大学) IBM Research(IBM研究院) Florida Atlantic University(佛罗里达 Atlantic 大学) Virginia Tech(弗吉尼亚理工大学)

AI总结 本文研究了在电信领域微调的大型语言模型的安全退化问题,提出TeleHarm基准测试及三种防御方法,展示了如何通过安全重对齐提升模型安全性,实现SafeCOMM模型。

Journal ref IEEE Wireless Communications and Networking Conference (WCNC), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02436 2026-08-11 cs.AI 版本更新

Agentic AI for Clustering, Relationship Discovery, and Semantic Trading in Prediction Markets

语义交易:用于预测市场聚类和关系发现的代理AI

Agostino Capponi, Alfio Gliozzo, Brian Zhu

机构 * Columbia University(哥伦比亚大学) IBM Research(IBM研究院)

AI总结 本文提出一种代理AI方法,通过自然语言处理将预测市场划分为主题组并发现市场间的关系,利用历史数据验证其预测准确性及交易策略收益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12147 2026-08-10 cs.SE cs.AI cs.CL 版本更新

From Plan to Action: How Well Do Agents Follow the Plan?

评估自主编程代理中的计划合规性

Shuyang Liu, Saman Dehghan, Jatin Ganhotra, Martin Hirzel, Reyhaneh Jabbarvand

机构 * University of Illinois Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校) IBM(IBM公司)

AI总结 本文系统分析了编程代理在执行任务时对计划的遵循情况,通过16991条轨迹评估不同计划变体的影响,发现计划提醒能提高任务成功率,但不恰当的计划补充可能降低性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14967 2026-08-07 cs.SE cs.AI cs.LG 版本更新

MermaidSeqBench: An Evaluation Benchmark for NL-to-Mermaid Sequence Diagram Generation

MermaidSeqBench: 一种用于自然语言到Mermaid序列图生成的评估基准

Basel Shbita, Farhan Ahmed, Chad DeLuca

机构 * IBM Research(IBM研究院)

AI总结 本文提出MermaidSeqBench,通过混合方法构建132个样本,评估LLM生成Mermaid序列图的能力,揭示模型间显著能力差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04926 2026-08-06 cs.LG cs.AI cs.CL 新提交

Consistency-Driven Co-Evolution for Self-Supervised Cross-Representation Learning

一致性驱动的协同演化用于自监督跨表示学习

Xuehang Guo, Pengyuan Li, Tom Hope, Tirthankar Ghosal, Manling Li, Qingyun Wang

机构 * William & Mary(威廉玛丽学院) IBM(国际商业机器公司) Allen Institute for AI(艾伦人工智能研究所) Oak Ridge National Laboratory(橡树岭国家实验室) Northwestern University(西北大学)

AI总结 针对图表、表格、代码跨表示学习的挑战,提出CoCoEvolve方法,通过定义一一对应关系、利用表示一致性优化模型,在4个基准的训练和测试场景中提升了性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10783 2026-08-06 cs.CV 版本更新

LiveXiv -- A Multi-Modal Live Benchmark Based on Arxiv Papers Content

LiveXiv —— 基于 arXiv 论文内容的多模态实时基准测试集

Nimrod Shabtay, Felipe Maia Polo, Sivan Doveh, Wei Lin, M. Jehanzeb Mirza, Leshem Choshen, Mikhail Yurochkin, Yuekai Sun, Assaf Arbelle, Leonid Karlinsky, Raja Giryes

机构 * Faculty of Engineering Tel-Aviv University(特拉维夫大学工程学院) IBM Research(IBM研究院) Department of Statistics, University of Michigan(密歇根大学统计学系) JKU Linz, Austria(林茨大学,奥地利) MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) MIT-IBM(麻省理工学院-IBM)

AI总结 针对多模态模型训练中测试数据污染问题,提出基于 arXiv 论文的 LiveXiv 实时基准,自动生成 VQA 对,用部分模型评估降低成本,验证了其性能差异极小,数据集已在 HuggingFace 公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22882 2026-08-05 cs.CV cs.RO 版本更新

GEM-4D: Geometry-Enhanced Video World Models for Robot Manipulation

GEM-4D:用于机器人操作的几何增强视频世界模型

Kaichen Zhou, Yuzhen Chen, Fangneng Zhan, Hang Hua, Grace Chen, Xinhai Chang, Ao Qu, Yilun Du, Zhuang Liu, Paul Pu Liang, Mengyu Wang

机构 * Harvard AI and Robotics Lab(哈佛人工智能与机器人实验室) Harvard University(哈佛大学) Media Lab and EECS(媒体实验室和电子工程与计算机科学系) MIT(麻省理工学院) Princeton University(普林斯顿大学) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室)

AI总结 提出GEM-4D,通过注入从预训练几何基础模型蒸馏的密集4D对应监督,增强视频世界模型的几何一致性,并引入逆动力学模块将视频滚动转换为可执行机器人轨迹,提升操作成功率。

Comments Robotic World Model, Video Generative Model

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24929 2026-08-05 cs.AI cs.CL cs.IT math.IT 版本更新

LogitScope: A Framework for Analyzing LLM Uncertainty Through Information Metrics

LogitScope:通过信息度量分析大语言模型不确定性框架

Farhan Ahmed, Yuya Jeremy Ong, Chad DeLuca

机构 * IBM Research(IBM研究院) Plastic Labs

AI总结 LogitScope通过计算概率分布中的信息度量,分析大语言模型生成过程中的不确定性,揭示模型置信度模式,识别潜在幻觉并暴露高不确定决策点,无需标注数据或语义解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09445 2026-08-05 cs.CL cs.AI 版本更新

Where Knowledge Collides: A Mechanistic Study of Intra-Memory Knowledge Conflict in Language Models

知识碰撞之处:语言模型中内存知识冲突的机理研究

Minh Vu Pham, Hsuvas Borkakoty, Yufang Hou

机构 * IT:U Austria(因特大学奥地利分校) IBM Research(IBM研究院)

AI总结 本研究通过机理可解释性方法揭示语言模型中预训练数据冲突知识的编码位置,探讨冲突知识在模型内部的存储机制及干预方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02438 2026-08-04 cs.AI 新提交

xPress: Parallel Refinement for Diffusion Drafters in Speculative Decoding

xPress:推测解码中扩散草稿模型的并行优化

Zheng Wang, Davis Wertheimer, Yu Chin Fabian Lim, Mudhakar Srivatsa, Raghu K. Ganti, Minjia Zhang, Naigang Wang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) IBM(国际商业机器公司(IBM))

AI总结 xPress是恢复扩散草稿模型因果依赖的并行优化方法,在Qwen3-8B的7个基准上,可提升推测解码的接受长度与端到端吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08696 2026-08-04 cs.CL cs.LG 版本更新

Structured Recurrent Mixers for Massively Parallelized Sequence Generation

结构化递归混合器用于大规模并行序列生成

Benjamin L. Badger

机构 * IBM

AI总结 本文提出了一种结构化递归混合器架构,能够在训练时实现序列并行表示与推理时的递归表示之间的代数转换,从而在不依赖专用内核或设备特定内存管理的情况下提高训练效率、输入信息容量和推理吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28464 2026-07-31 cs.CV 新提交

Can Vision-Language Models Reason about AI Edits in Images?

视觉-语言模型能否对图像中的AI编辑进行推理?

Darsha Udayanga, Pin-Yu Chen, Payel Das, Qiang Ji

机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院) IBM Research(IBM研究院)

AI总结 本研究探究能否用强化学习而非显式推理监督训练视觉-语言模型推理AI图像编辑,提出基于GRPO的框架,引入eff-IoU指标,在多数据集上实现与SOTA相当的检测定位性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20440 2026-07-30 cs.LG cs.AI math.RA 版本更新

Exact Symmetry as Algebra: A Machine-Verified Tensor Calculus that Enforces Physical Selection Rules

群代数张量:可证明最优的等变学习与物理对称性发现

Paulina Hoyos, Shashanka Ubaru, Dongsung Huh, Vasileios Kalantzis, Kenneth L. Clarkson, Misha Kilmer, Haim Avron, Lior Horesh

机构 * UT Austin(得克萨斯大学奥斯汀分校) IBM Research(IBM研究院) Independent(独立) Tufts University(塔夫茨大学) Tel-Aviv University(特拉维夫大学)

AI总结 本文提出了一种群代数张量框架,通过将有限群G的乘法规则引入张量代数,使等变性成为代数属性而非架构限制。该框架基于三个理论支柱:(i) Eckart-Young最优性保证的星G-SVD;(ii)通过Kronecker分解组合多个对称性;(iii)600行的Lean4形式化证明。该框架提供了等变神经网络无法实现的能力:每个预测的闭式分解和数据驱动发现最佳对称群。在QM9分子几何上,通过八面体子群恢复角动量选择规则,展示了数据驱动的物理发现。

详情

展开后加载摘要…

URL PDF HTML 收藏