arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

大厂专区

2026-04-28 至 2026-04-28 共收录 11
2604.09388 2026-04-28 cs.SE cs.AI

The AI Codebase Maturity Model: From Assisted Coding to Fully Autonomous Systems

AI代码库成熟度模型:从辅助编码到完全自主系统

Andy Anderson

机构 * IBM Research — Hybrid Cloud and AI Platform(IBM混合云和人工智能平台研究院)

AI总结 本文提出AI代码库成熟度模型(ACMM),通过100天经验报告和Hive系统验证,展示代码库从基础AI辅助到完全自主的六级进化框架,强调测试覆盖率和反馈机制是关键因素。

Comments 30 pages, 7 tables. v2: Extended to 6 levels. Added Level 6 (Fully Autonomous), Hive reference implementation, Beads for agent memory continuity, throughput acceleration data. Metrics updated to 100 days. Source: https://github.com/kubestellar/console and https://github.com/kubestellar/hive

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08484 2026-04-28 cs.AI

Patching LLM Like Software: A Lightweight Method for Improving Safety Policy in Large Language Models

像软件一样修补大语言模型:一种轻量级方法用于改进大语言模型的安全策略

Huzaifa Arif, Keerthiram Murugesan, Ching-Yun Ko, Pin-Yu Chen, Payel Das, Alex Gittens

机构 * Rensselaer Polytechnic Institute(拉特格斯理工学院) IBM Research(IBM研究院)

AI总结 本文提出了一种轻量级方法,通过在现有模型前添加可学习的前缀来快速修复大语言模型的安全漏洞,该方法在毒性缓解、偏见减少和有害性拒绝等关键领域实现了与新一代安全对齐模型相当的安全提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22709 2026-04-28 cs.CL

Thinking Without Words: Efficient Latent Reasoning with Abstract Chain-of-Thought

无需言语的思考:通过抽象链式推理实现高效潜在推理

Keshav Ramji, Tahira Naseem, Ramón Fernandez Astudillo

机构 * IBM Research AI(IBM人工智能研究院)

AI总结 本文提出Abstract Chain-of-Thought,通过离散潜在推理机制在训练后实现高效推理,减少推理token数量同时保持性能,发现抽象词汇的幂律分布。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12373 2026-04-28 cs.CL

Masked by Consensus: Disentangling Privileged Knowledge in LLM Correctness

被共识掩盖:在LLM正确性中解构特权知识

Tomer Ashuach, Shai Gretz, Yoav Katz, Yonatan Belinkov, Liat Ein-Dor

机构 * Technion – Israel Institute of Technology(技术学院–以色列理工学院) IBM Research(IBM研究院) Kempner Institute, Harvard University(哈弗大学凯普纳研究所)

AI总结 研究探讨大语言模型是否具备类似人类的内部状态评估正确性知识,通过自代表和外部模型对比发现,在分歧子集上,自代表在事实任务中表现更优,但数学推理中无优势。

Comments Accepted to ACL 2026 (Main Conference). 8 pages, 16 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00127 2026-04-28 cs.SE cs.AI cs.PL

Generating Verifiable Chain of Thoughts from Exection-Traces

从执行轨迹生成可验证的推理链

Shailja Thakur, Vaibhav Saxena, Rohan Kulkarni, Shivdeep Singh, Parameswaran Selvam, Hima Patel, Hiroshi Kanayama

机构 * IBM Research, India(印度IBM研究院) IBM Research, Japan(日本IBM研究院)

AI总结 本文提出通过生成执行轨迹验证的推理链,提升模型在代码推理和生成中的准确性,实验显示验证质量显著提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04118 2026-04-28 cs.LG stat.ML

Guided Speculative Inference for Efficient Test-Time Alignment of LLMs

引导推测推断用于大型语言模型的高效测试时间对齐

Jonathan Geuter, Youssef Mroueh, David Alvarez-Melis

机构 * Harvard SEAS(哈佛大学SEAS学院) Kempner Institute(Kempner研究所) IBM Research(IBM研究院)

AI总结 本文提出引导推测推断(GSI),通过结合软最佳n次测试时间缩放、奖励模型和小型辅助模型的推测样本,提高大语言模型的奖励引导解码效率,并在多个基准测试中实现更高的准确性和更低的延迟。

Comments 41 pages, 11 figures. Published at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15155 2026-04-28 cs.LG cs.AR math.OC

On the Convergence Theory of Pipeline Gradient-based Analog In-memory Training

关于管道梯度基类比在内存训练的收敛理论

Zhaoxian Wu, Quan Xiao, Tayfun Gokmen, Hsinyu Tsai, Kaoutar El Maghraoui, Tianyi Chen

机构 * Cornell University(康奈尔大学) IBM Research(IBM研究院) Rensselaer Polytechnic Institute(拉特格斯理工学院)

AI总结 本文研究了异步管道并行在类比在内存计算硬件上进行多层深度神经网络训练的收敛性,证明了Analog-SGD-AP在迭代复杂度上与数字SGD和同步管道SGD相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23446 2026-04-28 cs.AI

IndustryAssetEQA: A Neurosymbolic Operational Intelligence System for Embodied Question Answering in Industrial Asset Maintenance

IndustryAssetEQA: 一种用于工业资产维护中具身体验问答的神经符号操作智能系统

Chathurangi Shyalika, Dhaval Patel, Amit Sheth

机构 * Artificial Intelligence Institute, University of South Carolina(南卡罗来纳大学人工智能研究所) University of South Carolina(南卡罗来纳大学) IBM Yorktown(IBM约克镇分公司) Indian AI Research Organization(印度人工智能研究组织)

AI总结 本文提出IndustryAssetEQA系统,结合事件 telemetry 表示与FMEA-KG知识图谱,提升工业资产问答的结构有效性、反事实准确性及解释蕴含性,减少专家评估的过度声称。

Comments 20 pages, 4 figures, 4 tables, Accepted for the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026) Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23027 2026-04-28 cs.AI

A Systematic Approach for Large Language Models Debugging

大语言模型调试的系统方法

Basel Shbita, Anna Lisa Gentile, Bing Zhang, Sungeun An, Shailja Thakur, Shubhi Asthana, Yi Zhou, Saptha Surendran, Farhan Ahmed, Rohan Kulkarni, Yuya Jeremy Ong, Chad DeLuca, Hima Patel

机构 * IBM Research(IBM研究院)

AI总结 本文提出系统化方法用于大语言模型调试,通过统一评估、可解释性和错误分析,帮助开发者迭代诊断模型弱点,优化提示和参数,并适应数据进行微调或评估,尤其在缺乏标准化基准时仍有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22817 2026-04-28 eess.AS cs.CL cs.LG cs.SD

In-Sync: Adaptation of Speech Aware Large Language Models for ASR with Word Level Timestamp Predictions

In-Sync: 语音感知大语言模型在ASR中的适应性改进:基于词级时间戳预测

Xulin Fan, Vishal Sunder, Samuel Thomas, Mark Hasegawa-Johnson, Brian Kingsbury, George Saon

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) IBM Research(IBM研究院)

AI总结 本文提出通过词级时间戳预测提升ASR性能,采用轻量训练策略增强对齐鲁棒性,实验证明在多个数据集上提升了时间戳准确性和整体ASR表现。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12938 2026-04-28 cs.LG physics.ao-ph

Local Off-Grid Weather Forecasting with Multi-Modal Earth Observation Data

本地非网格天气预报与多模态地球观测数据

Qidong Yang, Jonathan Giezendanner, Daniel Salles Civitarese, Johannes Jakubik, Eric Schmitt, Anirban Chandra, Jeremy Vila, Detlef Hohl, Chris Hill, Campbell Watson, Sherrie Wang

机构 * Massachusetts Institute of Technology(麻省理工学院) IBM Research(IBM研究院) Shell Information Technology International Inc.(壳牌信息技术国际公司)

AI总结 本文提出一种多模态Transformer模型,通过端到端训练将网格化预报降尺度至非网格位置,提升局部天气预测精度,实验显示其优于多种非数据驱动和数据驱动的非网格预报方法。

详情

展开后加载摘要…

URL PDF HTML 收藏