arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-13 至 2026-08-13 共收录 108 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 29 篇

2608.12197 2026-08-13 eess.SY cs.AI cs.SY 新提交 57%

NetlistBench: Evaluating LLM Reliability in SPICE Netlist Recognition and Manipulation

NetlistBench:评估大型语言模型在SPICE网表识别与操作中的可靠性

Jiarui Ma, Jianghan Wang, Yuheng Ma, Ziyi Zhuang, Xiaoguang Liu

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究针对LLMs在SPICE网表识别与操作中的可靠性,构建含2342个案例的NetlistBench基准,发现其性能随结构复杂度变化,为电路设计自动化提供关键瓶颈参考。

Comments accepted by MLCAD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12129 2026-08-13 cs.CL 新提交 57%

SAG: SQL-Retrieval Augmented Generation with Query-Time Dynamic Hyperedges

SAG:基于查询时动态超边的SQL检索增强生成

Yuchao Wu, Junqin Li, XingCheng Liang, Yongjie Chen, Yinghao Liang, Linyuan Mo, Guanxian Li

机构 * Zleap AI(智量科技)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本研究提出SAG(SQL检索增强生成)架构,通过查询时动态超边实现结构化检索,在HotpotQA等多跳问答基准上性能优于基线,为LLM智能体处理组织知识提供了新方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11741 2026-08-13 cs.CV cs.AI 新提交 57%

JieZi: A Large-Scale Expert-Audited Dataset and Benchmark for Ancient Chinese Character Exegesis

JieZi:用于古文字训诂的大规模专家审核数据集与基准

Ran Li, Huiguo He, Jiahuan Cao, Junle Liu, Hiuyi Cheng, Lianwen Jin

机构 * South China University of Technology(华南理工大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文针对古文字训诂研究缺乏结构化数据与基准的问题,提出ACCE任务,构建JieZi-Dataset与JieZi-Bench,实验发现多模态大模型在古文字训诂的高阶任务上表现不佳,微调后性能显著提升。

Comments 19 pages, 13 figures. Accepted to the Dataset Track of ACM Multimedia 2026 for oral presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11679 2026-08-13 cs.AI cs.IR cs.MA 新提交 57%

AgenticTwin: An Agentic LLM Framework Integrated with Digital Twin for Anomaly Detection

AgenticTwin:集成数字孪生的智能体大语言模型异常检测框架

Touseef Hasan, Mounika Ghanta, Souvika Sarkar, Ujjwal Guin

机构 * School of Computing, Wichita State University(威奇托州立大学计算机学院) Auburn University(奥本大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出AgenticTwin框架,整合LLM推理与数字孪生异常检测管道,构建基准评估管道并验证轻量级开源LLM部署可行性,可提升异常诊断、检索及缓解质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11584 2026-08-13 cs.AI 新提交 57%

EnterpriseRAG: Benchmarking LLM Instruction Adherence and Robustness under Non-Ideal Enterprise Retrieval

EnterpriseRAG:非理想企业检索场景下LLM指令遵循与鲁棒性的基准测试

Huiqi Miao, Xinbao Sun, Bo Wang, Fanyu Meng, Lijun Mei, Na Wu, Di Jin, Chao Deng, Junlan Feng

机构 * Jiutian Research, China Mobile(中国移动九天研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究针对企业RAG部署的可靠性问题,推出含983个样本的EnterpriseRAG基准,评估13个LLM发现其指令遵循崩溃,为生产级RAG提供可复现的评估基础

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10584 2026-08-13 cs.AI cs.DL 版本更新 57%

HexEval: An Evidence-Driven Hexagonal Framework for Multidimensional Scholar Assessment

HexEval:一种用于多维学者评估的证据驱动六边形框架

Xiaokang Qu, Yiting Lin

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出HexEval框架,将学者评估构建为证据驱动的推理问题,通过内在与外部两个互补证据层评估,实现可解释可审计的AI辅助学者评估,同时指出公开学术数据的局限性。

Comments remove copyright information

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23733 2026-08-13 cs.CL 版本更新 57%

Multimodal QUD: Inquisitive Questions from Scientific Figures

多模态QUD:来自科学图表的探究性问题

Yating Wu, William Rudman, Venkata S Govindarajan, Alexandros G. Dimakis, Junyi Jessy Li

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Ithaca College(伊萨卡学院) UC Berkeley, BespokeLabs.ai(伯克利大学,BespokeLabs.ai)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出多模态QUD数据集,通过结合图表与文本上下文生成探究性问题,提升多模态推理能力,实现更高质量的视觉 grounding。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16179 2026-08-13 cs.CV cs.AI 57%

360° Image Perception with MLLMs: A Comprehensive Benchmark and a Training-Free Method

360度图像感知与MLLMs:一个全面的基准和无需训练的方法

Huyen T. T. Tran, Van-Quang Nguyen, Farros Alferro, Kang-Jun Liu, Takayuki Okatani

机构 * GSIS, Tohoku University(东大GSIS研究所,东京东大大学) RIKEN AIP, Japan(日本RIKEN AIP)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出360Bench基准和Free360方法,评估MLLMs在360度图像感知中的能力,揭示其不足,并提出基于场景图的无需训练框架提升VQA性能。

Journal ref ECCV2026 (Link: https://tranhuyen1191.github.io/360Bench-Free360/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12228 2026-08-13 cs.SE 新提交 50%

Towards Automated Domain Model Extraction from Source Code using Heuristics and Open-Source LLMs

基于启发式方法与开源大语言模型(LLMs)从源代码中自动提取领域模型的研究

Alessandra Mancas, Mounir Ammam, Hyacinth Ali, Kevin Delcourt, Houari Sahraoui

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出结合启发式方法与开源LLMs的自动领域模型提取方法,克服上下文限制,在10个项目数据集上获高F1分数,适用于隐私敏感的工业逆向工程场景。

Comments To appear in the Proceedings of the 29th International Conference on Model Driven Engineering Languages and Systems (MODELS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12158 2026-08-13 cs.CV 新提交 50%

Context Blindness in DPO: Mitigating Object Hallucination in MLLMs via Context-Calibrated Preference Optimization

DPO中的上下文盲区:通过上下文校准的偏好优化缓解多模态大语言模型(MLLMs)中的物体幻觉

Byungoh Ko, Jinyoung Park, Jongha Kim, Jeehye Na, Jaewon Cho, Hyunwoo J. Kim

机构 * Korea University(高丽大学) KAIST(韩国科学技术院)

专题命中 推理评测 :reasoning(abstract)

AI总结 本研究针对MLLMs的物体幻觉问题,提出C²-DPO方法,通过最大化上下文偏好增益降低幻觉率,使Qwen2-VL-Instruct-2B的幻觉率相对降低36%且不损害通用推理能力。

Comments Accepted at ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12051 2026-08-13 cs.CV 新提交 50%

Do Not Forget the Obvious - RISC: A Risk-Informed Slice-Coverage Protocol for Safe Autonomous Driving

勿忽视显而易见的内容——RISC:一种用于安全自动驾驶的风险感知切片覆盖协议

Fabian Hüger

机构 * CARIAD SE

专题命中 推理评测 :planning(abstract)

AI总结 该研究提出RISC协议,将安全问题转化为风险切片,通过风险引导选择提升自动驾驶关键故障发现率,可应用于多类自动驾驶子系统,补充现有测试验证流程。

Comments 14 pages, 3 figures, 5 tables. Accepted at the ECCV 2026 Workshop on Safe and Defensive Autonomous Driving (SDAD). Non-archival workshop paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26608 2026-08-13 cs.CV 版本更新 50%

Understanding Knowledge Transfer Mechanism in Heterogeneous MLLM Fusion: A Simple Linear Approach

理解异构多模态大语言模型(MLLM)融合中的知识迁移机制:一种简单线性方法

Yinghao Hou, Jiahe Fan, Yuanhao Pu, Zongyuan Chen, Hong Xie

专题命中 推理评测 :reasoning(abstract)

AI总结 该研究针对异构MLLM跨规模知识迁移机制,提出CDPI线性探针,经多组模型与基准测试发现,融合增益集中于高层推理,且正向迁移多发生在小比率区间。

Comments 17 pages, 6 figures; includes supplementary material. Revised presentation and terminology; results unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31591 2026-08-13 cs.CV 50%

CoFiDA-M: Concept-Aware Feature Modulation for Cross-Domain Adaptation with Image-Only Inference

CoFiDA-M: 面向仅图像推理的跨域自适应的概念感知特征调制

Nurjahan Sultana, Moi Hoon Yap, Xinqi Fan, Wenqi Lu

机构 * Department of Computing and Mathematics, Manchester Metropolitan University(计算与数学系,曼彻斯特 Metropolitan 大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 提出CoFiDA-M框架,通过特权信息学习利用临床概念(如MONET概率)指导特征调制,训练仅图像的学生模型,在跨域皮肤癌筛查中显著提升黑色素瘤召回率。

Comments 'Accepted by CVPR 2026'

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026, pp. 15060-15069

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他推理 5 篇

2608.11660 2026-08-13 cs.CL cs.AI cs.LG 新提交 67%

Hybrid-Policy Self-Editing for Composable Unstructured Knowledge Editing

用于可组合非结构化知识编辑的混合策略自编辑

Tianci Liu, Zihan Dong, Tianchun Li, Yi-Chung Chen, Qiming Cao, Xingchen Wang, Shiyang Wang, Zichen Miao, Linjun Zhang, Haoyu Wang, Jing Gao

机构 * University of Tennessee(田纳西大学) Rutgers University(罗格斯大学) Purdue University(普渡大学) University at Albany(奥尔巴尼大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究针对现有非结构化知识编辑存在的可组合性缺失问题,提出HPSE方法,通过构建混合生成结果实现主动自蒸馏,在多种LLM及编辑工具上取得即插即用的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11233 2026-08-13 cs.CL cs.AI cs.LG 新提交 67%

Retrofitting Recurrent Depth into a Pretrained Language Model: Installation, Extrapolation, Transfer, and Retention at Two Parameter Budgets

将循环深度改造融入预训练语言模型:在两个参数预算下的安装、外推、迁移与保留

Mark Shapiro

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究在Qwen2.5-0.5B-Instruct中融入循环深度,在两个参数预算下实现安装,其模型在ARC测试集等任务上性能优于同等规模基准,可外推至1.5倍监督深度,推理速度更快。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02512 2026-08-13 cs.CL cs.AI 版本更新 62%

Social Meaning in Large Language Models: Structure, Magnitude, and Pragmatic Prompting

大语言模型中的社会意义:结构、规模与语用提示

Roland Mühlenbernd

机构 * Leibniz-Centre General Linguistics, Berlin, Germany(莱布尼茨普通语言学中心,柏林,德国)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文研究大语言模型在社会意义上的表现,提出两种校准指标并探讨语用理论指导的提示策略对模型校准的影响,发现提示策略能有效减少模型在规模校准上的偏差。

Journal ref Proceedings of the 15th Workshop on Cognitive Modeling and Computational Linguistics (CMCL) @ LREC 2026, pages 162-171

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11758 2026-08-13 cs.CL 新提交 57%

AWARe: Mitigating Catastrophic Forgetting via Activation-Weighted Adaptive REtention

AWARe:基于激活加权的自适应保留缓解灾难性遗忘

Juncheng Liao, Jinfan Lv, Guoming Wang, Jupeng Zheng, Ling Xiao, Siliang Tang

机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院) School of Artificial Intelligence, Sun Yat-Sen University(中山大学人工智能学院) Graduate School of Information Science, Hokkaido University(北海道大学信息科学研究院)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 针对多模态大语言模型微调时的灾难性遗忘问题,提出无需修改架构的AWARe方法,通过激活加权控制参数更新,在保留上游能力的同时提升下游性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11676 2026-08-13 cs.AI 新提交 57%

XBridge: Entity-Grounded Latent Bridge for Heterogeneous LLM Communication

XBridge:面向异构大语言模型通信的实体锚定隐空间桥接器

Wooseong Yang, Wei-Chieh Huang, Weizhi Zhang, Yu Wang, Philip S. Yu, Junhyun Lee

机构 * Hankuk University of Foreign Studies(韩国外国语大学) Noah’s Farm(诺亚农场) University of Illinois Chicago(伊利诺伊大学芝加哥分校) Capital One AI Foundations(Capital One AI 基金会)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 XBridge是免解码的异构大语言模型通信协议,通过词汇锚定映射和隐空间丰富桥接器解决跨架构通信的实体身份丢失问题,在多模型、多基准测试中表现优于现有方法,参数开销低。

Comments 18 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏