arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-27 至 2026-08-27 共收录 28 信号源:cs.CL, cs.AI, cs.LG

1. 其他推理 28 篇

2601.03542 2026-08-27 cs.CL cs.AI 版本更新 84%

Layer-Order Inversion: Rethinking Latent Multi-Hop Reasoning in Large Language Models

层序倒置:重新思考大语言模型中的潜在多跳推理

Xukai Liu, Ye Liu, Jipeng Zhang, Yanghai Zhang, Kai Zhang, Qi Liu

机构 * State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室) University of Science and Technology of China(中国科学技术大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本文提出"层序倒置"现象,通过概率性回忆与提取框架解释大语言模型中多跳推理的机制,揭示了层序倒置与总跳步数的关系,并提供了多跳失败的诊断方法。

Comments 16 pages, 18 figures, EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21054 2026-08-27 cs.AI cs.CL 版本更新 81%

Reasoning or Rambling? Exploring the Effect of Thinking on Agent Persuasion

推理还是漫谈?探究思考过程对智能体说服能力的影响

Haodong Zhao, Jidong Li, Zhaomin Wu, Tianjie Ju, Zhuosheng Zhang, Bingsheng He, Gongshen Liu

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) National University of Singapore(新加坡国立大学) Inner Mongolia Research Institute, Shanghai Jiao Tong University(上海交通大学内蒙古研究院)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文对比通用LLM与LRM,发现推理对智能体说服能力存在二元性影响,还揭示其依赖表面线索的漏洞,提出提示级对抗性论点检测方法以提升鲁棒性。

Comments Accepted as EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25215 2026-08-27 cs.AI cs.MA q-bio.QM 新提交 79%

Federation Is Nearly Free, Reasoning Is Not: Tradeoffs for AI Co-Scientists in Protein Characterization Workflows

联合近乎免费,推理并非如此:AI 联合科学家在蛋白质表征工作流中的权衡

Maia Kapur, Timothy Boe, Abby Jerger, Paul Rigor

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 该研究在生产级科学智能体平台上,对比联合拓扑、PPO策略及不同LLM等,发现LLM选择对蛋白质表征预测质量影响最大,PPO策略成本低且一致性好,联合对性能影响可忽略,为科学工作流智能体部署提供了指导。

Comments 24 Pages, 4 main figures, 5 main tables, 2 supplementary figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24001 2026-08-27 cs.AI 版本更新 79%

Diverse by Reasoning: Harnessing the Wisdom of LLM Crowds for Future Prediction

通过推理实现多样性:利用大语言模型群体的智慧进行未来预测

Nirupam Chetlapalli, Yiming Liao, Min-Chun Chen, Keke Chen

机构 * University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 该研究提出感知行为框架构建多样化LLM群体,用K-means++聚类选代表,三模型群体预测性能优于全部25模型的投票,降本提效,凸显群体构成与代表性多样性的重要性。

Comments 13 pages, 4 figures, 5 tables. Submitted to IEEE BigData 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22775 2026-08-27 cs.CL cs.SE 版本更新 79%

Scalable Supervision for Software Agents via Patch Reasoning

基于补丁推理的软件智能体可扩展监督

Junjielong Xu, Boyin Tan, Xiaoyuan Liu, Chao Peng, Pengfei Gao, Pinjia He

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen(数据科学学院,香港中文大学(深圳)) ByteDance(字节跳动)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL

AI总结 针对现有基于测试的软件智能体监督可扩展性不足的问题,提出R4P推理方法,在SWE-bench补丁验证中准确率达72.2%,训练的Mini-SE在Pass@1上较Qwen3-32B提升10.0%至26.2%。

Comments EMNLP'26 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24952 2026-08-27 cs.CL cs.AI cs.LG 新提交 67%

The Dialect Tax: Dialectal Biases Persist throughout the Language Modeling Pipeline

方言税:方言偏见在语言建模流程中持续存在

Elle

机构 * University of Oxford(牛津大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究在自然语言处理全流程追踪“方言税”,发现现代语言模型在分词、预训练等各环节均存在方言偏见,且字符级分词器无法消除相关差距,方言税由流程各环节共同累积而成。

Comments To be published at EMNLP 2026 under the full author name "Elle"

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05393 2026-08-27 cs.CV 版本更新 67%

PreResQ-R1: Response-Preference Disentangled Ranking-and-Scoring Reinforcement Optimization for Robust Visual Quality Assessment

PreResQ-R1:用于鲁棒视觉质量评估的响应偏好解耦排序与评分强化优化

Zehui Feng, Weichuan Wang, Xiaohan Chen, Ting Han

机构 * Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学)

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract)

AI总结 本文提出PreResQ-R1框架,通过解耦响应偏好的强化学习统一评分与排序目标,结合GRPO优化,在IQA和VQA基准上取得最优结果,推理轨迹更贴合人类感知。

Comments 27 pages, 16 figures, Accepted as EMNLP 2026 conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25277 2026-08-27 cs.CL cs.AI 新提交 62%

Routed Graph Handoff: Adaptive Format Selection for Multi-Agent LLM Delegation

路由图交接:多智能体大语言模型委派的自适应格式选择

Pratyay Banerjee, Ankit Chadha

机构 * Amazon(亚马逊)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究针对多智能体 LLM 协调的高 token 开销问题,提出路由图交接方法,通过轻量级 LLM 路由器在图与自然语言间自适应选择,在多基准测试中实现性能提升或持平,且开销极低。

Comments Accepted in EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25243 2026-08-27 cs.CL cs.LG 新提交 62%

From Memorization to Absorption: Mixed-Policy RL for Continual Knowledge Injection

从记忆到吸收:用于持续知识注入的混合策略强化学习

Zhibo Hou, Fan Zhao, Zhiyu An, Wan Du

机构 * University of California, Merced(加州大学默塞德分校)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 针对大语言模型持续知识注入中监督微调泛化不足的问题,提出三阶段自学习框架GRIN,其核心为混合策略RL算法Golden-GRPO,引入两个基准验证,结果表明GRIN性能优于SFT及混合策略RL基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25123 2026-08-27 cs.CL cs.AI 新提交 62%

SelfGraphRAG: Bridging the Supervision Gap in Graph-Based RAG with Synthetic QA Generation

SelfGraphRAG:通过合成问答对弥合基于图的检索增强生成(RAG)中的监督缺口

Ben Lagnese, Manas Gaur

机构 * University of Maryland, Baltimore County (UMBC)(马里兰大学巴尔的摩县分校)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 SelfGraphRAG框架通过从知识图谱结构生成问答对训练查询条件图检索器,解决新建图谱缺乏标注数据的问题,在多跳问答等任务中提升了检索与推理性能。

Comments 16 pages, 2 figures. Based on M.S. thesis work. Thesis available at this https URL (https://www.proquest.com/docview/3350071346). Under review. Code available upon request from manas@umbc.edu

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21727 2026-08-27 cs.LG cs.AI 版本更新 62%

Reinforcement Learning on Benign Facts Amplifies Leakage of Memorized Private Data

基于良性事实的强化学习会放大模型对已记忆私人数据的泄露

Renfei Zhang, Niloofar Mireshghallah

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 该研究发现,基于良性事实的强化学习可放大指令模型对已记忆个人身份信息的泄露,且推理能力与拒绝率得以保留,为攻击者提供了无需接触私人数据即可提取的途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11632 2026-08-27 cs.CL cs.AI 版本更新 62%

Macro: Enhancing Multilingual Counterfactual Explanations through Alignment-as-Preference Optimization

Macro: 通过偏好对齐优化提升多语言反事实解释

Yilong Wang, Qianli Wang, Bohao Chu, Yihong Liu, Jing Yang, Simon Ostermann

机构 * Technische Universität Berlin(柏林技术大学) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心) University of Duisburg-Essen(杜伊斯堡- Essen大学) LMU Munich(慕尼黑大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Saarland Informatics Campus(萨尔兰州信息学校区) BIFOLD – Berlin Institute for the Foundations of Learning and Data(柏林学习与数据基础研究院) Centre for European Research in Trusted AI (CERTAIN)(可信人工智能欧洲研究中心)

专题命中 其他推理 :chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Macro框架,通过直接偏好优化改进多语言反事实解释,提升有效性的同时保持最小性,避免翻译基线的严重最小性问题,并在多个指标上优于监督微调方法。

Comments Camera-ready version accepted to EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21852 2026-08-27 cs.LG cs.AI 版本更新 62%

A Comedy of Estimators: On KL Regularization in RL Training of LLMs

估计器的喜剧:关于在LLM训练中的KL正则化

Vedant Shah, Johan Obando-Ceron, Vineet Jain, Brian Bartoldson, Bhavya Kailkhura, Sarthak Mittal, Glen Berseth, Pablo Samuel Castro, Yoshua Bengio, Esmeralda S. Whitammer, Moksh Jain, Siddarth Venkatraman, Aaron Courville

机构 * McGill University(麦吉尔大学) LawZero(法零) LLNL(劳伦斯利弗莫尔国家实验室) University of Edinburgh(爱丁堡大学) CIFAR AI Chair(CIFAR人工智能主席) CIFAR Fellow

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了在LLM训练中使用KL正则化的估计器方法,分析了不同配置对训练稳定性及下游性能的影响,发现偏导数估计器可能导致训练不稳定,而无偏导数估计器能提升模型在领域内外任务的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16899 2026-08-27 cs.LG cs.AI 版本更新 62%

Epistemic Memory: A Validity Layer for Self-Maintaining Intelligent Systems

认知记忆:自维持智能系统的有效性层

Pin-Han Ho, Limei Peng, Yiming Miao, Yan Jiao

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文针对AI记忆机制忽略知识有效性条件导致语义坐标漂移的问题,提出认知记忆作为有效性维护层,引入OBM架构,实验表明其可提升智能体在变化观测条件下的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25960 2026-08-27 cs.AI 新提交 57%

LivingRAG: Augmenting Graph RAG with Experience

LivingRAG:用经验增强图检索增强生成(Graph RAG)

Yuzhuo Cui, Zongye Zhang, Qingjie Liu

机构 * Beihang University(北京航空航天大学) Hangzhou Innovation Institute, Beihang University(北京航空航天大学杭州创新研究院)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出具备可复用推理经验的LivingRAG框架,通过在Graph RAG中添加可写入经验存储,提升多跳问答准确率并减少完成令牌使用量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25935 2026-08-27 cs.CV cs.AI 新提交 57%

TAU-Agent: An Agentic Retrieval-Augmented Framework for Traffic Anomaly Understanding

TAU-Agent:用于交通异常理解的智能体式检索增强框架

Yuqiang Lin, Yan Shi, Sam Lockyer, Harish Tayyar Madabushi, Adrian Evans, Wenbin Li, Yinhai Wang, Nic Zhang

机构 * University of Bath(巴斯大学) University of Washington(华盛顿大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 针对交通异常理解需求,提出TAU-Agent智能体式检索增强框架,调度两类视觉工具获取证据,结合微调视觉语言模型推理,在AI City 2026挑战赛多赛道取得对应排名成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25577 2026-08-27 cs.DB cs.AI 新提交 57%

PolyMemDB: A Polyglot Database System for AI Memory Management

PolyMemDB:一款面向AI记忆管理的多语言数据库系统

Yu Wang, Jiaheng Lu

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 针对现有智能体记忆系统的存储碎片化与事实冲突问题,推出PolyMemDB多语言数据库系统,通过多语言存储架构与概率推理引擎管理智能体记忆,以减少LLM幻觉并提升个性化体验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25399 2026-08-27 cs.AI 新提交 57%

Can your AI agent be cheaper? Investigating the effects of task specifications on token spend in agentic coding tasks

你的AI智能体能更便宜吗?探究智能体编码任务中任务规格对token消耗的影响

Jakub Smékal

机构 * Stanford University(斯坦福大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文以Kimi K3模型为对象,探究智能体编码任务中任务规格对token消耗的影响,发现简化任务规格会提升token消耗,拟合的预测器可较优地预测token消耗,为评估AI编码工作流成本提供方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25276 2026-08-27 cs.CL 新提交 57%

Groundhog Bit-Flip Attack: Seeding Infinite Generation Loops in Mixture-of-Experts LLMs through Bit Flips

土拨比特翻转攻击:通过比特翻转在混合专家大语言模型中植入无限生成循环

Huakang Lin, Tiancheng Zheng, Mingxuan Sun, Tianhong Xu, Fan Zhang, Yunsi Fei, Ruyi Ding

机构 * Louisiana State University(路易斯安那州立大学) Northeastern University(东北大学) Zhejiang University(浙江大学) University of California, Los Angeles(加利福尼亚大学洛杉矶分校) Southeast University(东南大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 本研究提出首个针对混合专家大语言模型的土拨比特翻转攻击,通过翻转路由层相关比特,可使平均输出膨胀率达5912%,揭示了MoE架构的鲁棒性漏洞。

Comments 9 pages, 3 figures; Accepted at EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24902 2026-08-27 cs.HC cs.AI 新提交 57%

Beyond the Chatbot: Co-Learning and Co-Teaching through a Dual-Persona Generative-AI Assistant

超越聊天机器人:通过双角色生成式AI助手实现共学与共教

Chaido Mizeli, Marina Delianidi, Konstantinos Diamantaras

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 该研究开发一款适配希腊教育领域的双角色生成式AI助手,可切换教学/学习角色,支持师生共学共教,构建了连接技术与课程的教学生成助手框架。

Comments 14 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19872 2026-08-27 cs.AI 版本更新 57%

Simulated Self-Assessment in Large Language Models: A Psychometric Approach to AI Self-Efficacy

大语言模型的模拟自我评估:一种心理测量方法用于AI自我效能

Daniel I Jackson, Emma L Jensen, Syed-Amad Hussain, Emre Sezgin

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文通过心理测量方法评估大语言模型的自我效能,发现模型自我评估与实际表现不一致,且不同任务表现差异显著。

Comments 30 pages,7 tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25770 2026-08-27 cs.MA 新提交 50%

HypoForge: A Self-Improving Multi-Agent Framework for Automated Hypothesis Generation and Testing via Scientific Skill Learning

HypoForge:一种通过科学技能学习实现自动假设生成与测试的自改进多智能体框架

Ziqing Qian, Jiaying Lei, Yifang Wang, Nan Cao

专题命中 其他推理 :reasoning(abstract)

AI总结 提出HypoForge多智能体框架,通过匹配阶段特定监督的技能学习策略,无需微调基础模型即可实现自改进,在相关基准上优于现有框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25729 2026-08-27 cs.CV 新提交 50%

LongVU-TTT: Causal Test-Time Training for Visual Resampling in Long Video Understanding

LongVU-TTT:用于长视频理解中视觉重采样的因果测试时训练方法

Mahmoud Ahmed, Sameh Abdulah, Olatunji Ruwase, Sam Ade Jacobs, Mathis Bode, Mohamed Elhoseiny

机构 * KAUST(阿卜杜拉国王科技大学) Snowflake(雪花公司) Microsoft Inc.(微软公司) Jülich Supercomputing Centre, Forschungszentrum Jülich(于利希研究中心于利希超级计算中心)

专题命中 其他推理 :reasoning(abstract)

AI总结 LongVU-TTT在视觉编码器与LLM间插入带因果快速权重更新的卷积TTT重采样器,通过混合选择器保留帧证据,在五个视频理解基准测试中性能具竞争力,较多种基线方法有明显提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25381 2026-08-27 cs.IR 新提交 50%

MOTIF: Motivation-guided Topology Inference for Cold-start Multimodal Recommendation

MOTIF:面向冷启动多模态推荐的动机引导拓扑推断

Yurui Shi, Yuchen Miao, Ximing Hu, Zijun Wang, Chang Han

专题命中 其他推理 :reasoning(abstract)

AI总结 针对冷启动多模态推荐的三大耦合挑战,提出MOTIF框架,整合四类技术实现拓扑推断,在三个多模态基准上较各类基线取得最高6.07%的相对提升。

Comments 15 pages, 3 figures, 7 tables. Accepted at WISE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25361 2026-08-27 cs.CY 新提交 50%

Toward a Threat Actor Profiling Taxonomy for Pre-Release Risk Management of Open-Weight Frontier Models

面向开放权重前沿模型预发布风险管理的威胁行为者画像分类学

James Zhang

专题命中 其他推理 :reasoning(abstract)

AI总结 本研究提出含六大属性的威胁行为者画像分类学,作为开放权重前沿模型预发布风险管理的研究基础设施,以明确对手特征,支撑可解释、可比且忠实于目标风险的评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25332 2026-08-27 cs.CV 新提交 50%

Not All Attention Heads Contribute to Critical Visual Token Selection: Head-Aware Pruning Matters More

并非所有注意力头都有助于关键视觉标记选择:头感知剪枝更重要

Chaofang Ma, Lin Jiang, Carol Jingyi Li, Xingyu Liu, Zeyu Li, Jiang Xu, Wei Zhang

机构 * The Hong Kong University of Science and Technology(香港科技大学) Northeastern University(东北大学)

专题命中 其他推理 :reasoning(abstract)

AI总结 本文针对视觉-语言模型推理效率问题,提出无需训练的渐进式视觉标记剪枝框架ProViP,利用关键注意力头提升剪枝效果,在LLaVA-1.5-7B上实现高剪枝率下的性能保留与推理加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25168 2026-08-27 cs.CV cs.MM 新提交 50%

See More, Detect Less? Taming Information Leakage in Multi-View Anomaly Detection

看得更多,检测得更少?抑制多视图异常检测中的信息泄漏

Shang-Fu Chen, Kuan-Chuan Peng, Jhih-Ciang Wu, Wen-Huang Cheng, Kai-Lung Hua

机构 * National Taiwan University(台湾大学) Mitsubishi Electric Research Laboratories (MERL)(三菱电机研究实验室) National Taiwan Normal University(台湾师范大学) VinUniversity Microsoft Taiwan Corporation(微软台湾公司) National Taiwan University of Science and Technology(台湾科技大学)

专题命中 其他推理 :reasoning(abstract)

AI总结 该研究针对多视图异常检测中的跨视图信息泄漏问题,提出GLAD框架,结合视觉基础模型特征与MMA、OGA模块,在Real-IAD等数据集上优于现有最优方法,证实信息限制的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08462 2026-08-27 cs.CR cs.PL cs.SE 版本更新 50%

QLCoder: A Query Synthesizer For Static Analysis of Security Vulnerabilities

QLCoder:一种用于静态分析安全漏洞的查询生成器

Claire Wang, Ziyang Li, Saikat Dutta, Mayur Naik

专题命中 其他推理 :reasoning(abstract)

AI总结 QLCoder通过结合LLM与执行反馈,利用MCP接口生成有效的安全查询,有效检测漏洞。在111个Java项目中,53.4%的CVE被正确识别,优于仅使用Claude Code的10%。

详情

展开后加载摘要…

URL PDF HTML 收藏