arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-24 至 2026-08-24 共收录 6 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 6 篇

2505.11924 2026-08-24 cs.CL cs.AI cs.LG 版本更新 82%

Explaining Intrinsic Moral Self-Correction with Mechanistic Interpretability

大语言模型中的内在自我修正:通过机制可解释性实现可解释的提示

Yu-Ting Lee, Fu-Chieh Chang, Yu-En Shu, Hui-Ying Shih, Pei-Yuan Wu

机构 * Graduate Institute of Communication Engineering, National Taiwan University, Taipei, Taiwan(通讯工程研究院,国立台湾大学) MediaTek Research, Taipei, Taiwan(联发科研究,台北,台湾) Department of Electrical Engineering, National Taiwan University, Taipei, Taiwan(电气工程系,国立台湾大学) Department of Electrical Engineering, National Tsing Hua University, Hsinchu, Taiwan(电气工程系,国立清华大学) AI Research Center (AINTU), National Taiwan University, Taipei, Taiwan(人工智能研究中心(AINTU),国立台湾大学)

专题命中 复杂问题求解 :self-correction(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究通过机制可解释性揭示大语言模型中内在自我修正的机制,证明提示引导隐藏表示偏移是其核心驱动因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20887 2026-08-24 cs.CL cs.AI 新提交 81%

KREL: Automatic Medical Coding via Knowledge-Guided Reasoning over Clinical Evidence with LLMs

KREL:基于大型语言模型对临床证据进行知识引导推理的自动医学编码方法

Xubin Chen, Yipeng Zhou, Wen Sun, Chengkai Huang, Xiaoming Fu, Quan Z. Sheng

机构 * The University of New South Wales(新南威尔士大学) University of Göttingen(哥廷根大学) Macquarie University(麦考瑞大学) Beijing Intelligent Decision Medical Technology Co. Ltd(北京智决医疗科技有限公司)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究提出KREL框架,将LLM与ICD编码指南知识结合解决自动医学编码问题,在基准数据集上性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20814 2026-08-24 cs.CV 新提交 78%

Enhancing Localized Reasoning for Long Video Understanding via Efficient Segment-to-Video Supervision

通过高效的段级到视频级监督增强长视频理解的局部推理能力

Beibei Zhang, Chao Xu, Jun Lan, Zongyi Li, Lai Wei, Huijia Zhu, Tongwei Ren

机构 * Ant Group(蚂蚁集团)

专题命中 复杂问题求解 :reasoning(title,abstract)

AI总结 针对长视频理解中MLLMs易受干扰噪声影响的问题,提出S2V方法,通过段级VQA训练模型,提升了LVU性能与训练推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20341 2026-08-24 cs.AI cs.SE 新提交 57%

SDAD: Spec-Driven Agentic Development for the AI-Native SDLC

SDAD:面向AI原生软件开发生命周期的规范驱动智能体开发

Vu Hung Nguyen, Thanh Nguyen

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 该研究提出规范驱动智能体开发(SDAD)模型,对比传统敏捷开发,扩展团队角色、量化治理等,论证智能体开发需将工程规范转移至上游规范环节。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09044 2026-08-24 cs.CL 版本更新 57%

Tree-of-Experience: Hierarchical Experience Management for Self-Evolving Agents

经验树:面向自我进化智能体的分层经验管理

Zihao Deng, Yining Zhu, Leiming Wang, Junbo Wang, Jingfei Lu

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 该研究提出经验树(ToE)框架,将经验组织与LLM智能体分层推理对齐,在“24点游戏”和“金融进化基准”上大幅提升了解题性能与效率,解决了现有经验表示与推理过程脱节的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00424 2026-08-24 cs.AI 版本更新 57%

Weak Critics Make Strong Learners: On-Policy Critique Distillation for Scalable Oversight

弱批评者造就强学习者:用于可扩展监督的在策略批评蒸馏

Can Jin, Jiakang Li, Rui Wu, Eddy Z. Zhang, Dimitris N. Metaxas

机构 * University of Cambridge(剑桥大学) University of California, Berkeley(加州大学伯克利分校) UC Berkeley AI Lab(加州大学伯克利分校人工智能实验室)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 提出在策略批评蒸馏(OPCD)方法,利用弱模型作为批评者提供修订方向,通过自适应自教师信号蒸馏批评引导的行为,提升强模型在推理和对齐基准上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏