arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 5021 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 5021 篇

2606.22870 2026-06-23 cs.CV cs.AI 新提交 81%

VideoLatent: Video-Language Learning via Latent Self-Forcing

VideoLatent: 通过潜在自强制进行视频-语言学习

Zi-Yuan Hu, Zicong Tang, Shijia Huang, Yanyang Li, Michael R. Lyu, Liwei Wang

机构 * The Chinese University of Hong Kong(香港中文大学) Weitu AI(微图AI)

专题命中 复杂问题求解 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 提出VideoLatent,一种通过潜在自强制训练范式(包括潜在对齐和潜在多样性目标)进行视觉潜在推理的多模态大语言模型,仅依赖标准视频-问答三元组,在14个基准上优于现有模型,并大幅降低训练/推理开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18572 2026-05-19 cs.CL 81%

MA$^{2}$P: A Meta-Cognitive Autonomous Intelligent Agents Framework for Complex Persuasion

MA$^{2}$P: 一种用于复杂说服的元认知自主智能体框架

Dingyi Zhang, Ziqing Zhuang, Linhai Zhang, Ziyang Gao, Deyu Zhou

机构 * School of Computer Science and Engineering, Key Laboratory of Computer Network and Information Integration, Ministry of Education, Southeast University, China(计算机科学与工程学院、计算机网络与信息集成重点实验室、教育部、东南大学,中国) Department of Informatics, King’s College London(信息学院、伦敦国王学院)

专题命中 复杂问题求解 :reasoning(abstract,abstract_cn);planning(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出MA$^{2}$P框架,通过自主多智能体架构和元认知配置器,解决复杂说服中说服者需解读内部状态、推断潜在心理状态并生成策略一致行动的挑战,提升说服成功率。

Comments 22 pages, 8 figures. Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17088 2026-05-19 cs.CL 81%

ACIL: Auto Chain of Thoughts for In-Context Learning

ACIL: 自动链式思维用于上下文学习

Rui Chu

机构 * Rui Chu(楚瑞)

专题命中 复杂问题求解 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本文提出ACIL框架,通过自动构建包含推理步骤的演示来提升上下文学习在多步推理任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22498 2026-04-27 cs.CV cs.AI 81%

CGC: Compositional Grounded Contrast for Fine-Grained Multi-Image Understanding

CGC:基于组成性 grounded 对比的细粒度多图像理解

Lihao Zheng, Zhenwei Shao, Yu Zhou, Yan Yang, Xintian Shen, Jiawei Chen, Hao Ma, Tao Wei

机构 * School of Computer Science and Technology, Hangzhou Dianzi University(杭州电子科技大学计算机科学与技术学院) School of Computer Science(计算机科学学院) Technology, Hangzhou Dianzi University(技术,杭州电子科技大学)

专题命中 复杂问题求解 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出CGC框架,通过跨图像对比和内图像对比提升多图像细粒度理解,结合规则空间奖励增强属性和对齐,实验显示在多个基准上取得最佳结果,并在多模态任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23503 2025-04-01 cs.CL 81%

Evolutionary Prompt Optimization Discovers Emergent Multimodal Reasoning Strategies in Vision-Language Models

Sid Bharthulwar, John Rho, Katrina Brown

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL;planning(comments)

Comments Published at ICLR 2025 Workshop on Reasoning and Planning for LLMs

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15113 2025-03-20 cs.AI 81%

Reasoning Effort and Problem Complexity: A Scaling Analysis in LLMs

Benjamin Estermann, Roger Wattenhofer

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI;planning(comments)

Comments Published at ICLR 2025 Workshop on Reasoning and Planning for LLMs

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22479 2026-08-25 cs.CL cs.LG 新提交 81%

GTA-RAG: Graph-Trajectory-Augmented Reinforcement Learning for Multi-Turn Retrieval-Augmented Reasoning

GTA-RAG:用于多轮检索增强推理的图轨迹增强强化学习

Jun Chen, Yongchao Liu, Pengyu Qiu, Jiajun Zheng, Juelu Zhang, Yujie Zeng, Qin Zhang, Ziyue Qiao, Xiao Luo

机构 * Shenzhen University(深圳大学) Great Bay University(大湾区大学) Ant Group(蚂蚁集团)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 GTA-RAG是一种图轨迹增强强化学习框架,通过轨迹级监督优化检索策略,在多跳和简单问答基准上,相比RL-based RAG基线提升了性能与证据链覆盖率。

Comments 11 pages, 5 figures. Accepted to EMNLP 2026 Fundings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20887 2026-08-24 cs.CL cs.AI 新提交 81%

KREL: Automatic Medical Coding via Knowledge-Guided Reasoning over Clinical Evidence with LLMs

KREL:基于大型语言模型对临床证据进行知识引导推理的自动医学编码方法

Xubin Chen, Yipeng Zhou, Wen Sun, Chengkai Huang, Xiaoming Fu, Quan Z. Sheng

机构 * The University of New South Wales(新南威尔士大学) University of Göttingen(哥廷根大学) Macquarie University(麦考瑞大学) Beijing Intelligent Decision Medical Technology Co. Ltd(北京智决医疗科技有限公司)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究提出KREL框架,将LLM与ICD编码指南知识结合解决自动医学编码问题,在基准数据集上性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14659 2026-08-18 cs.AI cs.LG cs.SE 新提交 81%

When Uncertainty Isn't Enough: An Empirical Study of Self-Correction in Code Generation

当不确定性还不够时:代码生成中自校正的实证研究

Pranav Rakasi, Maanas Lalwani, Arnav Srivastava, Arya Palanivel, Tinuade Adeleke, Ruizhe Li, Sean Wu

机构 * University of Michigan(密歇根大学) New York University(纽约大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Algoverse AI University of Aberdeen(阿伯丁大学) University of Oxford(牛津大学)

专题命中 复杂问题求解 :self-correction(title,abstract);分类 cs.AI、cs.LG

AI总结 本研究通过实证发现,针对代码生成的不确定性估计方法难以可靠提升生成准确率,仅基于验证的自校正策略可显著提升Pass@1指标,廉价不确定性估计器仅适合作为校正循环的门控信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10444 2026-08-13 cs.CL cs.AI 版本更新 81%

From Reasoning Depth to Reasoning Breadth: Evaluating Multi-Point Associative Reasoning in Large Language Models

从推理深度到推理广度:评估大型语言模型中的多点关联推理

Si'an Xie, Jiaxun Liu, Biao Yang, Wei Yuan, Fan Yang, Tingting Gao, Ming Wu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Peking University(北京大学) Kuaishou Technology(快手科技)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究构建了中英双语多点关联推理基准MPAR-Bench,发现大型语言模型的推理深度未自动带来稳健的推理广度,当前基准未充分覆盖推理广度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15062 2026-08-11 cs.CL cs.AI 版本更新 81%

SAKE: Structured Agentic Knowledge Extrapolation for Complex LLM Reasoning via Reinforcement Learning

SAKE:通过强化学习进行复杂LLM推理的结构代理知识外推

Jiashu He, Jinxuan Fan, Bowen Jiang, Ignacio Hounie, Dan Roth, Alejandro Ribeiro

机构 * University of Pennsylvania(宾夕法尼亚大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 SAKE通过强化学习训练LLM自主检索和外推结构化知识,提升生物医学和常识领域推理性能,同时减少90%以上token使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04444 2026-08-06 cs.CL cs.AI 新提交 81%

D$^2$F-ReAG: Dynamic Decomposition and Filtering for Multi-Hop Reasoning-Augmented Generation

D²F-ReAG:面向多跳推理增强生成的动态分解与过滤

Jiaoyang Li, Junhao Ruan, Shengwei Tang, Kaiyan Chang, Zhengtao Yu, Tong Xiao, Jingbo Zhu

机构 * Northeastern University(东北大学) Kunming University of Science and Technology(昆明理工大学) NiuTrans Research(NiuTrans研究院)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 针对现有检索增强生成(RAG)处理多跳问题时缺乏动态分解与有效过滤的缺陷,提出D²F-ReAG范式,通过判断根级推理可靠性自适应控制推理深度,经实验验证其处理复杂多跳问题的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04007 2026-08-05 cs.CL cs.AI 新提交 81%

TurnSight: Turn-Level Hindsight Self-Distillation for Tool-Integrated Reasoning

TurnSight:面向工具集成推理的回合级事后自蒸馏方法

Changle Qu, Sunhao Dai, Hengyi Cai, Yuqi Zhou, Xinran Chen, Simon, Jun Xu

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 针对工具集成推理中现有方法缺乏细粒度监督的问题,提出TurnSight框架,通过回合级事后自蒸馏生成可靠监督信号,在三个基准上验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03048 2026-08-05 cs.CL cs.AI 新提交 81%

PI-Mem: Pushing Long-Context Reasoning to 3.6M Tokens with Parallel-Iterative Memory

PI-Mem:通过并行迭代式记忆将长上下文推理推向360万 tokens

Dawei Liu, Haixu Song, Shuang Cheng, Shijie Wang, Haozheng Hou, Kaifeng Liu, Ermo Hua, Zhonghang Yuan, Zhijie Zhong, Yuchen Fan, Biqing Qi, Bowen Zhou

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究提出PI-Mem并行迭代记忆机制,在360万 tokens长上下文下,使Qwen系列模型在HotpotQA基准上较循环记忆基线实现准确率提升与推理加速,打破长上下文推理的准确率-效率权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01328 2026-08-04 cs.CL cs.AI cs.CV 新提交 81%

LongChart VQA: A Comprehensive Benchmark for MLLMs with Complex Multi-Chart Reasoning

LongChart VQA:面向具备复杂多图表推理能力的多模态大语言模型的综合基准

Ziyan Xiao, Yinghao Zhu, Wenting Zhang, Heaju Kim, Lequan Yu

机构 * The University of Hong Kong(香港大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 LongChart VQA是面向具备复杂多图表推理能力的MLLMs的综合基准,该基准含平均6.5张图像与31.2个问题,评估10个SOTA MLLMs发现其准确率随计算复杂性提升下降,为多图表推理研究指明方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05158 2026-08-04 cs.CL cs.AI cs.MA 版本更新 81%

Streaming Communication in Multi-Agent Reasoning

多智能体推理中的流式通信

Zhen Yang, Xiaogang Xu, Wen Wang, Cong Chen, Xander Xu, Ying-Cong Chen

机构 * HKUST(GZ)(香港科技大学(广州)) Alibaba Group(阿里巴巴集团) ZJU(浙江大学) HKUST(香港科技大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 提出流式多智能体推理系统StreamMA,通过将推理步骤实时流式传输给下游智能体来降低延迟,并意外地提升了效果,同时首次给出流式、串行和单协议三种模式的闭式联合分析。

Comments project page: https://zhenyangcs.github.io/StreamMA-website/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19345 2026-08-03 cs.CL cs.AI 版本更新 81%

Copy Less, Ground More: Overcoming Repetitive Copying in Long-Context Reasoning via Evidence-Aware Reinforcement Learning

少复制,多扎根:通过证据感知强化学习克服长上下文推理中的重复复制

Lizhe Fang, Weizhou Shen, Tianyi Tang, Yisen Wang

机构 * Peking University(北京大学) Alibaba Group(阿里巴巴集团)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 研究长上下文推理中语言模型的重复复制问题,提出GEAR奖励塑造方法,通过区分关键证据和干扰上下文来增强奖励信号,经实验验证该方法能提升模型性能,减少重复复制,凸显准确扎根证据对长上下文推理的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03595 2026-07-29 cs.AI cs.CL 版本更新 81%

Controllable LLM Reasoning via Sparse Autoencoder-Based Steering

通过稀疏自编码器基于的转向实现可控的大语言模型推理

Yi Fang, Wenjie Wang, Mingfeng Xue, Boyi Deng, Fengli Xu, Dayiheng Liu, Fuli Feng

机构 * University of Science and Technology of China(中国科学技术大学) Zhongguancun Academy(中关村学院) Alibaba Group(阿里巴巴集团) Tsinghua University(清华大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出SAE-Steering方法,通过稀疏自编码器分解隐藏状态,实现对大语言模型推理策略的高效控制,提升推理准确率和灵活性。

Comments Accepted to the ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20638 2026-07-24 cs.AI cs.AR cs.CL 新提交 81%

WaveformQA: Benchmarking LLM Temporal Reasoning on Digital Waveforms

WaveformQA:对数字波形上的大语言模型时间推理进行基准测试

Yichuan Liu, Daniel Cummings, Nick Vadlamudi

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型对数字波形的时间推理能力,提出开源问答基准WaveformQA,含360个不同难度问题,波形由开源设计生成。评估发现模型在简单查询有准确率,但复杂问题上因窗口限制等性能下降,JSON表示可提高准确率,框架支持扩展实验。

Comments 10 pages; abridged version published in IEEE International Conference on LLM-Aided Design (ICLAD), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19398 2026-07-23 cs.AI cs.CL 新提交 81%

HyGRL: Adaptive Hybrid Graph Reasoning for Multi-Entity Questions

HyGRL:用于多实体问题的自适应混合图推理

Junyi Wang

机构 * Beijing Institute of Technology(北京理工大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 针对多实体组合问题,传统方法有局限。本文提出HyGRL框架,将文本嵌入知识图谱创建异构网络,通过模仿学习和强化学习进行自适应结构归纳推理,实验证明其在答案准确性、推理保真度等方面表现出色,成本低且推理快。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14905 2026-07-21 cs.CL cs.AI 版本更新 81%

Show Me How You Reason and I'll Tell You Who You Are: Reasoning Graphs for Robust LLM Authorship Attribution

告诉我你如何推理,我就能说出你是谁:用于可靠大语言模型作者归属的推理图

Zlata Kikteva, Artur Romazanov, Annette Hautli-Janisz, Ramon Ruiz-Dolz

机构 * University of Passau(帕绍大学) University of Dundee(邓迪大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 针对LLM生成文本检测和作者归属问题,此前方法易受改写等影响。本文提出利用论证挖掘管道提取推理图的图神经网络方法,在混淆攻击及新模型版本文本评估中,相比传统基线展现更强鲁棒性和泛化能力,提升了检测准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20039 2026-07-20 cs.AI cs.LG 81%

Separable Pathways for Causal Reasoning: How Architectural Scaffolding Enables Hypothesis-Space Restructuring in LLM Agents

因果推理的可分离路径:建筑框架如何使LLM代理重构假设空间

John Alderete, Sebastian Benthall, Connie Xu, John Xing

机构 * Simon Fraser University(西蒙弗雷泽大学) International Computer Science Institute(国际计算机科学研究所) Amigo AI

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出通过建筑框架使LLM代理重构假设空间,通过实验发现上下文图和动态行为在因果推理中分别提升推理质量和有效性。

Comments 24 pages, 11 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07646 2026-07-09 cs.AI cs.CL 新提交 81%

RL Post-Training Builds Compositional Reasoning Strategies

强化学习后训练构建组合推理策略

Azwar Abdulsalam, Nishil Patel, Andrew Saxe

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 研究强化学习后训练能否组合原始技能成高级策略,通过在可观察环境实验发现,强化学习能解决预训练模型难题,通过分阶段组合机制重组能力,组合过程可复用巩固,与拒绝微调关键差异在选择性,预训练消融表明其对组合策略出现有影响。

Comments 8 pages, 6 figures. Accepted to the 2nd Workshop on Compositional Learning at ICML 2026, Seoul, South Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02504 2026-07-03 cs.CL cs.AI cs.CV 新提交 81%

Reasoning LLM Improves Speaker Recognition in Long-form TV Dramas

推理大模型提升长篇电视剧中的说话人识别

Yuxuan Li, Lingxi Xie, Xinyue Huo, Jihao Qiu, Jiacheng Shao, Pengfei Chen, Jiannan Ge, Kaiwen Duan, Qi Tian

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 提出DramaSR-532K大规模基准和基于推理大模型的DramaSR-LRM方法,通过多模态工具使用聚合上下文证据,显著提升长篇电视剧中说话人识别准确率,尤其对短话语效果显著。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29164 2026-06-30 cs.LG cs.AI cs.CG 81%

Invariant Reasoning Directions in Latent Trajectories of Language Models

语言模型潜在轨迹中的不变推理方向

Arun Vignesh Malarkkan, Manan Roy Choudhury, Utkarsh Byahut, Yash Ravindra Charde, Vivek Gupta, Yanjie Fu

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 发现潜在推理轨迹中存在稳定不变方向,提出TILR方法通过低秩子空间干预提升推理一致性与稳定性。

Comments 9 main text pages and 6 appendix pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24060 2026-06-23 cs.CL cs.AI 81%

Task Complexity Matters: An Empirical Study of Reasoning in LLMs for Sentiment Analysis

任务复杂性至关重要:对LLM在情感分析中推理能力的实证研究

Donghao Huang, Zhaoxia Wang

机构 * School of Computing and Information Systems, Singapore Management University(新加坡管理学院) Research and Development, Mastercard(麦star公司)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 研究通过评估7种模型家族在不同粒度的情感分析数据集上的表现,发现推理效果高度依赖任务复杂性,二分类任务性能下降,多类情感识别性能提升,且少量样本学习在多数情况下优于零样本学习。

Comments 12 pages, 1 figure, 3 tables. Accepted at PAKDD 2026

Journal ref In: Wong, R.CW., et al. Advances in Knowledge Discovery and Data Mining. PAKDD 2026. Lecture Notes in Computer Science(), vol 16600. Springer, Singapore

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07459 2026-06-17 cs.CL cs.AI 版本更新 81%

MedicalAgentsBench for Complex Medical Reasoning: Comparing Internalized Reasoning Models versus Externalized Agent-based Frameworks

MedicalAgentsBench:复杂医学推理基准——比较内化推理模型与外化智能体框架

Yanjun Shao, Xiangru Tang, Jiwoong Sohn, Jiapeng Chen, Yuxuan Liao, Jiayi Zhang, Jinyu Xiang, Fang Wu, Yilun Zhao, Chenglin Wu, Wenqi Shi, Arman Cohan, Mark Gerstein

机构 * Program in Computational Biology & Biomedical Informatics, Yale University(计算生物学与生物医学信息学项目,耶鲁大学) Department of Biomedical Informatics & Data Science, Yale University(生物医学信息学与数据科学系,耶鲁大学) Department of Computer Science, Yale University(计算机科学系,耶鲁大学) Department of Biosystems Science and Engineering, ETH Zurich(生物系统科学与工程系,苏黎世联邦理工学院) Department of Computer Science, Stanford University(计算机科学系,斯坦福大学) Department of Bioinformatics, UT Southwestern Medical Center(生物信息学系,德克萨斯西南医学中心)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 提出MedicalAgentsBench基准(862个复杂临床问题),比较内化推理模型与外化智能体框架在医学推理中的表现,发现两者效果可叠加,最优组合为o3-mini+MDAgents(准确率35.1%)。

Comments https://github.com/gersteinlab/MedicalAgentsBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16890 2026-06-16 cs.CL cs.AI 新提交 81%

Compositional Reasoning Depth Predicts Clinical AI Failure: Empirical Evidence Consistent with Transformer Compositionality Limits in Electronic Health Record Question Answering

组合推理深度预测临床AI失败:与电子健康记录问答中Transformer组合性限制一致的实证证据

Sanjay Basu

机构 * University of California San Francisco(加州大学旧金山分校) Waymark

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究引入推理步数(hop count)作为预测大型语言模型在电子健康记录问答中失败的理论驱动指标,发现准确率随步数增加单调下降,且扩展思考未能显著改善,提示组合推理深度是跨架构的失败预测因子。

Comments 20 pages, 5 figures. Code: https://github.com/sanjaybasu/compositional-depth-clinical-ehr

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13233 2026-06-12 cs.LG cs.AI 新提交 81%

ReSET: Accurate Latency-Critical NVFP4 Reasoning via Step-Aware Temperature Scaling

ReSET: 通过步骤感知温度缩放实现精确的延迟关键型NVFP4推理

Sihwa Lee, Janghwan Lee, Donghoon Yoo, Jae Gon Kim, Hanyul Ryu, Soojung Ryu, Jungwook Choi

机构 * Hanyang University(汉阳大学) Xenoscube Korean Inc.(Xenoscube韩国公司)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 针对大型推理模型在NVFP4低精度推理中精度下降和延迟问题,提出基于推理步骤熵的温度缩放方法ReSET,并设计CUDA小M核,在多个基准上提升精度约2点,解码速度提升2倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02465 2026-06-11 cs.AI cs.CV cs.LG 版本更新 81%

MentisOculi: Revealing the Limits of Reasoning with Mental Imagery

MentisOculi: 揭示心智图像推理的局限性

Jana Zeller, Thaddäus Wiedemer, Fanfei Li, Thomas Klein, Prasanna Mayilvahanan, Matthias Bethge, Felix Wichmann, Ryan Cotterell, Wieland Brendel

机构 * Max Planck Institute for Informatics(马克斯·普朗克信息研究所)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 提出MentisOculi基准,通过多步推理问题测试前沿模型利用视觉表示辅助推理的能力,发现视觉策略普遍无法提升性能,且统一多模态模型存在生成错误累积和无法利用真实可视化的问题。

Comments 9 pages, 8 figures, Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏