arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-02-11 至 2026-02-11 共收录 12 信号源:cs.CL, cs.AI, cs.LG

1. 其他推理 12 篇

2509.25666 2026-02-11 cs.LG cs.CL 84%

Nudging the Boundaries of LLM Reasoning

推动大语言模型推理边界的 nudging

Justin Chih-Yao Chen, Becky Xiangyu Peng, Prafulla Kumar Choubey, Kung-Hsiang Huang, Jiaxin Zhang, Mohit Bansal, Chien-Sheng Wu

机构 * Salesforce AI Research(Salesforce AI研究)

专题命中 其他推理 :reasoning(title,abstract);CoT(abstract);分类 cs.CL、cs.LG

AI总结 NuRL通过自动生成提示提升大语言模型推理上限,解决传统RL无法学习无法解决样本的问题。

Comments ICLR 2026 (Camera-Ready)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10021 2026-02-11 cs.CL cs.AI 81%

Decoupled Reasoning with Implicit Fact Tokens (DRIFT): A Dual-Model Framework for Efficient Long-Context Inference

解耦推理与隐式事实标记(DRIFT):一种双模型框架,用于高效长上下文推理

Wenxuan Xie, Yujia Wang, Xin Tan, Chaochao Lu, Xia Hu, Xuhong Wang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Tongji University(同济大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 DRIFT通过双模型框架解耦知识提取与推理,提升长上下文推理效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10004 2026-02-11 cs.AI 79%

ESTAR: Early-Stopping Token-Aware Reasoning For Efficient Inference

ESTAR: 早期停止的令牌感知推理用于高效推理

Junda Wang, Zhichao Yang, Dongxu Zhang, Sanjit Singh Batra, Robert E. Tillman

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Optum AI

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 ESTAR通过令牌感知推理的早期停止机制,有效减少推理冗余,提升大型推理模型的推理效率,同时保持高准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09832 2026-02-11 cs.CL 79%

LLM Reasoning Predicts When Models Are Right: Evidence from Coding Classroom Discourse

大语言模型推理可预测模型何时正确:来自编程课堂对话的证据

Bakhtawar Ahtisham, Kirk Vanacore, Zhuqian Zhou, Jinsook Lee, Rene F. Kizilcec

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本研究通过分析课堂对话中的教师发言,发现LLM生成的推理能有效预测模型预测的正确性,使用随机森林分类器达到F1得分0.83,表明基于推理的错误检测在教育对话分析中具有实用价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13666 2026-02-11 cs.RO cs.AI 74%

DREAM: Domain-aware Reasoning for Efficient Autonomous Underwater Monitoring

DREAM:面向高效自主水下监测的领域感知方法

Zhenqi Wu, Abhinav Modi, Angelos Mavrogiannis, Kaustubh Joshi, Nikhil Chopra, Yiannis Aloimonos, Nare Karapetyan, Ioannis Rekleitis, Xiaomin Lin

机构 * Electrical Engineering, University of South Florida(佛罗里达州立大学电气工程系) Maryland Robotics Center (MRC), University of Maryland(马里兰大学机器人中心) Woods Hole Oceanographic Institution (WHOI)(伍兹霍尔海洋研究所) Mechanical Engineering, University of Delaware(德雷克塞尔大学机械工程系)

专题命中 其他推理 :reasoning(title);分类 cs.AI

AI总结 DREAM通过视觉语言模型引导的自主框架,实现了高效、低耗的水下长期监测,显著提升了目标物体探测效率与覆盖范围。

Comments In Proceeding of ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09331 2026-02-11 cs.CL cs.AI cs.LG 67%

Beyond Uniform Credit: Causal Credit Assignment for Policy Optimization

超越均匀信用:为策略优化的因果信用分配

Mykola Khandoga, Rui Yuan, Vinay Kumar Sankarapu

机构 * Lexsi Labs(Lexsi实验室)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出反事实重要性加权方法,通过因果信用分配提升语言模型推理性能,无需辅助模型或外部标注,实验验证其在GSM8K上的有效性。

Comments 12 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10097 2026-02-11 cs.LG cs.AI 62%

Step-resolved data attribution for looped transformers

循环变换器中逐步数据归因

Georgios Kaissis, David Mildenberger, Juan Felipe Gomez, Martin J. Menten, Eleni Triantafillou

机构 * Hasso Plattner Institute for Digital Engineering, University of Potsdam(波恩大学数字工程研究所) Technical University of Munich(慕尼黑技术大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Harvard University(哈佛大学) Imperial College London(伦敦帝国理工学院) Google DeepMind(谷歌DeepMind)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出SDI方法,用于分析循环变换器中每个循环步骤对模型的影响,提升数据归因和可解释性能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09902 2026-02-11 cs.GT cs.AI cs.LG 62%

Routing, Cascades, and User Choice for LLMs

路由、级联与用户选择用于大语言模型

Rafid Mahmood

机构 * University of Ottawa(渥太华大学) NVIDIA(NVIDIA公司)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了大语言模型路由策略与用户行为之间的博弈,揭示了提供者与用户在效用和成本排序上的不一致,提出了基于Stackelberg博弈的路由优化方法,并得出了单用户单提供者互动的阈值规则。

Comments 23 pages, accepted in ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09384 2026-02-11 cs.CL cs.AI 62%

Contractual Deepfakes: Can Large Language Models Generate Contracts?

合同型深度伪造:大语言模型能生成合同吗?

Eliza Mik

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文指出大语言模型生成的合同可能不具法律效力,质疑其在法律领域应用的可行性。

Comments Accepted for publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20906 2026-02-11 cs.LG 57%

TwinWeaver: An LLM-Based Foundation Model Framework for Pan-Cancer Digital Twins

TwinWeaver: 一种基于大语言模型的跨癌症数字双胞胎基础模型框架

Nikita Makarov, Maria Bordukova, Lena Voith von Voithenberg, Estrella Pivel-Villanueva, Sabrina Mielke, Jonathan Wickes, Hanchen Wang, Mingyu Derek Ma, Keunwoo Choi, Kyunghyun Cho, Stephen Ra, Raul Rodriguez-Esteban, Fabian Schmich, Michael Menden

机构 * Computational Sciences Center of Excellence, Roche, Penzberg, Germany(罗氏计算科学卓越中心) Computational Health Center, Helmholtz Munich, Munich, Germany(海德堡慕尼黑计算健康中心) Department of Biology, Ludwig Maximilian University of Munich, Munich, Germany(慕尼黑路易斯·马克西米利安大学生物学系) Early Development Oncology, Roche Innovation Center Zurich, Roche, Schlieren, Switzerland(罗氏苏黎世创新中心早期肿瘤学) Computational Sciences Center of Excellence, Genentech, New York City, USA(基因泰克计算科学卓越中心) Computational Sciences Center of Excellence, Genentech, South San Francisco, USA(基因泰克计算科学卓越中心) Center for Data Science, New York University, New York City, USA(纽约大学数据科学中心) Department of Computer Science, Stanford University, Stanford, CA, USA(斯坦福大学计算机科学系) Computational Sciences Center of Excellence, Roche, Basel, Switzerland(罗氏巴塞尔计算科学卓越中心) Department of Biochemistry(生物化学系) Biotechnology Institute, The University of Melbourne, Melbourne, Australia(墨尔本大学生物技术研究所)

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 TwinWeaver通过基于大语言模型的框架,构建跨癌症数字双胞胎,提升临床事件预测与风险分层精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09934 2026-02-11 cs.CV 50%

VersaViT: Enhancing MLLM Vision Backbones via Task-Guided Optimization

VersaViT: 通过任务引导优化增强MLLM视觉骨干

Yikun Liu, Yuan Liu, Shangzhe Di, Haicheng Wang, Zhongyin Zhao, Le Tian, Xiao Zhou, Jie Zhou, Jiangchao Yao, Yanfeng Wang, Weidi Xie

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University, China(上海交通大学人工智能学院) CMIC, Shanghai Jiao Tong University, China(上海交通大学计算机学院) WeChat AI, Tencent Inc., China(腾讯公司)

专题命中 其他推理 :reasoning(abstract)

AI总结 VersaViT通过任务引导优化增强MLLM视觉骨干,解决其在密集预测任务中的性能问题,提升视觉任务的适应性与表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09637 2026-02-11 cs.CV cs.MM 50%

Towards Training-free Multimodal Hate Localisation with Large Language Models

无需训练的多模态仇恨定位与大型语言模型

Yueming Sun, Long Yang, Jianbo Jiao, Zeyu Fu

机构 * Hybrid Intelligence Lab, University of Durham(杜伦大学混合智能实验室) Multimodal Intelligence Lab, University of Exeter(埃克塞特大学多模态智能实验室) The MIx Group University of Birmingham(伯明翰大学MIx集团)

专题命中 其他推理 :reasoning(abstract)

AI总结 提出无需训练的多模态仇恨视频定位框架LELA,通过多阶段提示方案和跨模态推理机制实现高精度定位。

详情

展开后加载摘要…

URL PDF HTML 收藏