arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-02-19 至 2026-02-19 共收录 13 信号源:cs.CL, cs.AI, cs.LG

1. 其他推理 13 篇

2508.02669 2026-02-19 cs.CV 82%

MedVLThinker: Simple Baselines for Multimodal Medical Reasoning

MedVLThinker: 多模态医疗推理的简单基线

Xiaoke Huang, Juncheng Wu, Hui Liu, Xianfeng Tang, Yuyin Zhou

机构 * UC Santa Cruz(加州大学圣克ruz分校) Amazon Research(亚马逊研究院)

专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(abstract)

AI总结 MedVLThinker通过简单基线和RLVR方法,在医疗多模态推理中实现新突破,超越现有开源模型并接近专有模型性能。

Comments Project page: https://ucsc-vlaa.github.io/MedVLThinker/ ; Code: https://github.com/UCSC-VLAA/MedVLThinker ; Model and Data: https://huggingface.co/collections/UCSC-VLAA/medvlthinker-688f52224fb7ff7d965d581d ; Accepted by ML4H'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16085 2026-02-19 cs.CL cs.AI 81%

Language Statistics and False Belief Reasoning: Evidence from 41 Open-Weight LMs

语言统计与虚假信念推理:来自41个开放权重语言模型的证据

Sean Trott, Samuel Taylor, Cameron Jones, James A. Michaelov, Pamela D. Rivière

机构 * Rutgers University - Newark(新泽西罗格斯大学-新布朗斯维尔) UC San Diego(加州大学圣地亚哥分校) Stony Brook University(史泰文斯理工学院) MIT(麻省理工学院)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究通过41个开放权重语言模型测试,发现人类和模型在非事实性动词提示下对虚假信念的归因存在偏差,揭示语言统计学在解释人类认知中的局限性。

Comments 15 pages, 7 figures, submitted to conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15863 2026-02-19 cs.CL cs.AI 81%

Not the Example, but the Process: How Self-Generated Examples Enhance LLM Reasoning

不是例子,而是过程:如何自动生成的例子增强LLM推理

Daehoon Gwak, Minseo Jung, Junwoo Park, Minho Park, ChaeHun Park, Junha Hyung, Jaegul Choo

机构 * KAIST AI(韩国科学技术院人工智能研究所) Applied Artificial Intelligence, Sungkyunkwan University(成均馆大学应用人工智能系)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究通过对比不同提示策略,发现自动生成例子的过程增强了LLM推理性能,而非例子本身。

Comments Presented at AACL-IJCNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15857 2026-02-19 cs.CL 79%

Multi-source Heterogeneous Public Opinion Analysis via Collaborative Reasoning and Adaptive Fusion: A Systematically Integrated Approach

通过协同推理与自适应融合进行多源异构公共意见分析:一种系统整合方法

Yi Liu

机构 * Yi Liu School of Software Xi’an Jiaotong University(刘毅 软件学院 西安交通大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出CRAF框架,通过协同推理与自适应融合整合传统方法与LLMs,提升多源异构公共意见分析的跨平台适应性与性能

Comments 13 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07611 2026-02-19 cs.AI 74%

DIAGPaper: Diagnosing Valid and Specific Weaknesses in Scientific Papers via Multi-Agent Reasoning

DIAGPaper: 通过多智能体推理诊断科学论文中的有效且具体弱点

Zhuoyang Zou, Abolfazl Ansari, Delvin Ce Zhang, Dongwon Lee, Wenpeng Yin

机构 * Penn State University(宾夕法尼亚州立大学) University of Sheffield(谢菲尔德大学)

专题命中 其他推理 :reasoning(title);分类 cs.AI

AI总结 DIAGPaper通过多智能体推理框架有效识别科学论文中的弱点,结合定制、反驳和优先模块提升弱点识别的准确性和优先级排序。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16650 2026-02-19 cs.CE cs.AI 57%

Retrieval Augmented Generation of Literature-derived Polymer Knowledge: The Example of a Biodegradable Polymer Expert System

文献衍生聚合物知识的检索增强生成:生物降解聚合物专家系统的例子

Sonakshi Gupta, Akhlak Mahmood, Wei Xiong, Rampi Ramprasad

机构 * School of Computational Science and Engineering(计算科学与工程学院) Georgia Institute of Technology(佐治亚理工学院) Matmerize, Inc.(Matmerize公司)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出基于检索增强生成的聚合物知识系统,通过构建结构化知识图谱和语义向量方法,提升生物降解聚合物领域的文献检索与推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03710 2026-02-19 cs.LG 57%

Shrinking the Variance: Shrinkage Baselines for Reinforcement Learning with Verifiable Rewards

缩减方差:用于具有可验证奖励的强化学习的收缩基线

Guanning Zeng, Zhaoyi Zhou, Daman Arora, Andrea Zanette

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出了一种基于收缩估计的基线方法,用于改进具有可验证奖励的强化学习中策略梯度估计器的方差,通过结合每个提示和跨提示的均值来提高估计准确性。

Comments Preprint. Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16188 2026-02-19 cs.LG 57%

Deep TPC: Temporal-Prior Conditioning for Time Series Forecasting

深度时间序列预测中的时间先验条件:时间序列预测中的时间先验条件

Filippos Bellos, NaveenJohn Premkumar, Yannis Avrithis, Nam H. Nguyen, Jason J. Corso

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出TPC方法,通过时间先验条件提升时间序列预测性能,实现低参数预算下的长周期预测优化。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16162 2026-02-19 cs.CL 57%

LLMs Exhibit Significantly Lower Uncertainty in Creative Writing Than Professional Writers

LLMs在创造性写作中表现出显著低于专业作家的不确定性

Peiqi Sui

机构 * McGill University(麦吉尔大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 本文研究了LLM在创造性写作中相较于专业作家的不确定性问题,发现模型输出的不确定性显著低于人类,提出需新的对齐方法以提升创造性写作质量。

Comments 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15915 2026-02-19 cs.CV cs.AI 57%

MaS-VQA: A Mask-and-Select Framework for Knowledge-Based Visual Question Answering

MaS-VQA: 一种基于掩码和选择的基于知识的视觉问答框架

Xianwei Mao, Kai Ye, Sheng Zhou, Nan Zhang, Haikuan Huang, Bin Li, Jiajun Bu

机构 * Zhejiang University, Hangzhou, China(浙江大学, 杭州, 中国) Alibaba Group, Hangzhou, China(阿里巴巴集团, 杭州, 中国)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 MaS-VQA通过结合显式知识过滤与隐式知识推理,提升基于知识的视觉问答任务的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15882 2026-02-19 cs.RO cs.AI 57%

FUTURE-VLA: Forecasting Unified Trajectories Under Real-time Execution

FUTURE-VLA:在实时执行下统一轨迹预测

Jingjing Fan, Yushan Liu, Shoujie Li, Botao Ren, Siyuan Li, Xiao-Ping Zhang, Wenbo Ding, Zhidong Deng

机构 * Department of Automation, Tsinghua University(自动化系,清华大学) Shenzhen International Graduation School, Tsinghua University(深圳国际研究生院,清华大学) Department of Computer Science and Technology, Tsinghua University(计算机科学与技术系,清华大学) School of Mechanical and Aerospace Engineering, Nanyang Technological University(机械与航空航天工程学院,南洋理工大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 FUTURE-VLA通过实时执行实现统一轨迹预测,采用双效效率范式提升时空信息密度,实现实时预测与人机交互机制,取得多项任务的高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13521 2026-02-19 cs.DB cs.AI 57%

Arming Data Agents with Tribal Knowledge

赋予数据代理以部落知识

Shubham Agarwal, Asim Biswal, Sepanta Zeighami, Alvin Cheung, Joseph Gonzalez, Aditya G. Parameswaran

机构 * UC Berkeley(伯克利大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 Tk-Boost通过积累经验纠正NL2SQL代理的误解,提升其在大规模数据库中的查询准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16034 2026-02-19 cs.IR 50%

FeDecider: An LLM-Based Framework for Federated Cross-Domain Recommendation

FeDecider: 一种基于大语言模型的联邦跨域推荐框架

Xinrui He, Ting-Wei Li, Tianxin Wei, Xuying Ning, Xinyu He, Wenxuan Bao, Hanghang Tong, Jingrui He

专题命中 其他推理 :reasoning(abstract)

AI总结 FeDecider是一种基于大语言模型的联邦跨域推荐框架,通过解耦客户端低秩更新并学习个性化权重,有效解决跨域推荐中的过拟合和异质性问题。

Comments Accepted to The Web Conference (WWW) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏