arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-12 至 2026-01-12 共收录 12 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 12 篇

2601.05567 2026-01-12 cs.AI cs.CL 81%

WildSci: Advancing Scientific Reasoning from In-the-Wild Literature

WildSci: 从真实文献中推进科学推理

Tengxiao Liu, Deepak Nathani, Zekun Li, Kevin Yang, William Yang Wang

机构 * University of California, Santa Barbara(加州大学圣巴巴拉分校)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 WildSci通过自动合成领域特定科学问题数据集,提升科学推理的可扩展性和可持续性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05693 2026-01-12 cs.AI 79%

Circular Reasoning: Understanding Self-Reinforcing Loops in Large Reasoning Models

循环推理:理解大推理模型中的自增强循环

Zenghao Duan, Liang Pang, Zihao Wei, Wenbin Duan, Yuxin Tian, Shicheng Xu, Jingcheng Deng, Zhiyi Yin, Xueqi Cheng

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院人工智能安全国家重点实验室) University of Chinese Academy of Sciences(中国科学院大学) People’s Public Security University of China(中国人民公安大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出LoopBench数据集和CUSUM算法,用于识别和预测大型推理模型中的自增强循环问题,揭示循环推理的机理并提升模型稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04996 2026-01-12 cs.AI 79%

AlgBench: To What Extent Do Large Reasoning Models Understand Algorithms?

AlgBench: 大型推理模型对算法的理解程度有多高?

Henan Sun, Kaichi Yu, Yuyao Wang, Bowen Liu, Xunkai Li, Rong-Hua Li, Nuo Chen, Jia Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学) Beijing Institute of Technology(北京理工大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 AlgBench通过算法为中心的基准测试揭示大型推理模型在算法理解上的性能差异和局限性。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21329 2026-01-12 cs.CL 79%

Your Reasoning Benchmark May Not Test Reasoning: Revealing Perception Bottleneck in Abstract Reasoning Benchmarks

你的推理基准可能并未测试推理:揭示抽象推理基准中的感知瓶颈

Xinhe Wang, Jin Huang, Xingjian Zhang, Tianhao Wang, Jiaqi W. Ma

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 研究发现抽象推理基准中的性能差距主要源于视觉感知限制,而非推理能力不足,需设计分离感知与推理的评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09993 2026-01-12 cs.AI 79%

SPAN: Benchmarking and Improving Cross-Calendar Temporal Reasoning of Large Language Models

SPAN:大型语言模型跨日历时间推理的基准测试与改进

Zhongjian Miao, Hao Fu, Chen Wei

机构 * Li Auto(利亚特)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 SPAN通过开发时间代理提升大型语言模型跨日历时间推理能力,实验显示其准确率高达95.31%

Comments Accepted at the AAAI 2026 conference. This version includes the supplementary appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05432 2026-01-12 cs.CV cs.AI cs.CL 73%

Thinking with Map: Reinforced Parallel Map-Augmented Agent for Geolocalization

基于地图的思考:用于地理定位的强化并行地图增强智能体

Yuxiang Ji, Yong Wang, Ziyu Ma, Yiming Hu, Hailang Huang, Xuecai Hu, Guanhua Chen, Liaoni Wu, Xiangxiang Chu

机构 * Xiamen University(厦门大学) AMAP, Alibaba Group(阿里集团AMAP) Southern University of Science and Technology(南方科技大学)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于地图的强化并行智能体,通过两阶段优化提升地理定位精度,实验显示在Acc@500m指标上显著优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01739 2026-01-12 cs.CL cs.AI 62%

K-EXAONE Technical Report

K-EXAONE 技术报告

Eunbi Choi, Kibong Choi, Seokhee Hong, Junwon Hwang, Hyojin Jeon, Hyunjik Jo, Joonkee Kim, Seonghwan Kim, Soyeon Kim, Sunkyoung Kim, Yireun Kim, Yongil Kim, Haeju Lee, Jinsik Lee, Kyungmin Lee, Sangha Park, Heuiyeen Yeen, Hwan Chang, Stanley Jungkyu Choi, Yejin Choi, Jiwon Ham, Kijeong Jeon, Geunyeong Jeong, Gerrard Jeongwon Jo, Yonghwan Jo, Jiyeon Jung, Naeun Kang, Dohoon Kim, Euisoon Kim, Hayeon Kim, Hyosang Kim, Hyunseo Kim, Jieun Kim, Minu Kim, Myoungshin Kim, Unsol Kim, Youchul Kim, YoungJin Kim, Chaeeun Lee, Chaeyoon Lee, Changhun Lee, Dahm Lee, Edward Hwayoung Lee, Honglak Lee, Jinsang Lee, Jiyoung Lee, Sangeun Lee, Seungwon Lim, Solji Lim, Woohyung Lim, Chanwoo Moon, Jaewoo Park, Jinho Park, Yongmin Park, Hyerin Seo, Wooseok Seo, Yongwoo Song, Sejong Yang, Sihoon Yang, Chang En Yea, Sihyuk Yi, Chansik Yoon, Dongkeun Yoon, Sangyeon Yoon, Hyeongu Yun

机构 * LG AI Research(LG人工智能研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 K-EXAONE是一款由LG AI Research开发的大型多语言语言模型,基于专家混合架构,支持256K-token上下文窗口,具备多语言能力,其性能与同类开源模型相当,适用于多种工业和研究应用。

Comments 29 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19153 2026-01-12 cs.CR cs.AI cs.SE 57%

LLMs as verification oracles for Solidity

LLMs作为Solidity的验证或者

Massimo Bartoletti, Enrico Lipparini, Livio Pompianu

机构 * University of Cagliari, Italy(卡利亚里大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文探讨了使用LLMs评估Solidity合同属性有效性的潜力,通过实证研究展示其在智能合约验证中的应用效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04160 2026-01-12 cs.CL cs.CE q-fin.CP 57%

All That Glisters Is Not Gold: A Benchmark for Reference-Free Counterfactual Financial Misinformation Detection

并非所有发光的都是金子:一个无参考信息的反事实金融虚假信息检测基准

Yuechen Jiang, Zhiwei Liu, Yupeng Cao, Yueru He, Ziyang Xu, Chen Xu, Zhiyang Deng, Prayag Tiwari, Xi Chen, Alejandro Lopez-Lira, Jimin Huang, Junichi Tsujii, Sophia Ananiadou

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 RFC Bench通过对比上下文提升金融虚假信息检测性能,揭示无参考设置下的模型局限性。

Comments 48 pages; 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05927 2026-01-12 cs.CV 50%

Adapting Vision Transformers to Ultra-High Resolution Semantic Segmentation with Relay Tokens

适应于超高分辨率语义分割的视觉变换器:通过中继标记

Yohann Perron, Vladyslav Sydorov, Christophe Pottier, Loic Landrieu

专题命中 推理评测 :reasoning(abstract)

AI总结 通过引入中继标记,该方法在视觉变换器中实现多尺度推理,提升超高清语义分割的性能,实现局部细节与全局意识的平衡。

Comments 13 pages +3 pages of suppmat

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21272 2026-01-12 cs.CV 50%

Co-Training Vision Language Models for Remote Sensing Multi-task Learning

联合训练遥感多任务学习的视觉语言模型

Qingyun Li, Shuran Ma, Junwei Luo, Yi Yu, Yue Zhou, Fengxiang Wang, Xudong Lu, Xiaoxing Wang, Xin He, Yushi Chen, Xue Yang

机构 * Harbin Institute of Technology(哈尔滨工业大学) Shanghai Jiao Tong University(上海交通大学) Xidian University(西安电子科技大学) East China Normal University(东华大学) Wuhan University(武汉大学) Southeast University(东南大学) National University of Defense Technology(国防科技大学) Chinese University of Hong Kong(香港中文大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 RSCoVLM通过联合训练视觉语言模型,提升遥感多任务学习的性能和灵活性。

Comments 14 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05632 2026-01-12 eess.SY cs.SY 50%

LLM-DMD: Large Language Model-based Power System Dynamic Model Discovery

基于大语言模型的电力系统动态模型发现:LLM-DMD

Chao Shen, Zihan Guo, Ke Zuo, Wenqi Huang, Mingyang Sun

专题命中 推理评测 :reasoning(abstract)

AI总结 LLM-DMD通过结合大语言模型的推理和代码生成能力,利用两个循环发现电力系统动态方程并强制代数约束,从而实现高保真动态模型的构建。

详情

展开后加载摘要…

URL PDF HTML 收藏