arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-06 至 2026-01-06 共收录 14 信号源:cs.CL, cs.AI, cs.LG

1. 其他推理 14 篇

2601.02170 2026-01-06 cs.AI 89%

Streaming Hallucination Detection in Long Chain-of-Thought Reasoning

流式长推理链中的幻觉检测

Haolang Lu, Minghui Pan, Ripeng Li, Guoshun Nan, Jialin Zhuang, Zijie Zhao, Zhongxiang Sun, Kun Wang, Yang Liu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Nanyang Technological University(南洋理工大学) Southwest Jiaotong University(西南交通大学) Renmin University of China(中国人民大学)

专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract);分类 cs.AI

AI总结 本研究提出通过跟踪推理状态演变来检测长推理链中的幻觉,提供实时可解释的检测证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00830 2026-01-06 cs.AI 86%

Can We Trust AI Explanations? Evidence of Systematic Underreporting in Chain-of-Thought Reasoning

我们能相信AI的解释吗?链式推理中的系统性低估证据

Deep Pankajbhai Mehta

专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(title);分类 cs.AI

AI总结 研究发现AI在链式推理中系统性低估提示信息,强制报告反而降低准确性,提示用户偏好尤其危险。

Comments 22 pages, 8 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24617 2026-01-06 cs.LG cs.AI 81%

Dynamic Large Concept Models: Latent Reasoning in an Adaptive Semantic Space

动态大概念模型:在适应性语义空间中的潜在推理

Xingwei Qu, Shaowen Wang, Zihao Huang, Kai Hua, Fan Yin, Rui-Jie Zhu, Jundong Zhou, Qiyang Min, Zihao Wang, Yizhi Li, Tianyu Zhang, He Xing, Zheng Zhang, Yuxuan Song, Tianyu Zheng, Zhiyuan Zeng, Chenghua Lin, Ge Zhang, Wenhao Huang

机构 * University of Manchester(曼彻斯特大学) Mila - Quebec AI Institute(魁北克人工智能研究所) Tsinghua University(清华大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 动态大概念模型通过层次压缩和压缩感知扩展定律,在适应性语义空间中提升推理效率,实现零样本基准上的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00388 2026-01-06 cs.CL 79%

Vision-Language Reasoning for Geolocalization: A Reinforcement Learning Approach

基于视觉-语言推理的地理定位:一种强化学习方法

Biao Wu, Meng Fang, Ling Chen, Ke Xu, Tao Cheng, Jun Wang

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出Geo-R,一种基于强化学习的无检索地理定位框架,通过链式区域生成可解释的监督,提升定位准确性与可解释性。

Comments Accepted to AAAI 2026. Project Page: https://github.com/aialt/geo-r

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01708 2026-01-06 cs.CL 79%

A Training-Free Large Reasoning Model-based Knowledge Tracing Framework for Unified Prediction and Prescription

基于大推理模型的无训练知识追踪框架:用于统一预测与处方

Unggi Lee, Joo Young Kim, Ran Ju, Minyoung Jung, Jeyeon Eo

机构 * Chosun University(全州大学) Neudive Inc(Neudive公司) Independent Researcher(独立研究者)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出Thinking-KT框架,利用测试时缩放技术,使小型LLM在无需训练的情况下实现高效的知识追踪预测、个性化反馈和学习推荐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01378 2026-01-06 cs.AI 79%

Empowering Small Language Models with Factual Hallucination-Aware Reasoning for Financial Classification

赋能小型语言模型以实现金融分类的事实幻觉感知推理

Han Yuan, Yilin Wu, Li Zhang, Zheng Ma

机构 * Decision Science Center of Excellence(决策科学中心卓越机构) American Express(美国运通)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出AAAI流程,通过缓解事实幻觉提升小型语言模型在金融分类中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00923 2026-01-06 cs.AI 70%

Context Collapse: In-Context Learning and Model Collapse

上下文崩溃:上下文学习与模型崩溃

Josef Ott

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本研究探讨了大型语言模型中上下文学习与模型崩溃现象,通过数学分析揭示了上下文长度与模型稳定性之间的关系。

Comments Master's thesis

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02147 2026-01-06 cs.CV cs.AI cs.LG 62%

BiPrompt: Bilateral Prompt Optimization for Visual and Textual Debiasing in Vision-Language Models

BiPrompt:面向视觉与文本去偏的双重视觉语言模型双向提示优化

Sunny Gupta, Shounak Das, Amit Sethi

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 BiPrompt通过双重视觉语言模型双向提示优化,同时减轻视觉和文本中的非因果特征依赖,提升模型在分布偏移下的鲁棒性和因果推理能力。

Comments Accepted at the AAAI 2026 Workshop AIR-FM, Assessing and Improving Reliability of Foundation Models in the Real World

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01322 2026-01-06 cs.CV cs.AI cs.LG cs.MM eess.IV 62%

LinMU: Multimodal Understanding Made Linear

LinMU: 使多模态理解线性化

Hongjie Wang, Niraj K. Jha

机构 * Princeton University(普林斯顿大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 LinMU通过线性复杂度设计实现多模态理解,无需二次注意力模块,提升视频处理效率。

Comments 23 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01831 2026-01-06 cs.MA cs.AI cs.IR cs.SE 57%

ARIES: A Scalable Multi-Agent Orchestration Framework for Real-Time Epidemiological Surveillance and Outbreak Monitoring

ARIES:一种可扩展的多智能体编排框架,用于实时流行病监测和爆发监控

Aniket Wattamwar, Sampson Akwafuo

机构 * Department of Computer Science(计算机科学系) California State University(加州州立大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 ARIES是一种专为流行病监测设计的多智能体框架,通过自动化数据提取和逻辑综合,实现实时监测和突发公共卫生事件的快速响应。

Comments 6 pages, 14 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01477 2026-01-06 cs.CL 57%

Can Legislation Be Made Machine-Readable in PROLEG?

在PROLEG中如何使立法变得机器可读?

May-Myo Zin, Sabine Wehnert, Yuntao Kong, Ha-Thanh Nguyen, Wachara Fungwacharakorn, Jieying Xue, Michał Araszkiewicz, Randy Goebel, Ken Satoh, Le-Minh Nguyen

机构 * Center for Juris-Informatics, ROIS-DS, Tokyo, Japan(法律信息中心) Ruhr-University Bochum(波鸿鲁尔大学) Research and Development Center for Large Language Models, NII, Tokyo, Japan(大型语言模型研究开发中心) Uniwersytet Jagielloński w Krakowie(克拉科夫雅盖隆大学) University of Alberta(阿尔伯塔大学) Japan Advanced Institute of Science and Technology, Ishikawa, Japan(日本先进科学技術研究所)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出利用LLM和PROLEG系统将法律文本转换为可执行的规则,以提高监管应用的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01321 2026-01-06 cs.AI 57%

Digital Twin AI: Opportunities and Challenges from Large Language Models to World Models

数字孪生AI:从大语言模型到世界模型的机会与挑战

Rong Zhou, Dongping Chen, Zihan Jia, Yao Su, Yixin Liu, Yiwen Lu, Dongwei Shi, Yue Huang, Tianyang Xu, Yi Pan, Xinliang Li, Yohannes Abate, Qingyu Chen, Zhengzhong Tu, Yu Yang, Yu Zhang, Qingsong Wen, Gengchen Mai, Sunyang Fu, Jiachen Li, Xuyu Wang, Ziran Wang, Jing Huang, Tianming Liu, Yong Chen, Lichao Sun, Lifang He

机构 * Lehigh University(莱文斯顿大学) University of Maryland(马里兰大学) University of New South Wales(新南威尔士大学) Worcester Polytechnic Institute(沃思维尔理工学院) University of Pennsylvania(宾夕法尼亚大学) University of Notre Dame(圣约翰大学) Columbia University(哥伦比亚大学) University of Georgia(佐治亚大学) Yale University(耶鲁大学) Texas A&M University(德克萨斯A&M大学) Stanford University(斯坦福大学) Squirrel Ai Learning University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Texas Health Science Center at Houston(德克萨斯大学健康科学中心休斯顿分校) University of California, Riverside(加州大学河滨分校) Florida International University(佛罗里达国际大学) Purdue University(普渡大学) Children’s Hospital of Philadelphia(费城儿童医院)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出统一的四阶段框架,探讨数字孪生中AI整合的机会与挑战,涵盖建模、镜像、干预和自主管理,强调大语言模型和基础模型的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06781 2026-01-06 cs.CR cs.AI cs.PL 57%

From Description to Score: Can LLMs Quantify Vulnerabilities?

从描述到评分:大语言模型能否量化漏洞?

Sima Jafarikhah, Daniel Thompson, Eva Deans, Hossein Siadati, Yi Liu

机构 * University of North Carolina Wilmington(北卡罗来纳大学 Wilmington 分校)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究探讨了大语言模型在自动化CVSS评分中的潜力,发现其在某些指标上表现优异,但存在分类错误问题,需改进漏洞描述以提升自动化评分的可靠性。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06084 2026-01-06 cs.CV 50%

AdaptInfer: Adaptive Token Pruning for Vision-Language Model Inference with Dynamical Text Guidance

AdaptInfer: 用于视觉-语言模型推理的自适应令牌剪枝与动态文本引导

Weichen Zhang, Zhui Zhu, Ningbo Li, Shilong Tao, Kebin Liu, Yunhao Liu

机构 * Global Innovation Exchange, Tsinghua University(清华大学全球创新交流中心) Department of Automation, Tsinghua University(清华大学自动化系) School of Computer Science, Peking University(北京大学计算机科学系)

专题命中 其他推理 :reasoning(abstract)

AI总结 AdaptInfer通过动态文本引导和自适应令牌剪枝,有效降低视觉-语言模型推理成本,提升推理效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏