arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-08 至 2026-01-08 共收录 11 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 11 篇

2601.03717 2026-01-08 cs.CL 88%

MIND: From Passive Mimicry to Active Reasoning through Capability-Aware Multi-Perspective CoT Distillation

MIND:通过能力感知的多视角CoT蒸馏从被动模仿到主动推理

Jin Cui, Jiaqi Guo, Jiepeng Zhou, Ruixuan Yang, Jiayi Lu, Jiajun Xu, Jiangcheng Song, Boran Zhao, Pengju Ren

机构 * State Key Laboratory of Human-Machine Hybrid Augmented Intelligence, National Engineering Research Center for Visual Information and Applications, and Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(西安交通大学人机混合增强智能国家重点实验室、视觉信息与应用国家工程研究中心、人工智能与机器人研究所) Nankai University(南开大学) The Hong Kong University of Science and Technology(Guangzhou)(香港科技大学(广州)) School of Software Engineering, Xi’an Jiaotong University(西安交通大学软件学院)

专题命中 复杂问题求解 :reasoning(title,abstract);CoT(title);chain-of-thought(abstract);分类 cs.CL

AI总结 MIND通过能力感知的多视角CoT蒸馏,从被动模仿转向主动推理,提升模型在分布内和分布外任务中的性能。

Comments 13 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17306 2026-01-08 cs.CV 85%

Deep But Reliable: Advancing Multi-turn Reasoning for Thinking with Images

深度但可靠:提升图像思考的多轮推理

Wenhao Yang, Yu Xia, Jinlong Huang, Shiyin Lu, Qing-Guo Chen, Zhao Xu, Weihua Luo, Kaifu Zhang, Yuanyu Wan, Lijun Zhang

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 DRIM通过多阶段流程提升图像思考的多轮推理能力,通过冗余惩罚策略优化实现自我反思的推理模式,从而在视觉理解任务中取得优越表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03537 2026-01-08 cs.AI cs.CL 81%

STAR-S: Improving Safety Alignment through Self-Taught Reasoning on Safety Rules

通过安全规则的自教推理提升安全性

Di Wu, Yanyan Zhao, Xin Lu, Mingzhe Li, Bing Qin

机构 * Research Center for Social Computing and Information Retrieval(社会计算与信息检索研究中心) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 STAR-S通过自教推理提升大型语言模型的安全性,有效防御对抗攻击。

Comments 19 pages,4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07198 2026-01-08 cs.CV cs.CL 79%

Generating Storytelling Images with Rich Chains-of-Reasoning

通过丰富的推理链生成叙事图像

Xiujie Song, Qi Jia, Shota Watanabe, Xiaoyi Pang, Ruijie Chen, Mengyue Wu, Kenny Q. Zhu

机构 * X-LANCE Lab, School of Computer Science, Shanghai Jiao Tong University, China(X-LANCE实验室,计算机科学学院,上海交通大学,中国) Shanghai Artificial Intelligence Laboratory, China(上海人工智能实验室,中国) East China University of Technology, China(东华大学,中国) University of Texas at Arlington, USA(德克萨斯大学阿灵顿分校,美国)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出StorytellingPainter,通过结合大语言模型推理与文本到图像合成,生成具有丰富推理链的叙事图像,并引入评估框架和轻量级模型以提升生成效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04301 2026-01-08 cs.LG cs.AR 79%

The Cost of Dynamic Reasoning: Demystifying AI Agents and Test-Time Scaling from an AI Infrastructure Perspective

动态推理的成本:从AI基础设施视角解密AI代理与测试时扩展

Jiin Kim, Byeongjun Shin, Jinha Chung, Minsoo Rhu

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.LG

AI总结 本文从AI基础设施视角解密AI代理与测试时扩展,揭示动态推理带来的高成本与可持续性问题,呼吁转向计算高效的代理设计。

Comments Accepted for publication at the 32nd IEEE International Symposium on High-Performance Computer Architecture (HPCA-32), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04060 2026-01-08 cs.AI 74%

ComfySearch: Autonomous Exploration and Reasoning for ComfyUI Workflows

ComfySearch: 为ComfyUI工作流实现自主探索与推理

Jinwei Su, Qizhen Lan, Zeyu Wang, Yinghui Xia, Hairu Wen, Yiqun Duan, Xi Xiao, Tianyu Shi, Yang Jingsong, Lewei He

机构 * ComfyUI

专题命中 复杂问题求解 :reasoning(title);分类 cs.AI

AI总结 ComfySearch通过验证引导的工作流构建,有效提升ComfyUI工作流的通过率和解决方案率,适用于复杂创意任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03743 2026-01-08 cs.CL cs.AI 62%

O-Researcher: An Open Ended Deep Research Model via Multi-Agent Distillation and Agentic RL

O-Researcher: 通过多智能体蒸馏和智能体强化学习构建开放式深度研究模型

Yi Yao, He Zhu, Piaohong Wang, Jincheng Ren, Xinlong Yang, Qianben Chen, Xiaowan Li, Dingfeng Shi, Jiaxian Li, Qiexiang Wang, Sinuo Wang, Xinpeng Liu, Jiaqi Wu, Minghao Liu, Wangchunshu Zhou

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 O-Researcher通过多智能体蒸馏和智能体强化学习,构建开放式深度研究模型,实现开源模型在多个基准上的性能提升。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03483 2026-01-08 cs.CL cs.CY cs.LG 62%

CALM: Culturally Self-Aware Language Models

CALM:具有文化自感知能力的语言模型

Lingzhi Shen, Xiaohao Cai, Yunfei Long, Imran Razzak, Guanming Chen, Shoaib Jameel

机构 * University of Southampton(索姆塞特大学) Queen Mary University of London(伦敦女王学院) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 复杂问题求解 :self-correction(abstract);分类 cs.CL、cs.LG

AI总结 CALM通过对比学习和专家混合机制,赋予语言模型文化自感知能力,提升其在跨文化任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08726 2026-01-08 cs.CL cs.AI 62%

Improved LLM Agents for Financial Document Question Answering

改进的金融文档问答大型语言模型代理

Nelvin Tan, Zian Seng, Liang Zhang, Yu-Ching Shih, Dong Yang, Amol Salunkhe

机构 * American Express(美国美国运通)

专题命中 复杂问题求解 :self-correction(abstract);分类 cs.CL、cs.AI

AI总结 本文提出改进的金融文档问答代理,通过实验展示其在无 oracle 标签情况下的有效性,并引入更安全的计算代理。

Comments 13 pages, 6 figures. More analysis is added to Appendix C

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04170 2026-01-08 cs.AI 57%

Agent Drift: Quantifying Behavioral Degradation in Multi-Agent LLM Systems Over Extended Interactions

智能体漂移:多智能体大语言模型系统在长时间交互中的行为退化量化

Abhishek Rath

机构 * Independent Researcher(独立研究者)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出智能体漂移概念,通过理论框架和量化指标,探讨多智能体系统在长时间交互中的行为退化问题,并提出缓解策略以提升系统稳定性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22156 2026-01-08 cs.CL 57%

InComeS: Integrating Compression and Selection Mechanisms into LLMs for Efficient Model Editing

InComeS: 将压缩与选择机制整合到LLMs中以实现高效的模型编辑

Shuaiyi Li, Zhisong Zhang, Yang Deng, Chenlong Deng, Tianqing Fang, Hongming Zhang, Haitao Mi, Dong Yu, Wai Lam

机构 * The Chinese University of Hong Kong(香港中文大学) City University of Hong Kong(香港城市大学) Tencent AI Lab(腾讯AI实验室) Singapore Management University(新加坡管理学院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 InComeS通过整合压缩和选择机制,提升LLMs处理多编辑任务的效率和性能。

Comments 18 pages,5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏