arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-09 至 2026-01-09 共收录 15 信号源:cs.CL, cs.AI, cs.LG

1. 其他推理 15 篇

2601.04878 2026-01-09 cs.AI cond-mat.mtrl-sci cs.CL cs.LG 82%

Higher-Order Knowledge Representations for Agentic Scientific Reasoning

高阶知识表示用于代理科学推理

Isabella A. Stewart, Markus J. Buehler

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出基于超图的知识表示方法,用于代理科学推理,通过高阶路径生成机理假设,提升科学发现效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05019 2026-01-09 cs.CL cs.AI q-bio.NC 81%

Hán Dān Xué Bù (Mimicry) or Qīng Chū Yú Lán (Mastery)? A Cognitive Perspective on Reasoning Distillation in Large Language Models

模仿(Mimicry)还是精通(Mastery)?从认知视角看大语言模型中的推理蒸馏

Yueqing Hu, Xinyang Peng, Shuting Peng, Hanqi Wang, Tianhong Wang

机构 * School of Philosophy, Anhui University(安徽大学哲学学院) Institute of Neuroscience, Chinese Academy of Sciences(中国科学院神经科学研究所) Faculty of Education, University of Cambridge(剑桥大学教育学院) School of Foreign Studies, South China Normal University(华南师范大学外语学院) Division of Psychology and Language Sciences, University College London(伦敦大学学院心理学与语言科学系)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 从认知视角研究大语言模型推理蒸馏,发现其导致功能对齐崩溃,揭示人类样样的认知是主动强化的涌现属性而非被动模仿。

Comments 7 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04544 2026-01-09 cs.AI 79%

TCAndon-Router: Adaptive Reasoning Router for Multi-Agent Collaboration

TCAndon-Router: 多智能体协作的自适应推理路由

Jiuzhou Zhao, Chunrong Chen, Chenqi Qiao, Lebin Zheng, Minqi Han, Yanchi Liu Yongzhou Xu Xiaochuan Xu Min Zhang

机构 * Tencent Cloud Andon(腾讯云安顿)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 TCAndon-Router通过动态智能体接入和自然语言推理链提升多智能体协作的路由准确性与鲁棒性。

Comments 16 pages, 6 figures. Under review at IJCAI

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03905 2026-01-09 cs.AI cs.CL cs.LG 67%

Current Agents Fail to Leverage World Model as Tool for Foresight

当前智能体无法利用世界模型作为前瞻性工具

Cheng Qian, Emre Can Acikgoz, Bingxuan Li, Xiusi Chen, Yuji Zhang, Bingxiang He, Qinyu Luo, Dilek Hakkani-Tür, Gokhan Tur, Yunzhu Li, Heng Ji

机构 * UIUC(伊利诺伊大学香槟分校) THU(清华大学) JHU(约翰霍普金斯大学) Columbia(哥伦比亚大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了当前智能体能否利用世界模型作为工具提升前瞻性认知,发现其在模拟调用和结果整合方面存在显著不足。

Comments 36 Pages, 13 Figures, 17 Tables (Meta data updated)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04963 2026-01-09 cs.CL cs.AI 62%

Text as a Universal Interface for Transferable Personalization

文本作为通用的可转移个性化接口

Yuting Liu, Jian Guan, Jia-Nan Li, Wei Wu, Jiang-Ming Yang, Jianzhe Zhao, Guibing Guo

机构 * Software College, Northeastern University(东北大学软件学院) Ant Group(蚂蚁集团) Ant International(蚂蚁国际) Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学商学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出利用自然语言作为通用接口,通过两阶段训练框架开发出可转移的偏好推理模型,实现在多个任务和模型家族中的高性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12611 2026-01-09 cs.AI cs.CL 62%

An LLM + ASP Workflow for Joint Entity-Relation Extraction

基于LLM与ASP的工作流联合实体-关系抽取

Trang Tran, Trung Hoang Le, Huiping Cao, Tran Cao Son

机构 * New Mexico State University(新墨西哥州立大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于LLM与ASP的工作流,利用其优势在有限数据下提升JERE任务性能,尤其在SciERC基准上表现突出。

Comments In Proceedings ICLP 2025, arXiv:2601.00047

Journal ref EPTCS 439, 2026, pp. 63-75

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04435 2026-01-09 cs.CL cs.AI cs.CY 62%

Accommodation and Epistemic Vigilance: A Pragmatic Account of Why LLMs Fail to Challenge Harmful Beliefs

适应与认知警觉:一种实用视角下为何LLMs未能挑战有害信念

Myra Cheng, Robert D. Hawkins, Dan Jurafsky

机构 * Department of Computer Science, Stanford University(计算机科学系,斯坦福大学) Department of Linguistics, Stanford University(语言学系,斯坦福大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文通过语用学视角揭示LLMs在挑战有害信念时的失败原因,并提出简单干预提升安全性的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02780 2026-01-09 cs.CL cs.AI 62%

MiMo-V2-Flash Technical Report

MiMo-V2-Flash 技术报告

Core Team, Bangjun Xiao, Bingquan Xia, Bo Yang, Bofei Gao, Bowen Shen, Chen Zhang, Chenhong He, Chiheng Lou, Fuli Luo, Gang Wang, Gang Xie, Hailin Zhang, Hanglong Lv, Hanyu Li, Heyu Chen, Hongshen Xu, Houbin Zhang, Huaqiu Liu, Jiangshan Duo, Jianyu Wei, Jiebao Xiao, Jinhao Dong, Jun Shi, Junhao Hu, Kainan Bao, Kang Zhou, Lei Li, Liang Zhao, Linghao Zhang, Peidian Li, Qianli Chen, Shaohui Liu, Shihua Yu, Shijie Cao, Shimao Chen, Shouqiu Yu, Shuo Liu, Tianling Zhou, Weijiang Su, Weikun Wang, Wenhan Ma, Xiangwei Deng, Bohan Mao, Bowen Ye, Can Cai, Chenghua Wang, Chengxuan Zhu, Chong Ma, Chun Chen, Chunan Li, Dawei Zhu, Deshan Xiao, Dong Zhang, Duo Zhang, Fangyue Liu, Feiyu Yang, Fengyuan Shi, Guoan Wang, Hao Tian, Hao Wu, Heng Qu, Hongfei Yi, Hongxu An, Hongyi Guan, Xing Zhang, Yifan Song, Yihan Yan, Yihao Zhao, Yingchun Lai, Yizhao Gao, Yu Cheng, Yuanyuan Tian, Yudong Wang, Zhen Tang, Zhengju Tang, Zhengtao Wen, Zhichao Song, Zhixian Zheng, Zihan Jiang, Jian Wen, Jiarui Sun, Jiawei Li, Jinlong Xue, Jun Xia, Kai Fang, Menghang Zhu, Nuo Chen, Qian Tu, Qihao Zhang, Qiying Wang, Rang Li, Rui Ma, Shaolei Zhang, Shengfan Wang, Shicheng Li, Shuhao Gu, Shuhuai Ren, Sirui Deng, Tao Guo, Tianyang Lu, Weiji Zhuang, Weikang Zhang, Weimin Xiong, Wenshan Huang, Wenyu Yang, Xin Zhang, Xing Yong, Xu Wang, Xueyang Xie, Yilin Jiang, Yixin Yang, Yongzhe He, Yu Tu, Yuanliang Dong, Yuchen Liu, Yue Ma, Yue Yu, Yuxing Xiang, Zhaojun Huang, Zhenru Lin, Zhipeng Xu, Zhiyang Chen, Zhonghua Deng, Zihan Zhang, Zihao Yue

机构 * LLM-Core Xiaomi(LLM-Core小米)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 MiMo-V2-Flash通过混合注意力架构和多教师在线蒸馏技术,实现高效推理和代理能力,开源模型权重促进开放研究。

Comments 31 pages, technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05214 2026-01-09 cs.AI 57%

Internal Representations as Indicators of Hallucinations in Agent Tool Selection

内部表示作为代理工具选择中的幻觉指示器

Kait Healy, Bharathi Srinivasan, Visakh Madathil, Jing Wu

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出了一种利用LLM内部表示实时检测工具调用幻觉的方法,通过减少计算开销实现高准确率的检测,尤其在参数和工具选择方面表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04670 2026-01-09 cs.LG 57%

Learning Dynamics in RL Post-Training for Language Models

在语言模型中学习动态的强化学习后训练

Akiyoshi Tomihari

机构 * Department of Computer Science, The University of Tokyo(东京大学计算机科学系)

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出分类器优先强化学习(CF-RL),通过优先更新分类器来提升语言模型的对齐性和推理能力,揭示了RL后训练中学习动态的机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04436 2026-01-09 cs.CL 57%

Learning to Simulate Human Dialogue

学习模拟人类对话

Kanishk Gandhi, Agam Bhatia, Noah D. Goodman

机构 * Stanford University(斯坦福大学)

专题命中 其他推理 :chain-of-thought(abstract);分类 cs.CL

AI总结 本文研究了通过直接最大化真实人类对话的对数概率来提高对话预测效果,发现基于评判者奖励的方法在某些情况下表现不佳,而直接优化对数概率能更准确地预测人类对话。

Comments Kanishk Gandhi and Agam Bhatia contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04243 2026-01-09 cs.CR cs.AI 57%

Integrating Multi-Agent Simulation, Behavioral Forensics, and Trust-Aware Machine Learning for Adaptive Insider Threat Detection

融合多智能体仿真、行为取证和基于信任的机器学习的自适应内部威胁检测

Firdous Kausar, Asmah Muallem, Naw Safrin Sattar, Mohamed Zakaria Kurdi

机构 * Department of Computer Science(计算机科学系)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出融合多智能体仿真、行为取证和基于信任的机器学习的自适应内部威胁检测框架,通过不同系统变体验证了认知上下文、证据门控验证和预训练通信校准对提升检测精度和降低误报的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07267 2026-01-09 cs.AI 57%

Beyond Detection: Exploring Evidence-based Multi-Agent Debate for Misinformation Intervention and Persuasion

超越检测:探索基于证据的多智能体辩论用于虚假信息干预与说服

Chen Han, Yijia Ma, Jin Tan, Wenzhen Zheng, Xijin Tang

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出ED2D框架,通过整合事实证据检索,提升虚假信息检测与说服效果,同时揭示MAD系统在干预中的潜力与风险。

Comments This paper has been accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04750 2026-01-09 cs.DC cs.NI 50%

Cognitive Infrastructure: A Unified DCIM Framework for AI Data Centers

认知基础设施:面向AI数据中心的统一DCIM框架

Krishna Chaitanya Sunkara

专题命中 其他推理 :reasoning(abstract)

AI总结 本文提出DCIM 3.0框架,通过知识图谱、热模型和UDCP协议,解决AI数据中心在自动化、可持续性和数字孪生设计中的关键问题。

Comments 71 pages, 10 figures, 5 tables, 9 chapters including cases study. Published independently under Creative Commons BY 4.0. Includes comprehensive technical diagrams, quantitative models, JSON schema specifications, and production deployment validation.This is comprehensive manuscript synthesizing original research and systems engineering practices in AI Scale data center infrastructure management

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04706 2026-01-09 cs.CV 50%

Forge-and-Quench: Enhancing Image Generation for Higher Fidelity in Unified Multimodal Models

锻造与淬火:提升统一多模态模型中图像生成的高保真度

Yanbing Zeng, Jia Wang, Hanghang Ma, Junqiang Wu, Jie Zhu, Xiaoming Wei, Jie Hu

机构 * Meituan(美团)

专题命中 其他推理 :reasoning(abstract)

AI总结 本文提出Forge-and-Quench框架,通过利用理解模型增强生成图像的保真度和细节,提升多模态模型的生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏