arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-27 至 2026-01-27 共收录 21 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 21 篇

2601.17420 2026-01-27 cs.CV 93%

CoT-Seg: Rethinking Segmentation with Chain-of-Thought Reasoning and Self-Correction

CoT-Seg:重新思考基于链式推理的分割

Shiu-hong Kao, Chak Ho Huang, Huaiqian Liu, Yu-Wing Tai, Chi-Keung Tang

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Dartmouth College(达特茅斯学院)

专题命中 复杂问题求解 :CoT(title,abstract);reasoning(title,abstract);chain-of-thought(title,abstract);self-correction(title,abstract)

AI总结 CoT-Seg通过结合链式推理和自我纠正,提升复杂分割任务的可靠性与鲁棒性,适用于模糊或错误多发的场景。

Comments Project page: https://danielshkao.github.io/cot-seg.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16986 2026-01-27 cs.CL cs.AI cs.LG 87%

Crystal-KV: Efficient KV Cache Management for Chain-of-Thought LLMs via Answer-First Principle

Crystal-KV: 通过答案优先原则高效管理链式推理LLM的KV缓存

Zihan Wang, Cheng Tang, Lei Gong, Cheng Li, Chao Wang, teng wang, Wenqi Lou, Xuehai Zhou

机构 * School of Computer Science and Technology, University of Science and Technology of China(计算机科学与技术学院,中国科学技术大学) University of Science and Technology of China(中国科学技术大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(人工智能研究所,合肥综合性国家科学中心) Suzhou Institute for Advanced Research, University of Science and Technology of China(苏州先进研究院,中国科学技术大学)

专题命中 复杂问题求解 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Crystal-KV通过答案优先原则高效管理链式推理LLM的KV缓存,提升缓存压缩和推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.10688 2026-01-27 cs.LG cs.AI cs.CC cs.CL 82%

Neural Algorithmic Reasoning for Hypergraphs with Looped Transformers

具有循环变换器的超图神经算法推理

Zekai Huang, Yingyu Liang, Zhenmei Shi, Zhao Song, Zhen Zhuang

机构 * Department of XXX, University of YYY, Location, Country(YYY大学XXX系) School of ZZZ, Institute of WWW, Location, Country(WWW研究所ZZZ学院)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出基于循环变换器的超图神经算法推理方法,通过退化机制和超边感知编码方案模拟超图算法,展示其在高维数据处理中的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17982 2026-01-27 cs.CL cs.AI 81%

SD-E$^2$: Semantic Exploration for Reasoning Under Token Budgets

SD-E$^2$: 语义探索用于受限令牌预算下的推理

Kshitij Mishra, Nils Lukas, Salem Lahlou

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 SD-E$^2$通过语义多样性奖励提升小型语言模型在受限令牌预算下的推理能力,实现对复杂问题的高效探索与利用。

Comments Accepted at EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17275 2026-01-27 cs.LG cs.AI 81%

Latent-Space Contrastive Reinforcement Learning for Stable and Efficient LLM Reasoning

潜在空间对比强化学习用于稳定高效的LLM推理

Lianlei Shan, Han Chen, Yixuan Wang, Zhenjie Liu, Wei Li

机构 * University of Chinese Academy of Sciences(中国科学院大学) EvolutionLeap(进化跃迁) Tsinghua University(清华大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本研究提出深度潜在推理(DLR),通过潜在空间对比强化学习提升LLM在复杂推理任务中的稳定性与效率。

Comments 12 pages,

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11233 2026-01-27 cs.AI 79%

STaR: Towards Effective and Stable Table Reasoning via Slow-Thinking Large Language Models

STaR:通过慢思考大语言模型实现有效的稳定表格推理

Huajian Zhang, Mingyue Cheng, Yucong Luo, Xiaoyu Tao

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 STaR通过慢思考机制提升表格推理的有效性和稳定性,采用两阶段训练框架和不确定性量化技术,在领域内和领域外均取得优异表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17566 2026-01-27 cs.CV 78%

Sponge Tool Attack: Stealthy Denial-of-Efficiency against Tool-Augmented Agentic Reasoning

Sponge Tool Attack:针对工具增强代理推理的隐蔽低效攻击

Qi Li, Xinchao Wang

专题命中 复杂问题求解 :reasoning(title,abstract)

AI总结 Sponge Tool Attack通过重写输入提示,隐蔽地破坏工具增强代理推理的效率,验证了其在多种模型和工具上的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17435 2026-01-27 cs.SE cs.AI 70%

Towards a Declarative Agentic Layer for Intelligent Agents in MCP-Based Server Ecosystems

迈向基于MCP服务器生态系统的声明性代理层

Maria Jesus Rodriguez-Sanchez, Manuel Noguera, Angel Ruiz-Zafra, Kawtar Benghazi

专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出了一种声明性代理层,旨在解决基于MCP服务器生态系统中代理工作流的可靠性问题,通过明确的架构结构提升任务执行的可验证性和可重复性。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18129 2026-01-27 cs.CL cs.AI 62%

Typhoon-S: Minimal Open Post-Training for Sovereign Large Language Models

Typhoon-S: 最小化开放的训练后处理以实现主权大语言模型

Kunat Pipatanakul, Pittawat Taveekitworachai

机构 * Typhoon, SCB 10X(Typhoon,SCB 10X)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 Typhoon-S通过最小化开放的训练后处理方法,实现主权大语言模型的可采用性和主权能力,无需大规模数据或复杂调优流程。

Comments 19 pages. Code is publicly available at https://github.com/scb-10x/typhoon-s . Datasets and model weights are available at https://huggingface.co/collections/typhoon-ai/typhoon-s

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17869 2026-01-27 cs.CL cs.LG 62%

On the Emergence and Test-Time Use of Structural Information in Large Language Models

关于大型语言模型中结构信息的出现及其测试时使用

Michelle Chao Chen, Moritz Miller, Bernhard Schölkopf, Siyuan Guo

机构 * ETH Zurich(苏黎世联邦理工学院) Max Planck Institute for Intelligent Systems(智能系统马克斯·普朗克研究所) University of Cambridge(剑桥大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本研究探讨了大型语言模型如何学习和利用结构信息,发现其在复杂推理任务中表现突出,但测试时组合生成能力仍受限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14243 2026-01-27 cs.LG cs.CL 62%

Jet-RL: Enabling On-Policy FP8 Reinforcement Learning with Unified Training and Rollout Precision Flow

Jet-RL: 通过统一训练和回放精度流实现基于策略的FP8强化学习

Haocheng Xi, Charlie Ruan, Peiyuan Liao, Yujun Lin, Han Cai, Yilong Zhao, Shuo Yang, Kurt Keutzer, Song Han, Ligeng Zhu

机构 * NVIDIA MIT(麻省理工学院) UC Berkeley(加州大学伯克利分校)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 Jet-RL通过统一FP8精度流实现稳定高效的强化学习训练,显著提升训练和回放速度,同时保持精度稳定。

Comments 11 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15955 2026-01-27 cs.LG cs.AI 62%

How Good Are LLMs at Processing Tool Outputs?

大型语言模型在处理工具输出方面有多好?

Kiran Kate, Yara Rizk, Poulami Ghosh, Ashu Gulati, Tathagata Chakraborti, Zidane Wright, Mayank Agarwal

机构 * IBM Research(IBM研究院) Persistent Systems Grab

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了LLMs处理工具输出的能力,发现即使在前沿模型上,JSON处理仍具挑战性,不同提示策略影响性能差异达3%-50%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08741 2026-01-27 cs.CL cs.AI 62%

Coordinates from Context: Using LLMs to Ground Complex Location References

基于上下文的坐标:利用大语言模型来定位复杂位置参考

Tessa Masis, Brendan O'Connor

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种利用大语言模型来处理复杂位置参考地理编码的方法,展示了其在性能上的优势。

Comments EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18281 2026-01-27 cs.CL cs.SD 57%

Reflecting Twice before Speaking with Empathy: Self-Reflective Alternating Inference for Empathy-Aware End-to-End Spoken Dialogue

在富有同理心之前两次反思:用于富有同理心的端到端语音对话的自我反思交替推理

Yuhang Jia, Pei Liu, Haoqin Sun, Jiaming Zhou, Xuxin Cheng, Cao Liu, Ke Zeng, Xunliang Cai, Yong Qin

机构 * College of Computer Science, Nankai University(南开大学计算机科学学院) Meituan LongCat Interaction Team(美团LongCat交互团队)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 ReEmpathy通过自我反思交替推理机制提升语音对话的同理心表现,实现更情感智能的人机交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17971 2026-01-27 cs.CL 57%

LLMs as Cultural Archives: Cultural Commonsense Knowledge Graph Extraction

LLMs作为文化档案:文化常识知识图谱提取

Junior Cedric Tonga, Chen Cecilia Liu, Iryna Gurevych, Fajri Koto

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学) Ubiquitous Knowledge Processing Lab (UKP Lab)(无处不在知识处理实验室) Department of Computer Science(计算机科学系) Hessian Center for AI (hessian.AI)(黑森人工智能中心) Technische Universität Darmstadt(德累斯顿技术大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本文提出一种基于提示的框架,用于构建文化常识知识图谱,通过LLMs作为文化档案提取文化特定知识,提升文化推理和故事生成性能。

Comments EACL 2026 MAIN

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17735 2026-01-27 cs.AI 57%

ReFuGe: Feature Generation for Prediction Tasks on Relational Databases with LLM Agents

ReFuGe:基于LLM代理的关联数据库预测任务特征生成

Kyungho Kim, Geon Lee, Juyeon Kim, Dongwon Choi, Shinhwan Kang, Kijung Shin

机构 * KAIST(韩国科学技术院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 ReFuGe通过LLM代理生成关联数据库预测任务的特征,提升预测性能。

Comments Accepted in ACM WWW 2026 (Short Paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14047 2026-01-27 cs.GT cs.AI cs.MA cs.SI econ.TH 57%

Collective intelligence in science: direct elicitation of diverse information from experts with unknown information structure

科学中的集体智慧:通过未知信息结构直接获取专家多样化信息

Alexey V. Osipov, Nikolay N. Osipov

机构 * Swiss Re Institute(瑞士再保险学院) St. Petersburg State University(圣彼得堡国立大学) St. Petersburg Department of V. A. Steklov Institute of Mathematics of the Russian Academy of Sciences(俄罗斯科学院圣彼得堡维克托·阿列克谢耶维奇·斯捷克洛夫数学研究所圣彼得堡分所) HSE University(俄罗斯高等经济大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 通过结合预测市场和聊天机制,实现专家在未知信息结构下高效共享信息,从而提升科学问题的集体分析效率。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04861 2026-01-27 cs.AI 57%

Orchestrating Intelligence: Confidence-Aware Routing for Efficient Multi-Agent Collaboration across Multi-Scale Models

协调智能:基于置信度的路由机制用于高效多智能体协作跨多尺度模型

Jingbo Wang, Sendong Zhao, Jiatong Liu, Haochun Wang, Wanting Li, Bing Qin, Ting Liu

机构 * Research Center for Social Computing and Information Retrieval, Harbin Institute of Technology, China(社会科学与信息检索研究中心,哈尔滨工业大学,中国) the Institute of Automation of the Chinese Academy of Sciences, China(中国科学院自动化研究所,中国)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 OI-MAS通过基于置信度的路由机制,实现高效多智能体协作,提升准确率并降低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11266 2026-01-27 cs.SE cs.AI 57%

Live API-Bench: 2500+ Live APIs for Testing Multi-Step Tool Calling

Benjamin Elder, Anupama Murthi, Jungkoo Kang, Ankita Rajaram Naik, Kiran Kate, Kinjal Basu, Danish Contractor

机构 * IBM Research AI(IBM人工智能研究实验室)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

Comments 11+32 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04058 2026-01-27 cs.GR cs.CV 50%

SMooGPT: Stylized Motion Generation using Large Language Models

SMooGPT:利用大语言模型进行风格化动作生成

Lei Zhong, Yi Yang, Changjian Li

机构 * University of Edinburgh(爱丁堡大学)

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 SMooGPT通过利用大语言模型的推理、组合和生成能力,实现风格化动作生成,提升动作控制和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17997 2026-01-27 physics.app-ph 50%

Generative metamaterials based on large language models

基于大语言模型的生成超材料

Zhenyang Gao, Gengchen Zheng, Pengyuan Ren, Hongsong Wang, Kun Zhou, Minh-Son Pham, Yi Wu, Yu Zou, Chu Lun Alex Leung, Yuanyuan Tian, Yang Lu, Haowei Wang, Hongze Wang

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 基于大语言模型开发生成超材料设计工具,实现快速高效的设计生成与诊断进化,推动高通量超材料发现。

详情

展开后加载摘要…

URL PDF HTML 收藏