arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 5021 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 5021 篇

2606.08816 2026-06-09 cs.LG cs.AI 新提交 81%

Knowledge Graphs and Reasoning LLMs for Finding Simple Yet Effective Transcriptomic Perturbation Predictors

知识图谱与推理大语言模型用于寻找简单而有效的转录组扰动预测因子

Jake Fawkes, Liam Hodgson, Jason Hartford

机构 * University College London(伦敦大学学院) University of Manchester(曼彻斯特大学) Valence Labs(Valence实验室) Recursion(Recursion公司)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 利用知识图谱的K近邻方法在基因敲除扰动预测中表现优异,结合强化学习优化的LLM可达到最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03106 2026-06-09 cs.CL cs.AI 81%

Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback

Critique-GRPO:通过自然语言和数值反馈提升大语言模型推理能力

Xiaoying Zhang, Yipeng Zhang, Hao Sun, Kaituo Feng, Chaochao Lu, Chao Yang, Helen Meng

机构 * HCCL, The Chinese University of Hong Kong, Hong Kong, China(香港中文大学人工智能研究中心,香港,中国) University of Cambridge, Cambridge, United Kingdom(剑桥大学,剑桥,英国) MMLab, The Chinese University of Hong Kong, Hong Kong, China(香港中文大学人工智能实验室,香港,中国) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室,上海,中国)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出Critique-GRPO框架,结合自然语言和数值反馈提升LLM推理能力,实验显示其在多个任务中优于传统方法,显著提升推理性能。

Comments Accepted by ICML 2026 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04823 2026-06-04 cs.AI cs.CL cs.MA 81%

R-APS: Compositional Reasoning and In-Context Meta-Learning for Constrained Design via Reflective Adversarial Pareto Search

R-APS:基于反思性对抗帕累托搜索的组合推理与上下文元学习用于约束设计

João Pedro Gandarela, Thiago Rios, Stefan Menzel, André Freitas

机构 * Idiap Research Institute(Idiap研究 institute) École Polytechnique Fédérale de Lausanne(瑞士联邦理工学院) Honda Research Institute Europe(本田欧洲研究机构) Department of Computer Science, University of Manchester(曼彻斯特大学计算机科学系) National Biomarker Centre, CRUK-MI, University of Manchester(曼彻斯特大学国家生物标志物中心)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 提出R-APS方法,通过推理模式分解、分阶段组合推理、敏感性引导对抗测试和元归纳规则提取,联合解决LLM在代理设置中的错误传播、最坏情况扰动和知识失效问题,在平面机构合成任务上实现更紧的鲁棒性证书和更快的迭代速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28829 2026-06-04 cs.CL cs.AI cs.CY 81%

Aryabhata 2: Scaling Reinforcement Learning for Advanced STEM Reasoning

Aryabhata 2:扩展强化学习以提升高级STEM推理能力

Ritvik Rastogi, Vishal Singh, Tejas Chaudhari, Sandeep Varma

机构 * PhysicsWallah

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出Aryabhata 2,一个通过强化学习后训练在竞争性STEM考试中提升推理能力的语言模型,在JEE、NEET等基准上超越基础模型且输出token减少高达64%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12329 2026-06-04 cs.CL cs.AI 81%

Speculative Thinking: Enhancing Small-Model Reasoning with Large Model Guidance at Inference Time

推测性思考:在推理时利用大模型指导增强小模型推理能力

Wang Yang, Xiang Yue, Vipin Chaudhary, Xiaotian Han

机构 * Case Western Reserve University(凯斯西储大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 提出一种无需训练的推测性思考框架,通过让大推理模型在推理层面引导小模型,在提升小模型推理准确率的同时缩短输出长度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02465 2026-06-02 cs.CL cs.AI 81%

Learning When to Translate for Multilingual Reasoning

学习何时翻译以实现多语言推理

Deokhyung Kang, Hyounghun Kim, Gary Geunbae Lee

机构 * Graduate School of Artificial Intelligence(人工智能研究生院) Department of Computer Science & Engineering(计算机科学与工程系) POSTECH

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 提出Luar框架,通过强化学习训练推理语言模型在直接理解不可靠时选择性调用翻译,从而缩小多语言推理差距。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01991 2026-06-02 cs.AI cs.CL cs.CY 81%

SafeMCP: Proactive Power Regulation for LLM Agent Defense via Environment-Grounded Look-Ahead Reasoning

SafeMCP:基于环境接地前瞻推理的LLM智能体防御主动功率调节

Lichao Wang, Zhaoxing Ren, Tianzhuo Yang, Jiaming Ji, Chi Harold Liu, Yaodong Yang, Juntao Dai

机构 * Beijing Institute of Technology(北京理工大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 针对LLM智能体因动作空间扩大而面临功率寻求风险,提出SafeMCP服务器端防御插件,通过内部世界模型进行前瞻推理,实现主动工具过滤和即时干预两级防御,在保持智能体效用的同时有效降低风险。

Comments Accepted to the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026), Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21762 2026-06-01 cs.CL cs.AI 81%

Reasoning-Intensive Regression

推理密集型回归

Diane Tchuindjo, Omar Khattab

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 针对推理密集型回归任务,提出MENTAT方法,结合批量反思提示优化与神经集成学习,在基准测试中相比基线提升高达65%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29327 2026-05-29 cs.CL cs.LG 81%

Reasoning-preserved Efficient Distillation of Large Language Models via Activation-aware Initialization

保留推理能力的大语言模型高效蒸馏:基于激活感知初始化

Junlin He, Yihong Tang, Tong Nie, Guilong Li, Binyu Yang, Jinxiao Du, Lijun Sun, Wei Ma

机构 * The Hong Kong Polytechnic University, Hong Kong SAR, China(香港理工大学) McGill University, Montreal, QC, Canada(麦吉尔大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 针对高效蒸馏导致的多步推理能力严重下降(推理崩溃),提出RED方法,通过激活感知初始化投影矩阵为通道选择矩阵,理论缓解有效秩崩溃,恢复推理能力并保持高效训练与通用性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29123 2026-05-29 cs.AI cs.CL 81%

The Confidence Shortcut: A Reasoning Failure Mode of Masked Diffusion Models

置信捷径:掩码扩散模型的一种推理失败模式

Dueun Kim, Albert No

机构 * Department of Artificial Intelligence, Yonsei University(延世大学人工智能系)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文发现掩码扩散模型在置信度解码时存在推理失败模式,表现为过早预测局部易解部分而忽略长程依赖,导致复杂输入错误率升高,而随机掩码训练能保持推理轨迹条件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28305 2026-05-28 cs.CL cs.AI 81%

Revisiting Anthropomorphic Reflection Markers in Large Language Model Reasoning

重新审视大语言模型推理中的拟人化反思标记

Yahan Yu, Noa Nakanishi, Fei Cheng

机构 * Kyoto University(京都大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文通过提示级和令牌级干预抑制拟人化反思标记,发现这些标记并非推理性能的必要条件,且抑制后模型仍能进行无标记验证,表明它们更多是表面线索而非可靠反思代理。

Comments 15 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28014 2026-05-28 cs.CL cs.LG 81%

ROSD: Reflective On-Policy Self-Distillation for Language Model Reasoning across Domains

ROSD: 面向跨领域语言模型推理的反思式同策略自蒸馏

Ziqi Zhao, Xinyu Ma, Liu Yang, Yujie Feng, Daiting Shi, Jingzhou He, Xin Xin, Zhaochun Ren, Xiao-Ming Wu

机构 * The Hong Kong Polytechnic University(香港理工大学) Baidu Inc.(百度公司) Shandong University(山东大学) Leiden University(莱顿大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 提出反思式同策略自蒸馏(ROSD)框架,通过反思引导的错误定位蒸馏将参考解模仿转为针对性推理修正,提升领域内推理和跨领域泛化能力。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06999 2026-05-28 cs.CV cs.CL cs.LG 81%

Learning Deliberately, Acting Intuitively: Unlocking Test-Time Reasoning in Multimodal LLMs

有意学习,直觉行动:解锁多模态大语言模型的测试时推理能力

Yahan Yu, Yuyang Dong, Masafumi Oyamada

机构 * Kyoto University(京都大学) Initial S NEC Corporation, Japan(日本NEC公司)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 提出D2I框架,通过训练时使用基于规则的格式奖励进行有意推理以增强模态对齐,推理时移除显式策略转为直觉推理,从而提升多模态大语言模型的推理能力,无需额外标注或复杂奖励。

Comments 22 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01489 2026-05-27 cs.AI cs.CL 81%

SciResearcher: Scaling Deep Research Agents for Frontier Scientific Reasoning

SciResearcher: 面向前沿科学推理的深度研究智能体规模化

Tianshi Zheng, Rui Wang, Xiyun Li, Kelvin Kiu Wai Tam, Newt Nguyen Kim Hue Nam, Wei Fan, Yangqiu Song, Tianqing Fang

机构 * HKUST(香港科技大学) CUHK(香港大学) Tencent AI Lab(腾讯AI实验室)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 提出SciResearcher框架,通过合成基于学术证据的概念与计算任务并训练智能体,在HLE-Bio/Chem-Gold等基准上达到最优性能。

Comments 23 pages, 6 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21008 2026-05-27 cs.LG cs.AI math.OC 81%

ORLoopBench: Solver-in-the-Loop Benchmarks for Self-Correction and Behavioral Rationality in Operations Research

ORLoopBench:运筹学中自我修正与行为理性的求解器在环基准测试

Ruicheng Ao, David Simchi-Levi, Xinshang Wang

专题命中 复杂问题求解 :self-correction(title,abstract);分类 cs.AI、cs.LG

AI总结 提出ORLoopBench基准套件,通过将不可行模型修复形式化为求解器在环马尔可夫决策过程,利用不可约不可行子系统(IIS)反馈,结合验证强化学习训练(RLVR),使8B模型在LP修复上超越前沿API(95.3% vs 92.4% RR@5),并揭示全模型代码再生中的语义漂移问题。

Comments 58 pages, accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14443 2026-05-15 cs.AI cs.LG cs.MA 81%

Prompting Policies for Multi-step Reasoning and Tool-Use in Black-box LLMs with Iterative Distillation of Experience

多步推理和工具使用中黑盒LLM的提示策略:基于经验迭代蒸馏的强化学习框架

Krishna Sayana, Ketan Todi, Ambarish Jash

机构 * Google Research(谷歌研究)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于经验迭代蒸馏的强化学习框架,用于训练提示策略以提升黑盒LLM的多步推理和工具使用能力,实验显示在逻辑推理和工具使用任务中性能显著提升。

Comments 10 pages and reference, appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17062 2026-05-13 cs.CL cs.AI 81%

Investigating Thinking Behaviours of Reasoning-Based Language Models for Social Bias Mitigation

探究基于推理的语言模型在缓解社会偏见中的思维行为

Guoqing Luo, Iffat Maab, Lili Mou, Junichi Yamagishi

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文研究了基于推理的语言模型在缓解社会偏见中的思维机制,发现两种导致偏见累积的失败模式,并提出轻量级提示方法减少偏见同时保持准确性。

Comments Due to issues found with the annotations in Section 4.3, we have decided to withdraw this preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11388 2026-05-13 cs.CL cs.AI 81%

Deep Reasoning in General Purpose Agents via Structured Meta-Cognition

通过结构化元认知实现通用代理中的深度推理

Dean Light, Michael Theologitis, Kshitish Ghate, Shuyue Stella Li, Benjamin Newman, Chirag Shah, Aylin Caliskan, Pang Wei Koh, Dan Suciu, Yulia Tsvetkov

机构 * University of Washington(华盛顿大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出深度推理方法,通过结构化元认知构建任务特定框架,提升复杂任务处理能力,在四个基准测试中超越现有方法,减少早终止和幻觉。

Comments Preprint under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10082 2026-05-13 cs.CL cs.LG 81%

FERA: Uncertainty-Aware Federated Reasoning for Large Language Models

FERA:面向大语言模型的不确定性感知联邦推理

Ruhan Wang, Chengkai Huang, Zhiyong Wang, Junda Wu, Rui Wang, Tong Yu, Julian McAuley, Lina Yao, Dongruo Zhou

机构 * Indiana University(印第安纳大学) The University of New South Wales(新南威尔士大学) The Chinese University of Hong Kong(香港中文大学) University of California San Diego(加州大学圣地亚哥分校) Adobe Research(Adobe研究院)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 FERA通过迭代服务器-客户端协同细化,解决联邦推理中客户端可靠性依赖查询的问题,提升多步骤推理能力,实验表明其在多个推理基准上优于联邦训练和无训练基线。

Comments 44 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10268 2026-05-12 cs.CL cs.AI 81%

MemReread: Enhancing Agentic Long-Context Reasoning via Memory-Guided Rereading

MemReread: 通过记忆引导重读增强代理长上下文推理

Baibei Ji, Xiaoyang Weng, Juntao Li, Zecheng Tang, Yihang Lou, Min Zhang

机构 * Soochow University(苏州大学) Peking University(北京大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 MemReread通过记忆引导重读机制,在线性处理文档片段时避免二次检索,实现非线性推理并保持文档理解的逻辑流,通过强化学习框架提升长上下文推理任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06285 2026-05-08 cs.CL cs.LG 81%

LatentRAG: Latent Reasoning and Retrieval for Efficient Agentic RAG

LatentRAG: 基于潜在空间的高效代理RAG推理与检索

Yijia Zheng, Marcel Worring

机构 * University of Amsterdam(阿姆斯特丹大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 LatentRAG通过将推理与检索从离散语言空间转移到连续潜在空间,提升代理RAG的效率,实验表明其在七种基准数据集上性能与显式方法相当,推理延迟降低约90%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11509 2026-05-08 cs.CL cs.AI cs.CV 81%

Multimodal Fact-Level Attribution for Verifiable Reasoning

多模态事实级归因用于可验证推理

David Wan, Han Wang, Ziyang Wang, Elias Stengel-Eskin, Hyunji Lee, Mohit Bansal

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出MuRGAt基准,用于评估多模态事实归因能力,要求模型在复杂推理中生成明确推理和精确引用,揭示强模型在正确推理下仍易产生幻觉,且增加推理深度或结构化归因会降低准确性。

Comments Accepted to ICML 2026. Code and data are available at https://github.com/meetdavidwan/murgat

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01495 2026-05-05 cs.CL cs.AI 81%

FT-RAG: A Fine-grained Retrieval-Augmented Generation Framework for Complex Table Reasoning

FT-RAG:一种面向复杂表格推理的细粒度检索增强生成框架

Zebin Guo, Weidong Geng, Ruichen Mao

机构 * Georgia Institute of Technology(佐治亚理工学院) Zhejiang University(浙江大学) Zhejiang Lab(浙江实验室)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 FT-RAG通过细粒度检索和多模态融合提升表格推理能力,引入多表RAG库增强训练数据,实现表格和单元格命中率显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10368 2026-05-04 cs.CL cs.AI 81%

Exploring the System 1 Thinking Capability of Large Reasoning Models

探索大型推理模型的系统1思维能力

Wenyuan Zhang, Shuaiyi Nie, Xinghua Zhang, Zefeng Zhang, Tingwen Liu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文研究大型推理模型的系统1思维能力,提出S1-Bench基准测试,发现现有模型在简单问题上存在准确率低和效率差的问题,揭示了模型对问题难度的隐含编码。

Comments Accepted by IJCAI 2026 (Main Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26649 2026-04-30 cs.IR cs.AI cs.CL 81%

When to Retrieve During Reasoning: Adaptive Retrieval for Large Reasoning Models

在推理中何时检索:面向大推理模型的自适应检索

Dongxin Guo, Jikun Wu, Siu Ming Yiu

机构 * The University of Hong Kong(香港大学) Brain Investing Limited(Brain Investing有限公司) Stellaris AI Limited(Stellaris AI有限公司)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出ReaLM-Retrieve框架,通过三方面创新解决推理模型与检索增强生成的不匹配问题,提升答案F1分数并减少检索调用次数。

Comments 12 pages, 3 figures, 9 tables. Accepted at SIGIR 2026 (49th International ACM SIGIR Conference on Research and Development in Information Retrieval), Melbourne, Australia

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22154 2026-04-29 cs.AI cs.CL 81%

Exploring Reasoning Reward Model for Agents

探索用于智能体的推理奖励模型

Kaixuan Fan, Kaituo Feng, Manyuan Zhang, Tianshuo Peng, Zhixun Li, Yilei Jiang, Shuang Chen, Peng Pei, Xunliang Cai, Xiangyu Yue

机构 * MMLab, CUHK(CUHK 机器学习实验室) Meituan(美团) SEEM, CUHK(CUHK 系统工程与工程管理系)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出Agent-RRM模型,通过结构化反馈提升智能体推理能力,采用三种集成策略在12个基准测试中取得显著性能提升。

Comments ACL 2026 Findings, Project page: https://github.com/kxfan2002/Reagent

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10377 2026-04-27 cs.LG cs.AI stat.ME 81%

Causal Concept Graphs in LLM Latent Space for Stepwise Reasoning

在LLM潜在空间中使用因果概念图进行分步推理

Md Muntaqim Meherab, Noor Islam S. Mohammad, Faiza Feroz

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出因果概念图(CCG),通过结合任务条件稀疏自编码器和可微结构学习方法,在LLM潜在空间中建模概念间的因果依赖关系,提升了多步推理的效果。

Comments We have recently encountered author conflicts related to this work and therefore respectfully request the withdrawal of this paper. We believe this step is necessary to address the situation appropriately and maintain academic integrity in the submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21584 2026-04-24 cs.AI cs.CE cs.LG 81%

CoFEE: Reasoning Control for LLM-Based Feature Discovery

CoFEE:基于LLM的特征发现的推理控制

Maximilian Westermann, Ben Griffin, Aaron Ontoyin Yin, Zakari Salifu, Yagiz Ihlamur, Kelvin Amoaba, Joseph Ternasky, Fuat Alican, Yigit Ihlamur

机构 * University of Oxford(牛津大学) Vela Research(Vela研究) Amazon(亚马逊)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出CoFEE框架,通过引入认知行为提升LLM特征发现的预测性和效率,实验显示其在预测性和成本控制上优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24239 2026-04-24 cs.LG cs.AI 81%

ChessArena: A Chess Testbed for Evaluating Strategic Reasoning Capabilities of Large Language Models

ChessArena: 一个用于评估大语言模型战略推理能力的国际象棋测试平台

Jincheng Liu, Sijun He, Jingjing Wu, Xiangsen Wang, Yang Chen, Zhaoqi Kuang, Siqi Bao, Yuan Yao

机构 * State Key Laboratory of Novel Software Technology(新型软件技术国家重点实验室) Baidu(百度) University of Electronic Science and Technology of China(电子科技大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出ChessArena测试平台,用于评估大语言模型的战略推理能力,测试了13个模型在800多局游戏中表现,发现无模型能击败业余水平的Maia-1100,但经过微调的Qwen3-8B模型表现显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24803 2026-04-22 cs.LG cs.AI 81%

TimeOmni-1: Incentivizing Complex Reasoning with Time Series in Large Language Models

TimeOmni-1:通过时间序列激励大型语言模型的复杂推理

Tong Guan, Zijie Meng, Dianqi Li, Shiyu Wang, Chao-Han Huck Yang, Qingsong Wen, Zuozhu Liu, Sabato Marco Siniscalchi, Ming Jin, Shirui Pan

机构 * Griffith University(格里菲斯大学) Zhejiang University(浙江大学) NVIDIA(英伟达) Squirrel Ai Learning University of Palermo(帕尔米奥大学) Norwegian University of Science and Technology(挪威科学技术大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出TimeOmni-1,首个统一推理模型,通过时间序列推理解决多样化现实问题,提升因果发现和有效响应率。

Comments Accepted by the 14th International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏