arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-13 至 2026-01-13 共收录 21 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 21 篇

2601.07780 2026-01-13 cs.CL 87%

Enhancing Self-Correction in Large Language Models through Multi-Perspective Reflection

通过多视角反思增强大语言模型的自我纠正能力

Mariana Costa, Alberlucia Rafael Soarez, Daniel Kim, Camila Ferreira

机构 * University of Brasilia(巴西大学)

专题命中 复杂问题求解 :self-correction(title,abstract);reasoning(abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 PR-CoT通过多视角反思提升大语言模型的自我纠正能力,有效增强推理的逻辑一致性和准确性,尤其在伦理决策等复杂领域表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04472 2026-01-13 cs.LG cs.AI 86%

DAST: Difficulty-Adaptive Slow-Thinking for Large Reasoning Models

DAST: 为大推理模型引入难度自适应的慢思考

Yi Shen, Jian Zhang, Jieyun Huang, Shuming Shi, Wenjing Zhang, Jiangze Yan, Ning Wang, Kai Wang, Zhaoxiang Liu, Shiguo Lian

机构 * Unicom Data Intelligence(中国unicom数据智能) Data Science & Artificial Intelligence Research Institute(数据科学与人工智能研究院)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI、cs.LG

AI总结 DAST通过自适应调整推理步骤长度,有效减少大模型的过度思考问题,同时保持复杂任务的推理准确性。

Comments EMNLP 2025 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06471 2026-01-13 cs.CL 83%

Test-Time Scaling of Reasoning Models for Machine Translation

推理模型在机器翻译中的测试时扩展

Zihao Li, Shaoxiong Ji, Jörg Tiedemann

机构 * University of Helsinki(赫尔辛基大学) ELLIS Institute Finland(芬兰ELLIS研究所) University of Turku(图尔库大学)

专题命中 复杂问题求解 :reasoning(title,abstract);self-correction(abstract);分类 cs.CL

AI总结 本文研究了推理模型在机器翻译中的测试时扩展效果,发现领域特定微调能提升翻译质量,但通用模型在直接翻译中效果有限,而多步骤自我纠正流程中表现更佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06054 2026-01-13 cs.CL cs.AI 81%

A Multi-Stage Workflow for the Review of Marketing Content with Reasoning Large Language Models

一种基于推理大语言模型的多阶段营销内容审查工作流程

Alberto Purpura, Emily Chen, Swapnil Shinde

机构 * AI Foundations, Capital One(人工智能基础,Capital One)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种基于推理大语言模型的多阶段工作流程,用于自动审查营销内容的合规性,并评估不同微调策略和奖励函数对模型性能的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03519 2026-01-13 cs.RO 80%

A Vision-Language-Action Model with Visual Prompt for OFF-Road Autonomous Driving

一种具有视觉提示的视觉-语言-动作模型用于越野自动驾驶

Liangdong Zhang, Yiming Nie, Haoyang Li, Fanjie Kong, Baobao Zhang, Shunxin Huang, Kai Fu, Chen Min, Liang Xiao

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);planning(abstract)

AI总结 本文提出OFF-EMMA模型,通过视觉提示和COT-SC策略提升越野自动驾驶轨迹规划的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06974 2026-01-13 cs.CL 79%

UETQuintet at BioCreative IX -- MedHopQA: Enhancing Biomedical QA with Selective Multi-hop Reasoning and Contextual Retrieval

UETQuintet在BioCreative IX上的MedHopQA:通过选择性多跳推理和上下文检索增强生物医学问答

Quoc-An Nguyen, Thi-Minh-Thu Vu, Bich-Dat Nguyen, Dinh-Quang-Minh Tran, Hoang-Quynh Le

机构 * VNU University of Engineering and Technology(越南工程大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出MedHopQA模型,通过选择性多跳推理和上下文检索提升生物医学问答性能,在BioCreative IX共享任务中取得第二名成绩。

Comments In Proceedings of the BioCreative IX Challenge and Workshop (BC9): Large Language Models for Clinical and Biomedical NLP, IJCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14319 2026-01-13 cs.AI 79%

Metacognitive Self-Correction for Multi-Agent System via Prototype-Guided Next-Execution Reconstruction

多智能体系统中的元认知自我校正:通过原型引导的下一步执行重建

Xu Shen, Qi Zhang, Song Wang, Zhen Tan, Xinyu Zhao, Laura Yao, Vaishnav Tadiparthi, Hossein Nourkhiz Mahjoub, Ehsan Moradi Pari, Kwonjoon Lee, Tianlong Chen

专题命中 复杂问题求解 :self-correction(title,abstract);分类 cs.AI

AI总结 本文提出MASC框架,通过原型引导和下一步执行重建实现多智能体系统的元认知自我校正,有效提升错误检测精度并减少误差传播。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13130 2026-01-13 cs.CL 79%

MuDRiC: Multi-Dialect Reasoning for Arabic Commonsense Validation

MuDRiC:多方言推理用于阿拉伯常识验证

Kareem Elozeiri, Mervat Abassy, Preslav Nakov, Yuxia Wang

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 MuDRiC通过引入多方言阿拉伯语常识数据集和图卷积网络方法,提升阿拉伯语常识验证性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16787 2026-01-13 cs.CL cs.AI 73%

Credible Plan-Driven RAG Method for Multi-Hop Question Answering

可信计划驱动的RAG方法用于多跳问答

Ningning Zhang, Chi Zhang, Zhizhong Tan, Xingxing Yang, Weiping Deng, Wenyong Wang

机构 * Macau University of Science and Technology(澳门科学技术大学)

专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 PAR-RAG通过引入复杂性感知的计划生成和双验证机制,提升了多跳问答任务中的推理稳定性和事实一致性,实现了更可靠的问答性能。

Comments 24 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06678 2026-01-13 cs.DB 71%

Reflective Reasoning for SQL Generation

面向SQL生成的反思推理

Isabelle Mohr, Joao Gandarela, John Dujany, Andre Freitas

专题命中 复杂问题求解 :reasoning(title)

AI总结 本文提出了一种基于反思细化的文本到SQL框架,通过阶段化生成和反馈机制提升SQL生成的鲁棒性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08521 2026-01-13 cs.AI 70%

FlowSearch: Advancing deep research with dynamic structured knowledge flow

FlowSearch: 通过动态结构化知识流推进深度研究

Yusong Hu, Runmin Ma, Yue Fan, Jinxin Shi, Zongsheng Cao, Yuhao Zhou, Jiakang Yuan, Shuaiyu Zhang, Shiyang Feng, Xiangchao Yan, Shufei Zhang, Wenlong Zhang, Lei Bai, Bo Zhang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 FlowSearch通过动态结构化知识流提升多智能体系统在复杂任务中的推理与执行能力,实现跨学科研究的有效推进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07779 2026-01-13 cs.MA cs.AI cs.CL cs.CV cs.HC 62%

OS-Symphony: A Holistic Framework for Robust and Generalist Computer-Using Agent

OS-Symphony: 一个用于鲁棒且通用计算机使用代理的综合框架

Bowen Yang, Kaiming Jin, Zhenyu Wu, Zhaoyang Liu, Qiushi Sun, Zehao Li, JingJing Xie, Zhoumianze Liu, Fangzhi Xu, Kanzhi Cheng, Qingyun Li, Yian Wang, Yu Qiao, Zun Wang, Zichen Ding

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai AI Laboratory(上海人工智能实验室) National University of Singapore(新加坡国立大学) The Hong Kong University of Science and Technology(香港科学与技术大学) The University of Hong Kong(香港大学) CUHK MMLab(香港中文大学MMLab) Xi’an Jiaotong University(西安交通大学) Nanjing University(南京大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 复杂问题求解 :self-correction(abstract);分类 cs.CL、cs.AI

AI总结 OS-Symphony通过反思记忆代理和多功能工具代理,提升计算机使用代理在长周期任务和新领域中的鲁棒性和泛化能力。

Comments 31 pages, 11 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07054 2026-01-13 cs.CL cs.LG 62%

Fine-Tuning vs. RAG for Multi-Hop Question Answering with Novel Knowledge

基于新知识的多跳问答中微调与RAG的比较

Zhuoyi Yang, Yurun Song, Iftekhar Ahmed, Ian Harris

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文比较了微调与RAG在多跳问答中处理新颖知识的效果,发现RAG在时间新颖信息问答中表现更优,而有监督微调整体准确率最高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06644 2026-01-13 cs.CL cs.AI 62%

Do Language Models Reason Across Languages?

语言模型是否能在不同语言之间进行推理?

Yan Meng, Wafaa Mohammed, Christof Monz

机构 * Language Technology Lab University of Amsterdam(语言技术实验室 阿姆斯特丹大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了语言模型在多语言环境下进行推理的能力,提出了一种三阶段提示方法,有效提升了两跳问答任务的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07263 2026-01-13 cs.CR cs.AI 57%

When Bots Take the Bait: Exposing and Mitigating the Emerging Social Engineering Attack in Web Automation Agent

当机器人上当:揭露和缓解网络自动化代理中新兴的社会工程攻击

Xinyi Wu, Geng Hong, Yueyue Chen, MingXuan Liu, Feier Jin, Xudong Pan, Jiarun Dai, Baojun Liu

机构 * Fudan University(复旦大学) Zhongguancun Laboratory(中关村实验室) Shanghai Innovation Institute(上海创新研究院) Tsinghua University(清华大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 研究提出AgentBait攻击范式,揭示网络自动化代理的社会工程威胁,并设计SUPERVISOR模块有效缓解此类攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06914 2026-01-13 cs.CR cs.AI 57%

Towards Compositional Generalization in LLMs for Smart Contract Security: A Case Study on Reentrancy Vulnerabilities

面向智能合约安全的LLM组合泛化:重入漏洞案例研究

Ying Zhou, Jiacheng Wei, Yu Qi, Faguo Wu, Xiao Zhang

机构 * School of Artificial Intelligence, Beijing, China(人工智能学院,北京,中国) Beijing Advanced Innovation Center for Future Blockchain(未来区块链与隐私计算先进创新中心)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文提出基于原子任务分解与融合的后训练算法,通过分解重入漏洞检测任务提升LLM在智能合约安全检测中的准确率与召回率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05191 2026-01-13 cs.CV cs.LG 57%

AgentCompress: Task-Aware Compression for Affordable Large Language Model Agents

AgentCompress: 任务感知压缩以实现经济高效的大型语言模型代理

Zuhair Ahmed Khan Taha, Mohammed Mudassir Uddin, Shahnawaz Alam

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG

AI总结 AgentCompress通过任务感知动态压缩技术,显著降低大型语言模型的计算成本,同时保持高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04770 2026-01-13 cs.AI cs.DB 57%

SciIF: Benchmarking Scientific Instruction Following Towards Rigorous Scientific Intelligence

SciIF: 科学指令遵循基准测试以实现严谨的科学智能

Encheng Su, Jianyu Wu, Chen Tang, Lintao Wang, Pengze Li, Aoran Wang, Jinouwen Zhang, Yizhou Wang, Yuan Meng, Xinzhu Ma, Shixiang Tang, Houqiang Li

机构 * Shanghai AI Laboratory(上海人工智能实验室) University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学) University of Sydney(悉尼大学) Fudan University(复旦大学) Tsinghua University(清华大学) Beihang University(北航大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 SciIF是一个评估模型在科学问题解决中严格遵守约束条件能力的多学科基准测试,通过显式证据验证科学有效性,提升LLM在科学逻辑框架中的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18497 2026-01-13 cs.CL 57%

The Pragmatic Mind of Machines: Tracing the Emergence of Pragmatic Competence in Large Language Models

机器的实用性思维:追踪大型语言模型中实用性能力的出现

Kefan Yu, Qingcheng Zeng, Weihao Xuan, Wanxin Li, Jingyi Wu, Rob Voigt

机构 * Northwestern University(西北大学) The University of Tokyo(东京大学) RIKEN AIP(理化学研究所AIP) Zhejiang University(浙江大学) University of California, Davis(加州大学戴维斯分校)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本文提出ALTPRAG数据集,通过对比推理评估不同训练阶段LLMs的实用性能力发展,发现模型规模和数据规模的增加提升其对实用性提示的敏感性,SFT和RLHF进一步增强其在认知-实用性场景中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06848 2026-01-13 cs.CL 57%

Explainable Multimodal Aspect-Based Sentiment Analysis with Dependency-guided Large Language Model

可解释的多模态基于方面的情感分析与依赖引导的大语言模型

Zhongzheng Wang, Yuanhe Tian, Hongzhi Wang, Yan Song

机构 * Harbin Institute of Technology(哈尔滨工程大学) Zhongguancun Academy(中关村学院) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院) University of Science and Technology of China(中国科学技术大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本文提出了一种基于依赖引导的大语言模型的多模态情感分析方法,通过生成可解释的自然语言解释来提升情感分类的准确性。

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23010 2026-01-13 cs.SE 50%

TALM: Dynamic Tree-Structured Multi-Agent Framework with Long-Term Memory for Scalable Code Generation

TALM:具有长期记忆的动态树结构多智能体框架用于可扩展的代码生成

Ming-Tung Shen, Yuh-Jzer Joung

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 TALM通过动态树结构多智能体框架结合长期记忆机制,提升复杂代码生成任务中的推理性能和令牌效率。

详情

展开后加载摘要…

URL PDF HTML 收藏