DeepSeek-R1 Thoughtology: Let's think about LLM Reasoning
DeepSeek-R1 思维学:让我们思考LLM推理
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL
AI总结 DeepSeek-R1通过多步骤推理链实现复杂问题解决,研究揭示其推理性能的'甜点'及潜在安全漏洞。
Comments 135 pages, Published to TMLR
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
DeepSeek-R1 思维学:让我们思考LLM推理
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL
AI总结 DeepSeek-R1通过多步骤推理链实现复杂问题解决,研究揭示其推理性能的'甜点'及潜在安全漏洞。
Comments 135 pages, Published to TMLR
具备技能的数据选择与微调用于数据高效的推理蒸馏
机构 * University of Michigan(密歇根大学)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL
AI总结 本文提出了一种基于技能的蒸馏框架,通过数据选择和微调提升推理效率,实验证明在数学推理基准上优于随机微调基线。
M$^3$Searcher: 模块化多模态信息检索代理与检索导向推理
机构 * Huawei Cloud BU(华为云业务单元)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI
AI总结 M$^3$Searcher是一种模块化多模态信息检索代理,通过检索导向的多目标奖励机制,提升多模态任务中的事实准确性、推理合理性和检索忠实度。
UETQuintet在BioCreative IX上的MedHopQA:通过选择性多跳推理和上下文检索增强生物医学问答
机构 * VNU University of Engineering and Technology(越南工程大学)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL
AI总结 本文提出MedHopQA模型,通过选择性多跳推理和上下文检索提升生物医学问答性能,在BioCreative IX共享任务中取得第二名成绩。
Comments In Proceedings of the BioCreative IX Challenge and Workshop (BC9): Large Language Models for Clinical and Biomedical NLP, IJCAI 2025
多智能体系统中的元认知自我校正:通过原型引导的下一步执行重建
专题命中 复杂问题求解 :self-correction(title,abstract);分类 cs.AI
AI总结 本文提出MASC框架,通过原型引导和下一步执行重建实现多智能体系统的元认知自我校正,有效提升错误检测精度并减少误差传播。
MuDRiC:多方言推理用于阿拉伯常识验证
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL
AI总结 MuDRiC通过引入多方言阿拉伯语常识数据集和图卷积网络方法,提升阿拉伯语常识验证性能。
通过丰富的推理链生成叙事图像
机构 * X-LANCE Lab, School of Computer Science, Shanghai Jiao Tong University, China(X-LANCE实验室,计算机科学学院,上海交通大学,中国) ; Shanghai Artificial Intelligence Laboratory, China(上海人工智能实验室,中国) ; East China University of Technology, China(东华大学,中国) ; University of Texas at Arlington, USA(德克萨斯大学阿灵顿分校,美国)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL
AI总结 本文提出StorytellingPainter,通过结合大语言模型推理与文本到图像合成,生成具有丰富推理链的叙事图像,并引入评估框架和轻量级模型以提升生成效果。
动态推理的成本:从AI基础设施视角解密AI代理与测试时扩展
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.LG
AI总结 本文从AI基础设施视角解密AI代理与测试时扩展,揭示动态推理带来的高成本与可持续性问题,呼吁转向计算高效的代理设计。
Comments Accepted for publication at the 32nd IEEE International Symposium on High-Performance Computer Architecture (HPCA-32), 2026
MalruleLib: 大规模可执行的错误推理与步骤追踪用于数学学生思维建模
机构 * Rice University(里士大学) ; University of Central Florida(中央佛罗里达大学)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL
AI总结 MalruleLib通过可执行的错误推理和步骤追踪,建模数学学生思维,实现跨模板的误解预测与反馈。
基于代理记忆的递归推理用于微服务根因定位
机构 * Peking University(北京大学) ; Alibaba Group(阿里巴巴集团) ; Tsinghua University(清华大学) ; Institute of Artificial Intelligence(人工智能研究院)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI
AI总结 本文提出AMER-RCL框架,通过递归推理和代理记忆提升微服务根因定位的准确性和效率。
Comments accepted by ICSE-SEIP'26
结构分解用于LLM推理:跨领域验证与语义网集成
机构 * Warsaw University of Technology(华沙技术大学)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI
AI总结 本文提出结构分解框架,结合LLM与符号推理,通过本体填充和符号验证提升跨领域推理的准确性和一致性。
强化学习增强的多跳推理用于时间知识问答
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI
AI总结 本研究提出MRE框架,通过增强正向和反向推理,提升时间知识问答中多跳推理的准确性和鲁棒性。
Comments 11 pages, 2 figures
投资成功的获取路径:基于信息驱动的LLM图推理的创业投资预测
机构 * ShanghaiTech University(上海科技大学) ; Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学) ; University of Maryland(马里兰大学)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI
AI总结 MIRAGE-VC通过信息驱动的图路径推理,提升创业投资预测的准确性和可解释性。
MR-Align: 为大推理模型引入元推理的事实性对齐
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Zhongguancun Academy(中关村学院) ; University of Chinese Academy of Sciences(中国科学院大学) ; Tencent(腾讯)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL
AI总结 MR-ALIGN通过元推理引导的对齐框架提升大型推理模型的事实准确性,通过优化推理过程中的状态转移概率来增强事实性。
Comments Preprint
推理与创造力的权衡:迈向以创造力为导向的问题解决
机构 * University of Cambridge(剑桥大学)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.LG
AI总结 本文提出DCR框架,通过统一变分目标解决LLM在正确性与创造性之间的权衡问题,提供稳定且多样化的训练方法。
Comments 56 pages, 9 figures, submitted to Twenty-Ninth Annual Conference on Artificial Intelligence and Statistics
面向无服务器环境的多智能体协作推理自适应GPU资源分配
机构 * Department of Engineering Management and Systems Engineering, George Washington University, USA(工程管理与系统工程系,乔治华盛顿大学)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI
AI总结 本文提出一种自适应GPU资源分配框架,通过动态分配资源降低延迟并提升效率,适用于无服务器环境下的多智能体协作推理任务。
Comments 6 pages, 2 figures
Journal ref 2025 IEEE Computing, Communications and IoT Applications (ComComAP)
面向复杂推理的群体讨论导向多智能体对话模型
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI
AI总结 本文提出一种群体讨论导向的多智能体对话模型,通过三级角色架构和改进的优化策略,提升复杂推理任务的准确性和一致性。
Comments Accepted by IEEE ITCA 2025
基于外部子图生成的大型语言模型逐步增强推理框架
机构 * School of Information Science and Engineering, Chongqing Jiaotong University(重庆交通大学信息科学与工程学院) ; School of Computer Science and Technology, Chongqing University of Posts and Telecommunications(重庆邮电大学计算机科学与技术学院)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL
AI总结 SGR通过外部子图生成提升LLM的推理能力,通过多步骤推理和整合路径生成最终答案,实验表明其优于现有基线模型。
VideoZoomer: 用于长视频推理的强化学习时序聚焦
机构 * Tsinghua University(清华大学) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI
AI总结 VideoZoomer通过强化学习实现动态时序聚焦,提升长视频推理性能和效率。
基于图结构信息的大型语言模型知识推理用于烟草害虫和疾病控制
机构 * School of Information Science and Engineering(信息科学与工程学院) ; Chongqing Jiaotong University(重庆交通大学)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL
AI总结 本文提出一种整合图结构信息的大型语言模型,用于提升烟草害虫和疾病控制的知识推理能力,通过构建领域知识图并结合图神经网络实现更准确的推理。
通用推理模型
机构 * Ubiquant
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI
AI总结 本文提出通用推理模型URM,通过引入短卷积和截断反向传播提升推理性能,在ARC-AGI任务中取得state-of-the-art结果。
寻找有缺陷的虚构作品:通过情节漏洞检测评估语言模型的复杂推理
机构 * Paul G. Allen Center for Computer Science & Engineering(保罗·G·艾伦计算机科学与工程中心) ; University of Washington(华盛顿大学)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL
AI总结 本研究提出通过情节漏洞检测评估语言模型的复杂推理能力,发现先进模型在检测漏洞时表现不佳,且生成故事易引入漏洞。
Comments CoLM 2025 Camera Ready
多语言大语言模型中基于等价与继承的稳健知识表示研究
机构 * Amazon(亚马逊公司) ; IIT Jammu(印度理工学院贾姆鲁)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL
AI总结 本研究通过引入多语言任务和基准,评估LLMs在等价和继承推理中的稳健性,并提出组合表示以提升跨语言一致性。
Journal ref NAACL 2025 (Main Conference)
LTA-thinker: 用于复杂推理的大语言模型的潜在思维增强训练框架
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI
AI总结 LTA-Thinker通过提升潜在思维分布方差和信息效率,优化大语言模型的复杂推理性能。
ChartAgent: 一种集成工具推理的图表理解框架
机构 * College of Artificial Intelligence, Nankai University(人工智能学院,南开大学) ; University of Chinese Academy of Sciences(中国科学院大学) ; State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS), Institution of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室(MAIS),自动化研究所,中国科学院) ; Zhongguancun Academy(中关村学院) ; State Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.LG
AI总结 ChartAgent通过集成工具推理框架提升图表理解的鲁棒性与可追溯性。
AraReasoner: 评估基于推理的LLM在阿拉伯语NLP中的表现
机构 * King Fahd University of Petroleum and Minerals(国王法赫德石油和矿物大学) ; SDAIA–KFUPM Joint Research Center for Artificial Intelligence(SDAIA-KFUPM人工智能联合研究中心) ; Mohammed VI Polytechnic University(穆莱·易卜拉欣(polytechnic)大学)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL
AI总结 AraReasoner评估基于推理的LLM在阿拉伯语NLP中的表现,发现通过精心选择示例可显著提升分类任务性能,DeepSeek在复杂推理任务中表现优于GPT基线,LoRA微调进一步提升F1和BLEU分数。
Motif-2-12.7B-Reasoning: 一个实践者在强化学习训练配方中的指南
机构 * Motif Technologies(Motif技术公司)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI
AI总结 Motif-2-12.7B-Reasoning通过综合训练配方,在复杂推理和长上下文理解中实现性能媲美更大参数模型,提供开源模型和可扩展的推理能力蓝图。
视觉语言推理中测试时扩展的极限与收益
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.LG
AI总结 研究探讨了测试时扩展在视觉语言推理中的效果,发现其在不同任务和模型上表现不一,需根据具体需求定制策略。
Comments Mohammadjavad Ahmadpour and Amirmadhi Meighani contributed equally to this work
VLMLight:通过视觉-语言元控制与双分支推理架构实现安全关键的交通信号控制
机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Shanghai AI Laboratory(上海人工智能实验室) ; Nanyang Technological University(南洋理工大学) ; Nokia Bell Labs(诺基亚贝尔实验室) ; Fourier Intelligence(Fourier智能)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.LG
AI总结 VLMLight通过视觉-语言元控制与双分支推理架构,实现安全关键的交通信号控制,显著减少紧急车辆等待时间并提升系统安全性。
Comments 25 pages, 15 figures
GAIR:通过信息联合推理和群体反思实现GUI自动化
机构 * Zhejiang University(浙江大学) ; Huawei Technologies Ltd.(华为技术有限公司)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI
AI总结 GAIR是一种基于MLLM的GUI自动化代理框架,通过信息联合推理和群体反思整合异质模型能力,提升GUI自动化性能。