arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 5001 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 5001 篇

2601.07054 2026-01-13 cs.CL cs.LG 62%

Fine-Tuning vs. RAG for Multi-Hop Question Answering with Novel Knowledge

基于新知识的多跳问答中微调与RAG的比较

Zhuoyi Yang, Yurun Song, Iftekhar Ahmed, Ian Harris

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文比较了微调与RAG在多跳问答中处理新颖知识的效果,发现RAG在时间新颖信息问答中表现更优,而有监督微调整体准确率最高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06644 2026-01-13 cs.CL cs.AI 62%

Do Language Models Reason Across Languages?

语言模型是否能在不同语言之间进行推理?

Yan Meng, Wafaa Mohammed, Christof Monz

机构 * Language Technology Lab University of Amsterdam(语言技术实验室 阿姆斯特丹大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了语言模型在多语言环境下进行推理的能力,提出了一种三阶段提示方法,有效提升了两跳问答任务的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05256 2026-01-12 cs.AI cs.CL cs.CV cs.IR 62%

Naiad: Novel Agentic Intelligent Autonomous System for Inland Water Monitoring

Naiad:一种新型智能自主系统用于内陆水体监测

Eirini Baltzi, Tilemachos Moumouris, Athena Psalta, Vasileios Tsironis, Konstantinos Karantzalos

机构 * National Technical University of Athens(希腊国家技术大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 Naiad是一种基于大语言模型和外部工具的智能系统,用于通过地球观测数据实现内陆水体的全面监测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24556 2026-01-09 cs.CL cs.AI cs.CY 62%

Safe in the Future, Dangerous in the Past: Dissecting Temporal and Linguistic Vulnerabilities in LLMs

未来安全,过去危险:剖析大语言模型中的时间与语言脆弱性

Muhammad Abdullahi Said, Muhammad Sammani Sani

机构 * African Institute for Mathematical Science(非洲数学科学研究所) University of Vienna(维也纳大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究发现大语言模型在不同语言和时间框架下存在显著安全差异,提出不变对齐以提升跨语言和时间的稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04688 2026-01-09 cs.CL cs.AI cs.FL 62%

ToolGate: Contract-Grounded and Verified Tool Execution for LLMs

ToolGate: 以合同为基础并经过验证的工具执行用于LLMs

Yanming Liu, Xinyue Peng, Jiannan Cao, Xinyi Wang, Songhang Deng, Jintao Chen, Jianwei Yin, Xuhong Zhang

机构 * Zhejiang University(浙江大学) Southeast University(东南大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 ToolGate通过形式化合同和验证机制,确保LLM调用工具时逻辑安全和状态演变的可验证性,提升系统可靠性与可调试性。

Comments First version of ToolGate

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04526 2026-01-09 cs.SE cs.AI cs.CL 62%

Advancing Language Models for Code-related Tasks

推动与代码相关的语言模型

Zhao Tian

机构 * School of Computer Software, Tianjin University(天津大学软件学院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过改进代码数据质量、模型架构和推理能力,推动语言模型在软件开发中的实际应用。

Comments Accepted by ICSE 2026 (DS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04210 2026-01-09 cs.CL cs.AI cs.IT math.IT 62%

Complexity Agnostic Recursive Decomposition of Thoughts

无复杂度偏见的思维递归分解

Kaleem Ullah Qasim, Jiashu Zhang, Hafiz Saif Ur Rehman

机构 * Southwest Jiaotong University(西南交通大学) Southwestern University of Finance and Economics(西南财经大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 CARD通过预估问题复杂度并递归分解提升多步推理的准确性和效率

Comments 4

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03743 2026-01-08 cs.CL cs.AI 62%

O-Researcher: An Open Ended Deep Research Model via Multi-Agent Distillation and Agentic RL

O-Researcher: 通过多智能体蒸馏和智能体强化学习构建开放式深度研究模型

Yi Yao, He Zhu, Piaohong Wang, Jincheng Ren, Xinlong Yang, Qianben Chen, Xiaowan Li, Dingfeng Shi, Jiaxian Li, Qiexiang Wang, Sinuo Wang, Xinpeng Liu, Jiaqi Wu, Minghao Liu, Wangchunshu Zhou

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 O-Researcher通过多智能体蒸馏和智能体强化学习,构建开放式深度研究模型,实现开源模型在多个基准上的性能提升。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03483 2026-01-08 cs.CL cs.CY cs.LG 62%

CALM: Culturally Self-Aware Language Models

CALM:具有文化自感知能力的语言模型

Lingzhi Shen, Xiaohao Cai, Yunfei Long, Imran Razzak, Guanming Chen, Shoaib Jameel

机构 * University of Southampton(索姆塞特大学) Queen Mary University of London(伦敦女王学院) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 复杂问题求解 :self-correction(abstract);分类 cs.CL、cs.LG

AI总结 CALM通过对比学习和专家混合机制,赋予语言模型文化自感知能力,提升其在跨文化任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08726 2026-01-08 cs.CL cs.AI 62%

Improved LLM Agents for Financial Document Question Answering

改进的金融文档问答大型语言模型代理

Nelvin Tan, Zian Seng, Liang Zhang, Yu-Ching Shih, Dong Yang, Amol Salunkhe

机构 * American Express(美国美国运通)

专题命中 复杂问题求解 :self-correction(abstract);分类 cs.CL、cs.AI

AI总结 本文提出改进的金融文档问答代理,通过实验展示其在无 oracle 标签情况下的有效性,并引入更安全的计算代理。

Comments 13 pages, 6 figures. More analysis is added to Appendix C

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01446 2026-01-06 cs.CL cs.LG 62%

iFlip: Iterative Feedback-driven Counterfactual Example Refinement

iFlip: 迭代反馈驱动的反事实示例精炼

Yilong Wang, Qianli Wang, Nils Feldhus

专题命中 复杂问题求解 :self-correction(abstract);分类 cs.CL、cs.LG

AI总结 iFlip通过迭代反馈驱动的方法生成有效反事实示例,提升模型性能和鲁棒性。

Comments In submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.03541 2026-01-05 cs.CL cs.AI 62%

EXAONE 3.0 7.8B Instruction Tuned Language Model

EXAONE 3.0 7.8B 指令微调语言模型

Soyoung An, Kyunghoon Bae, Eunbi Choi, Stanley Jungkyu Choi, Yemuk Choi, Seokhee Hong, Yeonjung Hong, Junwon Hwang, Hyojin Jeon, Gerrard Jeongwon Jo, Hyunjik Jo, Jiyeon Jung, Yountae Jung, Euisoon Kim, Hyosang Kim, Joonkee Kim, Seonghwan Kim, Soyeon Kim, Sunkyoung Kim, Yireun Kim, Youchul Kim, Edward Hwayoung Lee, Haeju Lee, Honglak Lee, Jinsik Lee, Kyungmin Lee, Moontae Lee, Seungjun Lee, Woohyung Lim, Sangha Park, Sooyoun Park, Yongmin Park, Boseong Seo, Sihoon Yang, Heuiyeen Yeen, Kyungjae Yoo, Hyeongu Yun

机构 * LG AI Research(LG人工智能研究)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 EXAONE 3.0 7.8B 指令微调语言模型在韩语和通用任务中表现优异,通过开源促进专家AI的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23848 2026-01-01 cs.CL cs.CE cs.LG 62%

Integrating Domain Knowledge for Financial QA: A Multi-Retriever RAG Approach with LLMs

在金融问答中整合领域知识:一种基于多检索器RAG方法与LLM的多检索器RAG方法

Yukun Zhang, Stefan Elbl Droguett, Samyak Jain

机构 * Department of Computer Science Stanford University(计算机科学系 斯坦福大学) Graduate School of Business Stanford University(商学院 斯坦福大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本研究提出一种基于多检索器RAG方法与LLM的金融问答系统,通过领域知识训练提升数值推理能力,验证了领域特定训练在不同模型规模下的性能差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23485 2025-12-30 cs.LG cs.AI 62%

FRoD: Full-Rank Efficient Fine-Tuning with Rotational Degrees for Fast Convergence

FRoD:全秩高效微调与旋转自由度以实现快速收敛

Guoan Wan, Tianyu Chen, Fangzheng Feng, Haoyi Zhou, Runhua Xu

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 FRoD通过结合层次联合分解与旋转自由度,实现高效全秩微调,提升收敛速度和鲁棒性,同时在多个基准测试中保持与全模型微调相当的准确性。

Comments The 40th Annual AAAI Conference on Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22931 2025-12-30 cs.AI cs.LG 62%

Geometric Structural Knowledge Graph Foundation Model

几何结构知识图谱基础模型

Ling Xin, Mojtaba Nayyeri, Zahra Makki Nayeri, Steffen Staab

机构 * University of Stuttgart(斯图加特大学) University of Southampton(南安普顿大学) Shahrood University of Technology(沙霍尔德大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 Gamma通过引入多头几何注意力机制,提升知识图谱推理的表达能力,优于现有方法Ultra,在零样本归纳链接预测中表现更优。

Comments Submitted to IEEE TPAMI, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25123 2025-12-22 cs.AI cs.CL 62%

From $f(x)$ and $g(x)$ to $f(g(x))$: LLMs Learn New Skills in RL by Composing Old Ones

从f(x)和g(x)到f(g(x)):通过组合已有技能,LLMs在强化学习中学习新技能

Lifan Yuan, Weize Chen, Yuchen Zhang, Ganqu Cui, Hanbin Wang, Ziming You, Ning Ding, Zhiyuan Liu, Maosong Sun, Hao Peng

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Tsinghua University(清华大学) Shanghai AI Laboratory(上海人工智能实验室) Peking University(北京大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过强化学习使LLMs组合已有技能学习新能力,揭示强化学习在提升模型复杂任务处理能力中的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.15877 2025-12-22 cs.LG cs.AR cs.CL 62%

Basis Selection: Low-Rank Decomposition of Pretrained Large Language Models for Target Applications

基底选择:为特定应用预训练大语言模型的低秩分解

Yang Li, Daniel Agyei Asante, Changsheng Zhao, Ernie Chang, Yangyang Shi, Vikas Chandra

机构 * Iowa State University(爱荷华州立大学) Meta

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出了一种针对特定应用的LLM低秩分解方法,通过识别并去除冗余部分,有效压缩模型大小并保持性能。

Comments Transactions on Machine Learning Research (TMLR), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00878 2025-12-19 cs.CL cs.AI 62%

Less is More: Resource-Efficient Low-Rank Adaptation

少即是多:资源高效的低秩适应

Chunlin Tian, Xuyang Wei, Huanrong Liu, Zhijiang Guo, Li Li

机构 * University of Macau(澳门大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 EffiLoRA通过统一A矩阵和动态B矩阵更新,在多种模型中实现更高效且鲁棒的低秩适应。

Comments 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16279 2025-12-19 cs.AI cs.CL 62%

QuadSentinel: Sequent Safety for Machine-Checkable Control in Multi-agent Systems

QuadSentinel: 多智能体系统中机器可验证的顺序安全控制

Yiliu Yang, Yilei Jiang, Qunzhong Wang, Yingshui Tan, Xiaoyong Zhu, Sherman S. M. Chow, Bo Zheng, Xiangyu Yue

机构 * The Chinese University of Hong Kong(香港中文大学) Alibaba Group(阿里巴巴集团)

专题命中 复杂问题求解 :verifier(abstract);分类 cs.CL、cs.AI

AI总结 QuadSentinel通过四智能体守卫系统,将安全政策转化为机器可验证规则,提升多智能体系统的安全控制效果。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15312 2025-12-18 cs.CL cs.AI 62%

Evaluating LLMs for Zeolite Synthesis Event Extraction (ZSEE): A Systematic Analysis of Prompting Strategies

评估用于沸石合成事件提取(ZSEE)的LLM:对提示策略的系统分析

Charan Prakash Rathore, Saumi Ray, Dhruv Kumar

机构 * Birla Institute of Technology and Science, Pilani, India(巴尔·印度技术科学学院,比兰利,印度)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文评估了不同提示策略在沸石合成事件提取中的效果,发现零样本方法在事件分类上表现优异,但细粒度提取任务需领域适应模型。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07400 2025-12-18 cs.MA cs.AI cs.CV cs.LG 62%

MedChat: A Multi-Agent Framework for Multimodal Diagnosis with Large Language Models

MedChat: 一种基于大语言模型的多智能体多模态诊断框架

Philip R. Liu, Sparsh Bansal, Jimmy Dinh, Aditya Pawar, Ramani Satishkumar, Shail Desai, Neeraj Gupta, Xin Wang, Shu Hu

机构 * University at Albany, State University of New York(纽约州立大学阿布扎克分校)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 MedChat通过多智能体框架结合专用视觉模型和角色特定LLM代理,提升多模态诊断的可靠性与交互性。

Journal ref Proc. 2025 IEEE 8th International Conference on Multimedia Information Processing and Retrieval (MIPR), pp. 456-462, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10400 2025-12-17 cs.MA cs.AI cs.CL 62%

Rethinking the Reliability of Multi-agent System: A Perspective from Byzantine Fault Tolerance

重新思考多智能体系统可靠性:从拜占庭容错的角度出发

Lifan Zheng, Jiawei Chen, Qinghong Yin, Jingyuan Zhang, Xinyi Zeng, Yu Tian

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文从拜占庭容错角度研究基于大语言模型的智能体可靠性,提出CP-WBFT机制提升多智能体系统稳定性与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01113 2025-12-12 cs.IR cs.AI cs.CL 62%

GFM-RAG: Graph Foundation Model for Retrieval Augmented Generation

基于图的检索增强生成模型:图基础模型

Linhao Luo, Zicheng Zhao, Gholamreza Haffari, Dinh Phung, Chen Gong, Shirui Pan

机构 * Monash University(墨尔本大学) Nanjing University of Science and Technology(南京理工大学) Shanghai Jiao Tong University(上海交通大学) Griffith University(格里菲斯大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 GFM-RAG是一种基于图的检索增强生成模型,通过创新的图神经网络捕捉复杂查询-知识关系,实现了在未见数据集上的高效性能和泛化能力。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21306 2025-12-12 cs.CL cs.AI 62%

Natural Language Processing for the Legal Domain: A Survey of Tasks, Datasets, Models, and Challenges

法律领域自然语言处理:任务、数据集、模型与挑战的综述

Farid Ariai, Joel Mackenzie, Gianluca Demartini

机构 * The University of Queensland(昆士兰大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文综述了法律领域NLP的任务、数据集、模型及挑战,探讨了法律文本处理的独特性与现存问题,并提出了十六项开放研究挑战。

Comments 35 pages

Journal ref ACM Computing Surveys, Volume 58, Issue 6 Article No.: 163, Year: 2025, Pages 1 - 37

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.13732 2025-12-12 cs.CL cond-mat.mtrl-sci cs.LG 62%

Enhancing Large Language Models with Domain-Specific Knowledge: The Case in Topological Materials

通过领域特定知识增强大型语言模型:拓扑材料案例

HuangChao Xu, Baohua Zhang, Zhong Jin, Tiannian Zhu, Quansheng Wu, Hongming Weng

机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) University of Chinese Academy of Sciences(中国科学院大学) Institute of Physics, Chinese Academy of Sciences(中国科学院物理研究所)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出通过构建材料知识图谱与提示学习,开发专用对话系统TopoChat,以提升拓扑材料领域的信息检索与知识交互能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09935 2025-12-12 cs.AI cs.LG 62%

Exploring Health Misinformation Detection with Multi-Agent Debate

探索多智能体辩论中的健康 misinformation 检测

Chih-Han Chen, Chen-Han Tsai, Yu-Shao Peng

机构 * National Taiwan University(台湾国立大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种两阶段框架,通过多智能体辩论与自动化评分结合,提升健康虚假信息检测的准确性与说服力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09487 2025-12-11 cs.CL cs.AI cs.IR 62%

RouteRAG: Efficient Retrieval-Augmented Generation from Text and Graph via Reinforcement Learning

RouteRAG: 通过强化学习实现文本和图的高效检索增强生成

Yucan Guo, Miao Su, Saiping Guan, Zihao Sun, Xiaolong Jin, Jiafeng Guo, Xueqi Cheng

机构 * CAS Key Laboratory of Network Data Science and Technology, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所网络数据科学与技术重点实验室) School of Computer Science and Technology, University of Chinese Academy of Sciences(中国科学院大学计算机科学与技术学院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 RouteRAG通过强化学习实现文本和图的高效混合检索增强生成,提升多轮推理和复杂任务的适应性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09199 2025-12-11 cs.LG cs.AI cs.PF 62%

LLMs for Analog Circuit Design Continuum (ACDC)

用于模拟电路设计连续体的大型语言模型(ACDC)

Yasaman Esfandiari, Jocelyn Rego, Austin Meyer, Jonathan Gallagher, Mia Levy

机构 * HRL Laboratories(HRL实验室)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了大型语言模型在模拟电路设计中的适用性与一致性,探讨了不同数据表示对模型行为的影响,并揭示了LLMs在工程任务中的可靠性挑战与潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17923 2025-12-10 cs.LG cs.AI 62%

Rewarding the Journey, Not Just the Destination: A Composite Path and Answer Self-Scoring Reward Mechanism for Test-Time Reinforcement Learning

奖励旅程,而非仅终点:一种复合路径和答案自评分奖励机制用于测试时强化学习

Jingyu Xing, Chenwei Tang, Xinyu Liu, Deng Xiong, Shudong Huang, Wei Ju, Jiancheng Lv, Ziyue Qiao

机构 * Stevens Institute of Technology(史蒂文斯理工学院) Great Bay University(大湾大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 COMPASS通过自评分机制提升测试时强化学习的推理能力,增强模型分析能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23045 2025-12-09 cs.AI cs.CL cs.SE 62%

Kimi-Dev: Agentless Training as Skill Prior for SWE-Agents

Kimi-Dev:无代理训练作为SWE-代理的技能先验

Zonghan Yang, Shengjie Wang, Kelin Fu, Wenyang He, Weimin Xiong, Yibo Liu, Yibo Miao, Bofei Gao, Yejie Wang, Yingwei Ma, Yanhao Li, Yue Liu, Zhenxing Hu, Kaitai Zhang, Shuyi Wang, Huarong Chen, Flood Sung, Yang Liu, Yang Gao, Zhilin Yang, Tianyu Liu

机构 * Moonshot AI THU(清华大学) PKU(北京大学) UCAS(中国科学技术大学) BUPT(北京邮电大学) NUS(新加坡国立大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 Kimi-Dev通过无代理训练生成技能先验,使SWE-代理在SWE-bench Verified上取得60.4%的优异成绩,并通过额外SFT适应达到48.6%的pass@1,与Claude 3.5 Sonnet相当。

Comments 68 pages. GitHub repo at https://github.com/MoonshotAI/Kimi-Dev

详情

展开后加载摘要…

URL PDF HTML 收藏