Fine-Tuning vs. RAG for Multi-Hop Question Answering with Novel Knowledge
基于新知识的多跳问答中微调与RAG的比较
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 本文比较了微调与RAG在多跳问答中处理新颖知识的效果,发现RAG在时间新颖信息问答中表现更优,而有监督微调整体准确率最高。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
基于新知识的多跳问答中微调与RAG的比较
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 本文比较了微调与RAG在多跳问答中处理新颖知识的效果,发现RAG在时间新颖信息问答中表现更优,而有监督微调整体准确率最高。
语言模型是否能在不同语言之间进行推理?
机构 * Language Technology Lab University of Amsterdam(语言技术实验室 阿姆斯特丹大学)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文研究了语言模型在多语言环境下进行推理的能力,提出了一种三阶段提示方法,有效提升了两跳问答任务的准确性。
Naiad:一种新型智能自主系统用于内陆水体监测
机构 * National Technical University of Athens(希腊国家技术大学)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 Naiad是一种基于大语言模型和外部工具的智能系统,用于通过地球观测数据实现内陆水体的全面监测。
未来安全,过去危险:剖析大语言模型中的时间与语言脆弱性
机构 * African Institute for Mathematical Science(非洲数学科学研究所) ; University of Vienna(维也纳大学)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 研究发现大语言模型在不同语言和时间框架下存在显著安全差异,提出不变对齐以提升跨语言和时间的稳定性。
ToolGate: 以合同为基础并经过验证的工具执行用于LLMs
机构 * Zhejiang University(浙江大学) ; Southeast University(东南大学) ; Massachusetts Institute of Technology(麻省理工学院)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 ToolGate通过形式化合同和验证机制,确保LLM调用工具时逻辑安全和状态演变的可验证性,提升系统可靠性与可调试性。
Comments First version of ToolGate
推动与代码相关的语言模型
机构 * School of Computer Software, Tianjin University(天津大学软件学院)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本研究通过改进代码数据质量、模型架构和推理能力,推动语言模型在软件开发中的实际应用。
Comments Accepted by ICSE 2026 (DS)
无复杂度偏见的思维递归分解
机构 * Southwest Jiaotong University(西南交通大学) ; Southwestern University of Finance and Economics(西南财经大学)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 CARD通过预估问题复杂度并递归分解提升多步推理的准确性和效率
Comments 4
O-Researcher: 通过多智能体蒸馏和智能体强化学习构建开放式深度研究模型
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 O-Researcher通过多智能体蒸馏和智能体强化学习,构建开放式深度研究模型,实现开源模型在多个基准上的性能提升。
Comments 22 pages
CALM:具有文化自感知能力的语言模型
机构 * University of Southampton(索姆塞特大学) ; Queen Mary University of London(伦敦女王学院) ; Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
专题命中 复杂问题求解 :self-correction(abstract);分类 cs.CL、cs.LG
AI总结 CALM通过对比学习和专家混合机制,赋予语言模型文化自感知能力,提升其在跨文化任务中的表现。
改进的金融文档问答大型语言模型代理
机构 * American Express(美国美国运通)
专题命中 复杂问题求解 :self-correction(abstract);分类 cs.CL、cs.AI
AI总结 本文提出改进的金融文档问答代理,通过实验展示其在无 oracle 标签情况下的有效性,并引入更安全的计算代理。
Comments 13 pages, 6 figures. More analysis is added to Appendix C
iFlip: 迭代反馈驱动的反事实示例精炼
专题命中 复杂问题求解 :self-correction(abstract);分类 cs.CL、cs.LG
AI总结 iFlip通过迭代反馈驱动的方法生成有效反事实示例,提升模型性能和鲁棒性。
Comments In submission
EXAONE 3.0 7.8B 指令微调语言模型
机构 * LG AI Research(LG人工智能研究)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 EXAONE 3.0 7.8B 指令微调语言模型在韩语和通用任务中表现优异,通过开源促进专家AI的发展。
在金融问答中整合领域知识:一种基于多检索器RAG方法与LLM的多检索器RAG方法
机构 * Department of Computer Science Stanford University(计算机科学系 斯坦福大学) ; Graduate School of Business Stanford University(商学院 斯坦福大学)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 本研究提出一种基于多检索器RAG方法与LLM的金融问答系统,通过领域知识训练提升数值推理能力,验证了领域特定训练在不同模型规模下的性能差异。
FRoD:全秩高效微调与旋转自由度以实现快速收敛
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 FRoD通过结合层次联合分解与旋转自由度,实现高效全秩微调,提升收敛速度和鲁棒性,同时在多个基准测试中保持与全模型微调相当的准确性。
Comments The 40th Annual AAAI Conference on Artificial Intelligence
几何结构知识图谱基础模型
机构 * University of Stuttgart(斯图加特大学) ; University of Southampton(南安普顿大学) ; Shahrood University of Technology(沙霍尔德大学)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 Gamma通过引入多头几何注意力机制,提升知识图谱推理的表达能力,优于现有方法Ultra,在零样本归纳链接预测中表现更优。
Comments Submitted to IEEE TPAMI, under review
从f(x)和g(x)到f(g(x)):通过组合已有技能,LLMs在强化学习中学习新技能
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Tsinghua University(清华大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; Peking University(北京大学)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本研究通过强化学习使LLMs组合已有技能学习新能力,揭示强化学习在提升模型复杂任务处理能力中的关键作用。
基底选择:为特定应用预训练大语言模型的低秩分解
机构 * Iowa State University(爱荷华州立大学) ; Meta
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 本文提出了一种针对特定应用的LLM低秩分解方法,通过识别并去除冗余部分,有效压缩模型大小并保持性能。
Comments Transactions on Machine Learning Research (TMLR), 2025
少即是多:资源高效的低秩适应
机构 * University of Macau(澳门大学) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 EffiLoRA通过统一A矩阵和动态B矩阵更新,在多种模型中实现更高效且鲁棒的低秩适应。
Comments 18 pages, 7 figures
QuadSentinel: 多智能体系统中机器可验证的顺序安全控制
机构 * The Chinese University of Hong Kong(香港中文大学) ; Alibaba Group(阿里巴巴集团)
专题命中 复杂问题求解 :verifier(abstract);分类 cs.CL、cs.AI
AI总结 QuadSentinel通过四智能体守卫系统,将安全政策转化为机器可验证规则,提升多智能体系统的安全控制效果。
Comments Preprint
评估用于沸石合成事件提取(ZSEE)的LLM:对提示策略的系统分析
机构 * Birla Institute of Technology and Science, Pilani, India(巴尔·印度技术科学学院,比兰利,印度)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文评估了不同提示策略在沸石合成事件提取中的效果,发现零样本方法在事件分类上表现优异,但细粒度提取任务需领域适应模型。
Comments Under Review
MedChat: 一种基于大语言模型的多智能体多模态诊断框架
机构 * University at Albany, State University of New York(纽约州立大学阿布扎克分校)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 MedChat通过多智能体框架结合专用视觉模型和角色特定LLM代理,提升多模态诊断的可靠性与交互性。
Journal ref Proc. 2025 IEEE 8th International Conference on Multimedia Information Processing and Retrieval (MIPR), pp. 456-462, 2025
重新思考多智能体系统可靠性:从拜占庭容错的角度出发
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文从拜占庭容错角度研究基于大语言模型的智能体可靠性,提出CP-WBFT机制提升多智能体系统稳定性与可靠性。
基于图的检索增强生成模型:图基础模型
机构 * Monash University(墨尔本大学) ; Nanjing University of Science and Technology(南京理工大学) ; Shanghai Jiao Tong University(上海交通大学) ; Griffith University(格里菲斯大学)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 GFM-RAG是一种基于图的检索增强生成模型,通过创新的图神经网络捕捉复杂查询-知识关系,实现了在未见数据集上的高效性能和泛化能力。
Comments Accepted by NeurIPS 2025
法律领域自然语言处理:任务、数据集、模型与挑战的综述
机构 * The University of Queensland(昆士兰大学)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文综述了法律领域NLP的任务、数据集、模型及挑战,探讨了法律文本处理的独特性与现存问题,并提出了十六项开放研究挑战。
Comments 35 pages
Journal ref ACM Computing Surveys, Volume 58, Issue 6 Article No.: 163, Year: 2025, Pages 1 - 37
通过领域特定知识增强大型语言模型:拓扑材料案例
机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) ; University of Chinese Academy of Sciences(中国科学院大学) ; Institute of Physics, Chinese Academy of Sciences(中国科学院物理研究所)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 本文提出通过构建材料知识图谱与提示学习,开发专用对话系统TopoChat,以提升拓扑材料领域的信息检索与知识交互能力。
探索多智能体辩论中的健康 misinformation 检测
机构 * National Taiwan University(台湾国立大学)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出一种两阶段框架,通过多智能体辩论与自动化评分结合,提升健康虚假信息检测的准确性与说服力。
RouteRAG: 通过强化学习实现文本和图的高效检索增强生成
机构 * CAS Key Laboratory of Network Data Science and Technology, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所网络数据科学与技术重点实验室) ; School of Computer Science and Technology, University of Chinese Academy of Sciences(中国科学院大学计算机科学与技术学院)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 RouteRAG通过强化学习实现文本和图的高效混合检索增强生成,提升多轮推理和复杂任务的适应性与效率。
用于模拟电路设计连续体的大型语言模型(ACDC)
机构 * HRL Laboratories(HRL实验室)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文研究了大型语言模型在模拟电路设计中的适用性与一致性,探讨了不同数据表示对模型行为的影响,并揭示了LLMs在工程任务中的可靠性挑战与潜力。
奖励旅程,而非仅终点:一种复合路径和答案自评分奖励机制用于测试时强化学习
机构 * Stevens Institute of Technology(史蒂文斯理工学院) ; Great Bay University(大湾大学)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 COMPASS通过自评分机制提升测试时强化学习的推理能力,增强模型分析能力。
Kimi-Dev:无代理训练作为SWE-代理的技能先验
机构 * Moonshot AI ; THU(清华大学) ; PKU(北京大学) ; UCAS(中国科学技术大学) ; BUPT(北京邮电大学) ; NUS(新加坡国立大学)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 Kimi-Dev通过无代理训练生成技能先验,使SWE-代理在SWE-bench Verified上取得60.4%的优异成绩,并通过额外SFT适应达到48.6%的pass@1,与Claude 3.5 Sonnet相当。
Comments 68 pages. GitHub repo at https://github.com/MoonshotAI/Kimi-Dev