Learning from Self Critique and Refinement for Faithful LLM Summarization
从自我批评与完善学习以实现忠实的大语言模型摘要
机构 * Apple(苹果公司)
专题命中 测试时计算 :test-time compute(abstract);分类 cs.CL
AI总结 本文提出SCRPO方法,通过自监督训练框架提升大语言模型摘要的忠实度,实验表明其在忠实度和整体质量上优于现有方法。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
从自我批评与完善学习以实现忠实的大语言模型摘要
机构 * Apple(苹果公司)
专题命中 测试时计算 :test-time compute(abstract);分类 cs.CL
AI总结 本文提出SCRPO方法,通过自监督训练框架提升大语言模型摘要的忠实度,实验表明其在忠实度和整体质量上优于现有方法。
反思性信心:通过在线自我纠正修正推理缺陷
机构 * Sun Yat-sen University(中山大学)
专题命中 复杂问题求解 :reasoning(title,abstract);self-correction(title,abstract);chain-of-thought(abstract);分类 cs.AI
AI总结 本文提出反思性信心框架,通过在线自我纠正修正推理缺陷,提升数学推理任务的准确性。
Comments Under submission
MixKVQ: 为长上下文推理的查询感知混合精度KV缓存量化
机构 * South China University of Technology(南方科技大学) ; Beihang University(北航) ; Pazhou Laboratory(琶洲实验室)
专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI、cs.LG
AI总结 MixKVQ通过查询感知的混合精度量化策略,提升长上下文推理性能并降低内存开销。
思想的syzygy:通过最小自由分解改进LLM的CoT
机构 * UESTC(乌东德科技大学) ; CNU(中国矿业大学) ; KHU(韩国大学) ; Tongji Univ(同济大学)
专题命中 复杂问题求解 :CoT(title,abstract);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL
AI总结 Syzygy of Thoughts通过引入最小自由分解方法,改进LLM的链式思维推理,提升复杂问题的解决能力和推理准确性。
GRADEO: 通过多步骤推理实现文本到视频生成的人类级评估
机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University, Shenzhen, China(清华大学深圳国际研究生院,清华大学,深圳,中国) ; CSE department, The Chinese University of Hong Kong, Hong Kong,China(中国香港大学计算机科学与工程系,中国香港,中国) ; Department of Computer Science(计算机科学系) ; Engineering, The Hong Kong University of Science(工程,香港科学大学)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 GRADEO通过多步骤推理实现文本到视频生成的人类级评估,提出多维评估数据集和专门设计的视频评估模型,提升评估的可解释性和与人类判断的一致性。
基于检索引导的自动提示法用于物流帧检测
机构 * Faculty of Information Technology, VNU University of Engineering and Technology(信息技术学院,越南工程大学)
专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI
AI总结 本文提出基于检索引导的自动提示法,通过优化提示提升物流文本帧检测的准确性和效率。
从检索到推理:一个面向网络威胁情报实体识别的框架,具有显式和自适应指令
机构 * Sichuan University(四川大学) ; Renmin University of China(中国人民大学) ; Wuhan University(武汉大学) ; Engineering Research Center of Next-Generation Intelligent Search and Recommendation, Ministry of Education, China(教育部下一代智能搜索与推荐工程研究中心)
专题命中 复杂问题求解 :reasoning(title);分类 cs.CL
AI总结 本文提出TTPrompt框架,通过显式指令和反馈驱动细化,提升网络威胁情报实体识别的性能。
通过能量模型的理论视角提升强化学习调优语言模型
机构 * Tsinghua University(清华大学) ; Beihang University(北航)
专题命中 复杂问题求解 :reasoning(abstract);self-correction(abstract);分类 cs.LG
AI总结 本文通过能量模型视角,揭示了强化学习调优语言模型的理论基础,证明了其在指令遵循和推理任务中的稳定性与效率。
PDE-Agent:一种增强工具链的多智能体框架用于PDE求解
专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);分类 cs.AI
AI总结 PDE-Agent通过增强工具链的多代理协作框架,实现从自然语言描述中自动化的PDE求解。
Comments Adding Affiliation Information on arXiv
小型语言模型作为编译器专家:异构系统的自动并行化
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG
AI总结 本文提出利用小型语言模型提升异构系统自动并行化性能,通过多种模型和策略在科学计算等领域实现显著加速。
Comments Accepted at NeurIPS 2025 ML for Systems Workshop
$γ(3,4)$ 注意力在认知代理中的应用:基于承诺理论语义的知识表示
机构 * Oslo University College Chitek-i AS(奥斯陆大学学院奇特克-艾公司)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI
AI总结 本文提出基于承诺理论语义的$γ(3,4)$图表示方法,通过特征角色分类替代复杂本体,提升不确定性条件下的推理效率。
从自然语言到控制信号:复杂实验基础设施中语义通道寻找的概念框架
机构 * Lawrence Berkeley National Laboratory(劳伦斯伯克利国家实验室) ; University of California Santa Barbara(加州大学圣巴巴拉分校) ; Deutsches Elektronen-Synchrotron DESY(德意志电子同步辐射研究中心DESY) ; Thomas Jefferson National Accelerator Facility(托马斯·杰斐逊国家加速器设施) ; Cosylab USA(Cosylab美国分公司)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL
AI总结 本文提出了一种概念框架,用于在复杂实验基础设施中通过语义方法寻找控制信号,通过四个范式指导架构选择,实现了90-97%的准确率。
通过小世界网络的视角重新思考多智能体智能
机构 * School of Computer Science and Informatics, University of Liverpool(计算机科学与信息学院,利物浦大学)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI
AI总结 本文通过小世界网络视角重新思考多智能体智能,提出基于不确定性引导的重 wiring 方案,实现稳定且可扩展的多智能体系统设计。
Comments Under Review
面向社交媒体的抑郁症检测综述与实验:从大型语言模型和RAG到代理
机构 * The Hong Kong Polytechnic University(香港理工大学) ; The Hong Kong University of Science and Technology(香港科学与技术大学)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL
AI总结 本文综述并实验了基于社交媒体的抑郁症检测方法,探讨了LLM、RAG和代理系统在提升检测可靠性与推理能力中的应用。
Comments 20 pages, 10 figures. This is an extension of ICDEW 2025
GraphGeo: 多智能体辩论框架用于具有异构图神经网络的视觉地定位
专题命中 复杂问题求解 :reasoning(abstract)
AI总结 GraphGeo通过异构图神经网络的多智能体辩论框架,提升视觉地定位的准确性与鲁棒性。
Comments This submission has been withdrawn by the authors due to a fundamental error in the methodology that affects the validity of the main results
面向多模态大语言模型的推理保留反学习
机构 * Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(Mohamed bin Zayed人工智能大学) ; University of Queensland(昆士兰大学) ; Provable Responsible AI and Data Analytics (PRADA) Lab(可证明责任人工智能与数据分析实验室) ; King Abdullah University of Science and Technology (KAUST)(卡塔尔科学与技术大学)
专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出R-MUSE框架,通过子空间指导和自适应引导,在推理过程中有效消除多模态大语言模型中的推理痕迹,同时保留通用推理能力。
SafeMed-R1: 为视觉-语言模型中的通用性和鲁棒性医疗推理设计的对抗强化学习
机构 * National University of Singapore(新加坡国立大学)
专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI
AI总结 SafeMed-R1通过对抗训练与组相对策略优化提升视觉-语言模型在医疗推理中的鲁棒性和可解释性。
QuantiPhy:一种评估视觉-语言模型物理推理能力的定量基准
机构 * Stanford University(斯坦福大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI
AI总结 QuantiPhy通过定量评估视觉-语言模型的物理推理能力,揭示其在运动学属性推断中的数值准确性与定性合理性之间的差距。
Remedy-R:无错误标注的机器翻译评估生成推理
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL
AI总结 Remedy-R是一种无需错误标注的生成式机器翻译评估方法,通过强化学习训练,提供可解释的评估和翻译改进。
LexChain:为中文侵权案件分析建模法律推理链
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL
AI总结 本文提出LexChain框架,用于显式建模中国侵权案件中的法律推理过程,通过构建评估基准和基线方法,提升了语言模型在民事侵权分析中的推理能力。
对先验的探讨:大型语言模型在知识图谱上的可信推理
机构 * MOE KLINNS Lab, Xi’an Jiaotong University(MOE KLINNS实验室,西安交通大学) ; School of Computer Science and Technology, Xi’an Jiaotong University(计算机科学与技术学院,西安交通大学) ; Shaanxi Province Key Laboratory of Big Data Knowledge Engineering(陕西省大数据知识工程重点实验室) ; School of Artificial Intelligence, Chongqing University of Post and Telecommunications(人工智能学院,重庆邮电大学) ; School of Computer Science, Northwestern Polytechnical University(计算机学院,西北工业大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL
AI总结 本研究提出DP框架,通过整合知识图谱的结构和约束先验,提升大型语言模型在知识图谱上的推理准确性和响应可靠性。
Comments Accepted by NeurIPS 2025
FC-MIR:一种基于帧压缩多模态轨迹推理的移动屏幕感知框架,用于意图感知推荐
机构 * vivo AI Lab(vivo人工智能实验室) ; Zhejiang University(浙江大学)
专题命中 推理评测 :reasoning(title);分类 cs.AI
AI总结 FC-MIR框架通过帧压缩多模态轨迹推理,提升移动设备上意图感知推荐的效率与实用性,支持轻量级部署并探索生成操作与建议。
小米 MiMo-VL-Miloco 技术报告
机构 * Xiaomi(小米)
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract)
AI总结 小米提出 MiMo-VL-Miloco 模型,专为家庭场景设计,通过两阶段训练提升多模态推理与家庭场景理解能力。
ReGal:基于PPO的法律AI在印度判决预测和摘要中的初步探索
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 ReGal通过PPO结合多任务指令微调与强化学习,探索法律AI在印度判决预测和摘要中的应用,揭示了强化学习在法律文本中的挑战与潜力。
Comments Accepted in AILaw @ AAAI 2026 conference
注意力不是你需要的
专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出基于格拉斯曼流的无注意力架构,通过低秩子空间操作实现更结构化的神经推理,实验显示其在语言建模和自然推理任务中表现优异。
通过可微内部对齐嵌入实现嵌入式安全对齐智能
机构 * Sardar Vallabhbhai National Institute of Technology (SVNIT)(萨达尔·瓦拉布尔·尼尔达理工学院)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出嵌入式安全对齐智能框架,通过可微内部对齐嵌入实现多智能体强化学习中的安全对齐,探讨了反事实对齐惩罚、感知注意力等机制及理论性质。
Comments 32 pages, 1 figure. Theoretical framework; no empirical results
观察者,而非玩家:通过游戏观察模拟大语言模型中的理论心理论
机构 * Department of Management Information Systems, National ChengChi University(管理信息系,国立中正大学)
专题命中 推理评测 :reasoning(abstract,comments);分类 cs.AI
AI总结 通过游戏观察模拟大语言模型中的理论心理论,评估其在顺序行为中的推理能力。
Comments Accepted at NeurIPS Workshop on Foundations of Reasoning in Language Models and Workshop on Bridging Language, Agent, and World Model
大规模语言模型中的事件提取
机构 * National University of Singapore(新加坡国立大学) ; University of Sussex(苏塞克斯大学) ; Wuhan University(武汉大学) ; University of Texas at Dallas(德克萨斯大学达拉斯分校) ; Nanyang Technological University(南洋理工大学) ; Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) ; University of Illinois at Chicago(伊利诺伊大学香槟分校)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 本文探讨了大规模语言模型中事件提取的系统组件,提出通过事件方案、结构和存储提升事件处理的可靠性与智能体准备性。
Comments 38 pages, 9 Figures, 5 Tables
PENDULUM: 一个用于评估多模态大语言模型顺从性的基准
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 PENDULUM基准通过2000个视觉问答对评估多模态大语言模型的顺从性,揭示模型在顺从性和幻觉行为上的显著差异,提出新度量标准以提升模型的事实一致性和可靠性。
是否会平局?迈向风险投资领域的自主法律代理
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 本文提出了一种世界模型架构,旨在实现风险投资领域资本表核对的自动化,为法律智能提供基础。