arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 5021 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 5021 篇

2606.03021 2026-07-28 cs.CL 版本更新 79%

Hint-Guided Diversified Policy Optimization for LLM Reasoning

提示引导的多样化策略优化用于大语言模型推理

Zhiyu Cao, Kaixin Wu, Mingjie Zhong, Peifeng Li, Can Ye, Qiaoming Zhu

机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院) Ant Group(蚂蚁集团)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 提出提示引导的多样化策略优化(HDPO),通过“提出-选择-思考”轨迹激励模型生成多样且可靠的解决方案,提升推理能力、候选方案多样性和可靠方案识别能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16716 2026-07-21 cs.AI 新提交 79%

RECON: Benchmarking Agent Memory for Compositional Reasoning over Long Contexts

RECON:用于长上下文组合推理的智能体内存基准测试

Mihir Shriniwas Arya

机构 * RV College of Engineering(RV工程学院) Department of Computer Science and Engineering(计算机科学与工程系)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 该研究引入RECON基准测试,用于评估长上下文组合推理,跨越三个领域24个案例文件,测试智能体六个内存密集型任务,揭示当前架构在内存相关任务上存在重大局限,非预言机系统准确率低,检索和推理有挑战。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08940 2026-07-21 cs.LG 版本更新 79%

TSRouter: Dynamic Modality-Model Selection for Time Series Reasoning

TSRouter:用于时间序列推理的动态模态-模型选择

Fangxu Yu, Tao Feng, Dehai Min, Lu Cheng, Ge Liu, Tianyi Zhou

机构 * University of Maryland, College Park(马里兰大学帕克分校) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Illinois Chicago(伊利诺伊大学芝加哥分校) MBZUAI(Mohamed Bin Zayed University of Artificial Intelligence)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.LG

AI总结 研究针对时间序列推理中不同模型能力互补及特性差异问题,提出基于图的TSRouter动态路由框架,通过构建异构图并将路由设为候选评分问题来选择最优模态-模型对,在多任务评估中性能显著提升,还具备零样本泛化等优势。

Comments Accepted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20083 2026-07-21 cs.CR cs.CL 版本更新 79%

DisarmRAG: Stealthy Retriever-Centric Poisoning to Disable Self-Correction in Retrieval-Augmented Generation (Extended Version)

DisarmRAG:以检索器为中心的隐秘中毒攻击,以禁用检索增强生成中的自我纠正(扩展版)

Yanbo Dai, Zhenlan Ji, Zongjie Li, Kuan Li, Shuai Wang

专题命中 复杂问题求解 :self-correction(title,abstract);分类 cs.CL

AI总结 研究针对实际部署中LLMs自我纠正能力削弱RAG攻击效果的问题,提出DisarmRAG这一专注检索器的新型中毒范式,构建含迭代协同优化与对比学习技术的攻击框架,经多模型和基准测试验证其有效性及隐秘性。

Comments This paper is an extended version of our original paper accepted by ACM CCS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20379 2026-07-16 cs.AI 版本更新 79%

Policy of Thoughts: Scaling Test-Time Training for LLM Reasoning via Online Policy Evolution

思维策略:通过在线策略进化扩展大语言模型推理的测试时训练

Zhengbo Jiao, Hongyu Xian, Qinglong Wang, Yunpu Ma, Zhebo Wang, Zifan Zhang, Dezhang Kong, Meng Han

机构 * Binjiang Institute, Zhejiang University(浙江大学滨江学院) Shanghai University of Finance and Economics(上海财经大学) South China Normal University(华南师范大学) LMU Munich(慕尼黑大学) Wuhan University(武汉大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 研究针对大语言模型复杂推理难题,提出思维策略(PoT)框架,通过高效探索机制生成候选解,用组相对策略优化更新LoRA适配器,实现推理策略实时进化,显著提升模型性能。

Comments Under Review, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09713 2026-07-14 cs.AI cs.MA cs.RO 新提交 79%

Closed-Loop Control with Rule-Aligned Small Language Models and Multi-Agent Self-Correction

基于规则对齐的小语言模型和多智能体自我校正的闭环控制

Yuchen Wang, Javal Vyas, Tong Liu, Mehmet Mercangoz

专题命中 复杂问题求解 :self-correction(title);reasoning(abstract);分类 cs.AI

AI总结 研究能否对紧凑型小语言模型再训练用于控制推理并嵌入验证器引导的校正循环,通过组相对策略优化对齐模型,结合多种智能体,在随机热控模拟中取得高准确率和低延迟,支持该架构用于边缘可重构自主控制。

Comments Accepted by IEEE CCTA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08758 2026-07-10 cs.AI 新提交 79%

Ideas Have Genomes: Benchmarking Scientific Lineage Reasoning and Lineage-Grounded Idea Generation

思想有基因组:科学谱系推理与基于谱系的思想生成基准测试

Yifan Zhou, Qihao Yang, Yan Li, Donggang Li, Xiru Hu, Hokin Deng, Ziyang Gong, Xuanyi Zhou, Huacan Wang, Xiangchao Yan, Wanghan Xu, Wenlong Zhang, Shaofeng Zhang, Yue Zhou, Yifan Yang, Zhihang Zhong, Xue Yang

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 该研究提出IG-Bench基准测试,用于科学谱系推理与基于谱系的思想生成。围绕IdeaGene框架构建,支持两种评估。通过对14个基于大语言模型的科学家实验,发现存在组合瓶颈,最强系统谱系推理精确准确率低,结构化谱系上下文改变系统排名。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08003 2026-07-10 physics.chem-ph cs.AI 新提交 79%

Reaction-network reasoning with frontier models for experimentally confirmed catalyst-selectivity hypotheses

使用前沿模型进行反应网络推理以获得实验证实的催化剂选择性假设

Sutanay Choudhury, Anwesha Banerjee, Udishnu Sanyal, Jorin Dawidowicz, Chiezugolum Ijeoma Odilinye, Jesun Firoz, Liney Arnadottir, Simone Raugei, Johannes Lercher, Arnab Dutta

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 研究复杂反应中催化剂选择性问题,利用前沿语言模型开发人机协同思考框架,通过识别控制途径竞争的物理杠杆发现新型催化剂,指导合成的催化剂使乙酸盐选择性提高三倍,转变计算范式,提供材料发现蓝图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04945 2026-07-07 cs.CL 新提交 79%

You Frame It: How Conceptual Representations Shape LLM Detection and Reasoning about Antisemitism

你构建框架:概念表征如何塑造大语言模型对反犹主义的检测与推理

Katharina Soemer, Helena Mihaljević

机构 * Goethe University, Frankfurt(法兰克福歌德大学) HTW Berlin(柏林工业大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 研究不同形式概念基础对四个先进大语言模型检测反犹主义及解释行为的影响,用两个专家注释数据集比较不同表征,发现细粒度分类表征能提高召回率但降低精度,还揭示了模型解释存在的局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03787 2026-07-07 cs.AI cs.CE q-bio.BM 新提交 79%

Folding, Reasoning, and Scaling with Open-source Drug Discovery Engine

使用开源药物发现引擎进行折叠、推理和扩展

Aureka AI OpenDDE project

机构 * Aureka AI(奥雷卡人工智能)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 介绍开源全原子生物分子基础模型OpenDDE,以共折叠为切入点构建可扩展AI驱动药物发现引擎,整合多方面进展实现一定精度,还指出共折叠模型扩展方向,推动药物发现发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18089 2026-07-07 cs.LG 新提交 79%

From Reasoning Traces to Reusable Modules: Understanding Compositional Generalization in Language Model Reasoning

从推理轨迹到可复用模块:理解语言模型推理中的组合泛化

Lingjing Kong, Xin Liu, Guangyi Chen, Martin Q. Ma, Xiangchen Song, Yuekai Sun, Mikhail Yurochkin, Taylor W. Killian, Ruslan Salakhutdinov, Kun Zhang, Eric P. Xing, Zhengzhong Liu

机构 * Carnegie Mellon University(卡内基梅隆大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Institute of Foundation Models(基础模型研究院) University of Michigan(密歇根大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.LG

AI总结 本文通过层次化潜在选择模型形式化组合泛化,理论证明SFT提供原子模块,RL分解轨迹实现组合泛化,实验验证RL能从复合轨迹中提取原子模块并重组解决新配置。

Comments ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02262 2026-07-03 cs.CL 新提交 79%

CheckRLM: Effective Knowledge-Thought Coherence Checking in Retrieval-Augmented Reasoning

CheckRLM: 检索增强推理中的有效知识-思维连贯性检查

Dingling Xu, Ruobing Wang, Qingfei Zhao, Yukun Yan, Zhichun Wang, Daren Zha, Shi Yu, Zhenghao Liu, Shuo Wang, Xu Han, Maosong Sun

机构 * School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院) Beijing Key Laboratory of Artificial Intelligence for Education(北京人工智能教育重点实验室) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) Department of Computer Science and Technology, Institute for AI, Tsinghua University(清华大学人工智能研究院计算机科学与技术系) Northeastern University(东北大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 提出CheckRLM框架,通过检索增强生成及时检查和纠正推理链中的事实错误,确保推理与知识一致,降低长程推理错误累积成本。

Comments 24 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14157 2026-07-03 cs.AI cs.CV 版本更新 79%

Ophiuchus: Incentivizing Tool-augmented "Think with Images" for Joint Medical Segmentation, Understanding and Reasoning

Ophiuchus: 激励工具增强的“图像思考”用于联合医学分割、理解与推理

Yankai Jiang, Yujie Zhang, Peng Zhang, Wenjie Li, Yichen Li, Jintai Chen, Xiaoming Shi, Shihui Zhen

机构 * Zhejiang University(浙江大学) Fudan University(复旦大学) Information Hub, HKUST (Guangzhou)(信息枢纽,香港科技大学(广州))

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 提出Ophiuchus框架,通过三阶段训练策略(冷启动SFT、自反思微调、工具强化学习)使MLLM动态聚焦细粒度视觉区域,实现精准医学分割与诊断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30189 2026-06-30 cs.CL 79%

DAIN: Dynamic Agent-Based Interaction Network for Efficient and Collaborative Multimodal Reasoning

DAIN: 基于动态智能体交互网络的高效协同多模态推理

Xinxin Chen, Yuchen Li, Zihan Wang, Haoyu Zhang, Ruixin Liu, Mingyuan Zhao

机构 * University of Chinese Academy of Sciences(中国科学院大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 提出动态智能体交互网络(DAIN),通过上下文感知元控制器动态调度专业交互智能体并压缩通信,实现高效协同多模态推理,在五个基准上取得最优性能。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10359 2026-06-30 cs.CV cs.AI 79%

Tool-Augmented Spatiotemporal Reasoning for Streamlining Video Question Answering Task

增强工具的时空推理用于视频问答任务的优化

Sunqi Fan, Jiashuo Cui, Meng-Hao Guo, Shuojin Yang

机构 * BNRist, Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系,北京信息科学与技术国家研究中心)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出STAR框架和视频工具包,提升多模态大语言模型的时空推理能力,在VideoMME和LongVideoBench上分别提升8.2%和4.6%。

Comments Accepted by NeurIPS 2025 main track

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07533 2026-06-29 cs.AI 版本更新 79%

Joint Reward Modeling: Internalizing Chain-of-Thought for Efficient Visual Reward Models

联合奖励建模:将思维链内化以实现高效的视觉奖励模型

Yankai Yang, Yancheng Long, Hongyang Wei, Wei Chen, Tianke Zhang, Kaiyu Jiang, Haonan Fan, Changyi Liu, Jiankang Chen, Kaiyu Tang, Bin Wen, Fan Yang, Tingting Gao, Han Li, Shuo Yang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Kuaishou Technology(快手科技)

专题命中 复杂问题求解 :chain-of-thought(title);reasoning(abstract);分类 cs.AI

AI总结 提出联合奖励建模(JRM),通过共享视觉-语言骨干联合优化偏好学习和语言建模,将生成模型的语义推理能力内化到判别表示中,实现快速准确评估,在MMRB2和EditReward-Bench上取得最优结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25338 2026-06-25 cs.CL 新提交 79%

Hybrid-IR: Dual-Path Hybrid Retrieval with Iterative Reasoning for Complex Medical Question Answering

Hybrid-IR: 面向复杂医学问答的双路径混合检索与迭代推理

Sheng Wan, Jiahui Zhang, Zicheng Zhao, Shougang Ren

机构 * College of Artificial Intelligence, Nanjing Agricultural University(南京农业大学人工智能学院) School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 提出Hybrid-IR框架,结合图检索与稠密检索的双路径检索机制,并通过迭代检索-推理循环逐步优化推理轨迹,有效解决复杂医学问答中知识碎片化和静态检索不足的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00869 2026-06-24 cs.CL 版本更新 79%

What's Missing in Vision-Language Models? Probing Their Struggles with Causal Order Reasoning

视觉-语言模型缺少什么?探究它们在因果顺序推理中的困难

Zhaotian Weng, Haoxuan Li, Xin Eric Wang, Kuan-Hao Huang, Jieyu Zhao

机构 * University of Southern California(南加州大学) University of California, Santa Barbara(加州大学圣芭芭拉分校) Texas A&M University(德克萨斯A&M大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 针对VLM在因果推理中的不足,提出VQA-Causal和VCR-Causal基准,发现模型在因果任务上仅略优于随机猜测,归因于训练数据缺乏因果表达,并通过难负例微调改善。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04460 2026-06-24 cs.AI 版本更新 79%

From "Aha Moments" to Controllable Thinking: Toward Meta-Cognitive Reasoning in Large Reasoning Models via Decoupled Reasoning and Control

从“顿悟时刻”到可控思考:通过解耦推理与控制实现大型推理模型中的元认知推理

Rui Ha, Rui Pu, Chaozhuo Li, Li Sun, Sen Su

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Chongqing University of Posts and Telecommunications(重庆邮电大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 针对大型推理模型过度思考问题,提出元认知推理框架MERA,通过解耦推理与控制、构建推理-控制交替序列训练,结合控制段策略优化,提升推理效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23301 2026-06-23 cs.AI 新提交 79%

EHR-Complex: Benchmarking Medical Agents for Complex Clinical Reasoning

EHR-Complex:面向复杂临床推理的医疗智能体基准测试

Yitong Qiao, Lei Liu, Yue Shen, Jian Wang, Jinjie Gu, Zhixuan Chu, Kui Ren

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 提出EHR-Complex基准,基于MIMIC-IV构建约5.2万项交互式临床数据库推理任务,评估智能体在复杂SQL和代码执行中的表现,揭示主要失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21974 2026-06-23 quant-ph cs.AI 新提交 79%

Fine-Tuning Large Language Models for Quantum Reasoning

微调大型语言模型用于量子推理

Katherine Ip, Casey R. Myers, Udaya Parampalli, James Quach, Peiyong Wang

机构 * School of Computing and Information Systems, The University of Melbourne(墨尔本大学计算机与信息系统学院) School of Physics, Mathematics and Computing, The University of Western Australia(西澳大学物理、数学与计算学院) Pawsey Supercomputing Centre(帕韦西超级计算中心) CSIRO Clayton(CSIRO 克莱顿分校)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 提出通过量子电路模拟微调LLM,比较监督微调与两阶段SFT+GRPO方法,实现量子推理能力提升。

Comments 30 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22446 2026-06-23 cs.AI 版本更新 79%

Anytime Safe PAC Efficient Reasoning

任意时间安全PAC高效推理

Chengyao Yu, Hao Zeng, Youxin Zhu, Jianguo Huang, Huajun Zeng, Bingyi Jing

机构 * Department of Statistics and Data Science(统计与数据科学系) Department of Statistics(统计系) Data Science, Southern University of Science(数据科学,南方科技大学) College of Computing(计算学院) College of Computing and Data Science(计算与数据科学学院) School of Statistics(统计学系) School of Statistics and Data Science(统计与数据科学系) School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen(人工智能学院,香港中文大学(深圳)) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 针对大型推理模型计算成本高的问题,提出B-PAC推理方法,利用逆倾向评分估计构建测试超鞅,动态调整路由阈值,在部分反馈下实现任意时间安全高效推理,理论保证性能损失控制,实验减少思考模型使用达81.01%。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.02950 2026-06-23 cs.AI 版本更新 79%

A criterion for Artificial General Intelligence: hypothetic-deductive reasoning, tested on ChatGPT

通用人工智能的一个判据:假设-演绎推理,在ChatGPT上测试

Louis Vervoort, Vitaliy Mizyakov, Anastasia Ugleva

机构 * Higher School of Economics, Moscow(莫斯科高等经济学院)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出假设-演绎推理是AGI的关键推理能力,通过简单测试发现ChatGPT在复杂问题上该能力有限,并指出若AI能在广泛语境中具备此能力则可视为AGI。

Comments Minor revisions of previous version

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.14985 2026-06-19 cs.CV cs.CL 版本更新 79%

IdealGPT: Iteratively Decomposing Vision and Language Reasoning via Large Language Models

IdealGPT: 通过大型语言模型迭代分解视觉与语言推理

Haoxuan You, Rui Sun, Zhecan Wang, Long Chen, Gengyu Wang, Hammad A. Ayyubi, Kai-Wei Chang, Shih-Fu Chang

机构 * Columbia University(哥伦比亚大学) HKUST(香港科技大学) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 提出IdealGPT框架,利用大型语言模型迭代分解视觉语言推理任务,通过子问题生成、子答案获取和最终答案推理的循环过程,在零样本设置下显著提升多步推理性能。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02885 2026-06-19 cs.CL 版本更新 79%

Med-R2: Perception and Reflection-driven Complex Reasoning for Medical Report Generation

Med-R2:面向医学报告生成的感知与反思驱动复杂推理

Hao Wang, Shuchang Ye, Jinghao Lin, Usman Naseem, Jinman Kim

机构 * The School of Computer Science, The University of Sydney(悉尼大学计算机科学学院) The School of Computing, Macquarie University(麦考瑞大学计算机学院) Doubao Medical Group, ByteDance(字节跳动 doubao 医疗集团)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 提出Med-R2微调策略,通过引入感知驱动的长推理过程和放射学知识指导,并加入反思机制修正感知错误,提升LVLMs在医学报告生成中的病理特征感知和诊断准确性。

Comments 28 pages, 3 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03872 2026-06-17 cs.CL 版本更新 79%

Atlas: Orchestrating Heterogeneous Models and Tools for Multi-Domain Complex Reasoning

Atlas: 编排异构模型与工具实现多领域复杂推理

Jinyang Wu, Guocheng Zhai, Ruihan Jin, Jiahao Yuan, Yuhao Shen, Shuai Zhang, Zhengqi Wen, Jianhua Tao

机构 * Tsinghua University(清华大学) Zhejiang University(浙江大学) East China Normal University(华东师范大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 提出ATLAS双路径框架,通过无监督聚类路由和强化学习多步路由动态选择最优模型-工具组合,在15个基准上超越GPT-4o,分布内外任务分别提升10.1%和13.1%。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16808 2026-06-16 cs.AI 新提交 79%

Adaptive and Explicit safe: Triggering Latent Safety Awareness in Large Reasoning Models

自适应且显式安全:触发大型推理模型中的潜在安全意识

Ke Miao, Jiaxin Li, Hongliang Chen, Yuke Hu, Zhan Qin

机构 * The State Key Laboratory of Blockchain and Data Security, Zhejiang University(浙江大学区块链与数据安全全国重点实验室) Hangzhou HighTech Zone (Binjiang) Blockchain and Data Security Research Institute, China(杭州高新区(滨江)区块链与数据安全研究院) Li Auto Inc.(理想汽车) Tsinghua University(清华大学) King Abdullah University Of Science And Technology(阿卜杜拉国王科技大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 针对大型推理模型易受越狱攻击的问题,提出Safe Trigger方法,通过SFT显式诱导安全标签触发安全分析,并用DPO优化,显著降低攻击成功率而不影响通用性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09679 2026-06-16 cs.MA cs.AI 版本更新 79%

HCP-MAD:Heterogeneous Consensus-Progressive Reasoning for Efficient Multi-Agent Debate

HCP-MAD:用于高效多智能体辩论的异构共识渐进推理

Yiqing Liu, Hantao Yao, Wu Liu, Allen He, Yongdong Zhang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 提出HCP-MAD框架,通过异构共识验证和自适应停止机制,在保持准确率的同时大幅降低多智能体辩论的token成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02028 2026-06-16 cs.AI 版本更新 79%

Edit Knowledge, Not Just Facts via Multi-Step Reasoning over Background Stories

编辑知识,而不仅仅是事实:基于背景故事的多步推理

Ya Gao, Kalle Kujanpää, Pekka Marttinen, Harri Valpola, Alexander Ilin

机构 * Aalto University(阿莱大学) Amazon.com(亚马逊公司) System 2 AI(系统2人工智能)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 提出将知识更新视为推理问题,通过背景故事引入新知识、自生成多跳问题训练和知识蒸馏,使模型在多步推理中灵活运用新信息。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13634 2026-06-12 cs.CL math.CT 新提交 79%

Operads for compositional reasoning in LLMs

用于LLM组合推理的Operad框架

Nathaniel Bottman, Kyle Richardson

机构 * Allen Institute for Artificial Intelligence(人工智能研究所)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 提出operad作为问题分解的数学框架,定义问题operad Q,将QA模型解释为Q上的代数,并引入operadic一致性度量,实验表明该度量与准确性强相关。

详情

展开后加载摘要…

URL PDF HTML 收藏