arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-12 至 2026-01-12 共收录 71 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 9 篇

2601.05616 2026-01-12 cs.LG 87%

Dual-Phase LLM Reasoning: Self-Evolved Mathematical Frameworks

双阶段LLM推理:自演化数学框架

ShaoZhen Liu, Xinting Huang, Houwen Peng, Xin Chen, Xinyang Song, Qi Li, Zhenan Sun

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);self-correction(abstract)

AI总结 本文提出双阶段训练框架,通过自动生成的长链式思考数据增强模型自我纠正能力,提升数学问题解决性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11741 2026-01-12 cs.AI cs.CL cs.LG 82%

Climbing the Ladder of Reasoning: What LLMs Can-and Still Can't-Solve after SFT?

攀登推理的阶梯:在SFT之后,大语言模型能解决什么问题?

Yiyou Sun, Georgia Zhou, Haoyue Bai, Hao Wang, Dacheng Li, Nouha Dziri, Dawn Song

机构 * University of California, Berkeley(加州大学伯克利分校) University of Wisconsin, Madison(威斯康星大学麦迪逊分校) Allen Institute for AI(人工智能研究院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过分析AIME24数据集,揭示了大语言模型在数学推理任务中不同难度层级的进阶要求,发现SFT对提升推理能力有限,而扩大数据规模更有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01937 2026-01-12 cs.LG cs.AI stat.ML 81%

Shorter but not Worse: Frugal Reasoning via Easy Samples as Length Regularizers in Math RLVR

更短但不更差:通过易样本作为长度正则化器进行节俭推理

Abdelaziz Bounhar, Hadi Abdine, Evan Dufraisse, Ahmad Chamma, Amr Mohamed, Dani Bouch, Michalis Vazirgiannis, Guokan Shang

机构 * MBZUAI Ecole Polytechnique(巴黎政治学院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 通过易样本作为长度正则化器,使模型在不增加输出长度的情况下更高效地解决复杂问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05300 2026-01-12 cs.LG cs.CL 81%

TIME: Temporally Intelligent Meta-reasoning Engine for Context Triggered Explicit Reasoning

TIME:面向上下文触发的显式推理的时序智能元推理引擎

Susmit Das

机构 * Independent Researcher(独立研究者)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 TIME通过引入时序智能元推理引擎,改进对话模型的显式推理能力,提升时间感知和推理效率。

Comments 14 pages, 3 figures with 27 page appendix. See https://github.com/The-Coherence-Initiative/TIME and https://github.com/The-Coherence-Initiative/TIMEBench for associated code

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06022 2026-01-12 cs.CL cs.AI 62%

AdaFuse: Adaptive Ensemble Decoding with Test-Time Scaling for LLMs

AdaFuse: 用于大语言模型的自适应集成解码与测试时缩放

Chengming Cui, Tianxin Wei, Ziyi Chen, Ruizhong Qiu, Zhichen Zeng, Zhining Liu, Xuying Ning, Duo Zhou, Jingrui He

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 AdaFuse通过自适应集成解码与测试时缩放,提升大语言模型在多种任务上的生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05870 2026-01-12 cs.LG cs.AI 62%

IIB-LPO: Latent Policy Optimization via Iterative Information Bottleneck

IIB-LPO: 通过迭代信息瓶颈进行潜在策略优化

Huilin Deng, Hongchen Luo, Yue Zhu, Long Li, Zhuoyue Chen, Xinghao Zhao, Ming Li, Jihai Zhang, Mengchang Wang, Yang Cao, Yu Kang

机构 * DeepSeek-AI

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 IIB-LPO通过迭代信息瓶颈方法,解决LLM推理中的探索崩溃问题,实现更多样化的推理路径和更高的性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05501 2026-01-12 cs.LG cs.CL 62%

Hi-ZFO: Hierarchical Zeroth- and First-Order LLM Fine-Tuning via Importance-Guided Tensor Selection

Hi-ZFO:通过重要性引导的张量选择实现层次化零阶和一阶LLM微调

Feihu Jin, Ying Tan

机构 * School of Intelligence Science and Technology, Peking University(智能科学与技术学院,北京大学) State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 Hi-ZFO通过结合一阶和零阶优化,提升LLM微调的精度与探索能力,有效解决训练中的局部极小值问题。

Comments 13 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05607 2026-01-12 cs.LG 57%

Orchestrating Tokens and Sequences: Dynamic Hybrid Policy Optimization for RLVR

协调标记与序列:动态混合策略优化用于RLVR

Zijun Min, Bingshuai Liu, Ante Wang, Long Zhang, Anxiang Zeng, Haibo Zhang, Jinsong Su

机构 * School of Informatics, Xiamen University(厦门大学信息学院) LLM Team, Shopee Pte. Ltd.(Shopee 股份有限公司语言模型团队) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出动态混合策略优化方法,通过结合标记级和序列级重要性比率,提升RLVR在数学推理任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05298 2026-01-12 cs.AI 57%

Mathematical Knowledge Graph-Driven Framework for Equation-Based Predictive and Reliable Additive Manufacturing

基于数学知识图谱的方程驱动框架用于基于方程的预测和可靠的增材制造

Yeongbin Cha, Namjung Kim

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出基于数学知识图谱的框架,结合大语言模型与增材制造知识图谱,实现可靠的知识提取和外推建模,提升预测的准确性和物理一致性。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 1 篇

2601.03731 2026-01-12 cs.SE cs.AI 79%

From Laboratory to Real-World Applications: Benchmarking Agentic Code Reasoning at the Repository Level

从实验室到现实应用:在仓库级别评估代理代码推理

Jia Li, Yuxin Su, Michael R. Lyu

机构 * The Chinese University of Hong Kong(香港中文大学) Sun Yat-sen University(中山大学)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI

AI总结 RepoReason提出了一种白盒诊断基准测试,通过执行驱动的突变框架和动态程序切片,量化推理能力,揭示集成宽度是代理代码推理的主要瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 逻辑推理 5 篇

2601.05705 2026-01-12 cs.AI cs.CL cs.LO 81%

Logic-Parametric Neuro-Symbolic NLI: Controlling Logical Formalisms for Verifiable LLM Reasoning

逻辑参数化神经符号推理:通过可控逻辑形式实现可验证的大语言模型推理

Ali Farjami, Luca Redondi, Marco Valentino

机构 * University of Luxemburg(卢森堡大学) University of Sheffield(谢菲尔德大学)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出逻辑参数化框架,通过可控逻辑形式提升神经符号推理的鲁棒性与适应性,实验表明内部逻辑策略在不同领域具有更优表现。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18839 2026-01-12 cs.CL 77%

Detect, Explain, Escalate: Sustainable Dialogue Breakdown Management for LLM Agents

检测、解释、升级:面向LLM代理的可持续对话破裂管理

Abdellah Ghassel, Xianzhi Li, Xiaodan Zhu

机构 * Department of Electrical and Computer Engineering and Ingenuity Labs Research Institute, Queen’s University(电气与计算机工程系和Ingenuity Labs研究研究所,皇后大学)

专题命中 逻辑推理 :reasoning(abstract);chain-of-thought(abstract);logical reasoning(abstract);分类 cs.CL

AI总结 本文提出了一种可持续对话破裂管理框架,通过高效检测器和升级架构,在LLM代理中实现资源高效的对话破裂管理,提升对话AI的可靠性和成本效益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18695 2026-01-12 cs.AI cs.CE cs.CL 73%

KALE-LM-Chem: Vision and Practice Toward an AI Brain for Chemistry

KALE-LM-Chem:迈向化学人工智能脑的愿景与实践

Weichen Dai, Yezeng Chen, Zijie Dai, Yubo Liu, Zhijie Huang, Yixuan Pan, Baiyang Song, Chengli Zhong, Xinhe Li, Zeyu Wang, Zhuoying Feng, Yi Zhou

机构 * University of Science and Technology of China(科学技术大学) ShanghaiTech University(上海科技大学) USTC Knowledge Computing Lab(USTC知识计算实验室) State Key Laboratory of Communication Content Cognition People's Daily Online(通信内容认知国家重点实验室)

专题命中 逻辑推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出KALE-LM-Chem模型,旨在通过整合领域知识和逻辑,推动化学领域的智能AI发展,提升科学发现效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23143 2026-01-12 cs.RO cs.AI 57%

Automated Generation of MDPs Using Logic Programming and LLMs for Robotic Applications

利用逻辑编程和大语言模型自动化生成MDP用于机器人应用

Enrico Saccon, Davide De Martini, Matteo Saveriano, Edoardo Lamon, Luigi Palopoli, Marco Roveri

机构 * Department of Information Engineering and Computer Science, University of Trento(信息工程与计算机科学系,特伦托大学) Department of Industrial Engineering, University of Trento(工业工程系,特伦托大学)

专题命中 逻辑推理 :planning(abstract);分类 cs.AI

AI总结 本文提出结合大语言模型与形式方法,通过逻辑编程自动生成可执行的MDP策略,用于机器人中的概率规划。

Comments 9 pages, 11 figures, 2 tables, 2 algorithms, accepted for publication in IEEE Robotics and Automation Letters

Journal ref IEEE Robotics and Automation Letters, vol. 11, no. 2, pp. 1770-1777, Feb. 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05939 2026-01-12 cs.CV 50%

Context-Aware Decoding for Faithful Vision-Language Generation

面向上下文的解码方法用于忠实的视觉-语言生成

Mehrdad Fazli, Bowen Wei, Ziwei Zhu

机构 * Department of Computer Science, George Mason University(计算机科学系,乔治·马歇尔大学)

专题命中 逻辑推理 :reasoning(abstract)

AI总结 本文提出了一种无需训练的上下文嵌入注入方法,通过利用上下文嵌入信号在解码过程中保持视觉一致性,有效减少视觉-语言模型中的幻觉问题。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 规划推理 18 篇

2601.05455 2026-01-12 cs.AI cs.LG 86%

ART: Adaptive Reasoning Trees for Explainable Claim Verification

ART:可解释性声明验证的自适应推理树

Sahil Wadhwa, Himanshu Kumar, Guanqun Yang, Abbaas Alif Mohamed Nishar, Pranab Mohanty, Swapnil Shinde, Yue Wu

机构 * Capital One Stevens Institute of Technology(史蒂文斯理工学院)

专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI、cs.LG

AI总结 ART通过自适应推理树提升声明验证的可解释性和可靠性,通过分层论证结构和法官LLM裁决实现透明且可挑战的决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.11314 2026-01-12 cs.MA cs.AI 83%

Simulating Multi-Stakeholder Decision-Making with Generative Agents in Urban Planning

用生成代理模拟城市规划中的多利益相关者决策

Jin Gao, Hanyong Xu, Luc Dao

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 本研究通过多生成代理系统模拟城市规划中的多利益相关者决策,探讨人口因素对集体决策的影响,并提升决策的公平性和效率。

Journal ref Advances in Transdisciplinary Engineering, Vol. 76, pp. 40-49, IOS Press, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03811 2026-01-12 cs.AI 79%

Rethinking Supply Chain Planning: A Generative Paradigm

重新思考供应链规划:一种生成范式

Jiaheng Yin, Yongzhi Qi, Jianshen Zhang, Dongyang Geng, Zhengyu Chen, Hao Hu, Wei Qi, Zuo-Jun Max Shen

机构 * Tsinghua University, Beijing, China(清华大学) JD.com, Beijing, China(京东) Faculty of Engineering and Faculty of Business and Economics, The University of Hong Kong, China(香港大学工程学院和商学院) College of Engineering, University of California, Berkeley, CA, USA(加州大学伯克利分校工程学院)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 本文提出一种基于生成式人工智能的供应链规划范式,通过智能代理框架提升规划准确性与库存率,实现动态需求下的适应性协调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01022 2026-01-12 cs.AI cs.MA cs.RO 79%

Symbolic Planning and Multi-Agent Path Finding in Extremely Dense Environments with Unassigned Agents

符号规划与在极度密集环境中无分配代理的多智能体路径寻找

Bo Fu, Zhe Chen, Rahul Chandan, Alex Barbosa, Michael Caldara, Joey Durham, Federico Pecora

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 本文提出五种基于搜索的算法,用于解决在极度密集环境中无分配代理的多智能体路径寻找问题,通过图搜索方法高效生成重新排列计划。

Comments AAAI Conference on Artificial Intelligence (AAAI-26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06931 2026-01-12 cs.RO 78%

Non-Prehensile Tool-Object Manipulation by Integrating LLM-Based Planning and Manoeuvrability-Driven Controls

通过整合基于大语言模型的规划和机动性驱动的控制实现非抓取工具-物体 manipulation

Hoi-Yin Lee, Peng Zhou, Anqing Duan, Wanyu Ma, Chenguang Yang, David Navarro-Alarcon

机构 * organization= Department of Mechanical Engineering, The Hong Kong Polytechnic University , addressline= KLN, Hong Kong organization= School of Advanced Engineering, The Great Bay University , addressline= Dongguan, China organization= Department of Robotics, Mohamed Bin Zayed University of Artificial Intelligence , addressline= Abu Dhabi, UAE organization= Department of Surgery, The Chinese University of Hong Kong , addressline= NT, Hong Kong organization= Department of Computer Science, University of Liverpool , addressline= Liverpool, UK

专题命中 规划推理 :planning(title,abstract)

AI总结 本文提出了一种结合大语言模型和机动性驱动控制的方法,用于实现非抓取工具-物体 manipulation任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04285 2026-01-12 cs.AI cs.HC cs.LG cs.MA 73%

A Future Capabilities Agent for Tactical Air Traffic Control

战术空交通管制中的未来能力代理

Paul Kent, George De Ath, Martin Layton, Allen Hart, Richard Everson, Ben Carvell

机构 * University of Exeter(埃克塞特大学) NATS(英国航空交通服务提供商)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Agent Mallard,一种基于规则的前瞻性规划代理,用于战术空交通管制,通过嵌入随机数字双胞胎实现安全冲突解决,并在简化场景中展示与专家推理一致的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16769 2026-01-12 cs.AI cs.CL 73%

See or Say Graphs: Agent-Driven Scalable Graph Structure Understanding with Vision-Language Models

见或说图:基于视觉语言模型的 agent 驱动可扩展图结构理解

Shuo Han, Yukun Cao, Zezhong Ding, Zengyi Gao, S Kevin Zhou, Xike Xie

机构 * University of Science and Technology of China(中国科学技术大学) Data Darkness Lab, MIRACLE Center, USTC(数据黑暗实验室,MIRACLE中心,USTC) MIRACLE Center, Suzhou Institute for Advance Research, USTC(MIRACLE中心,苏州先进研究所,USTC)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 GraphVista 是一种基于视觉语言模型的 agent 驱动框架,通过分层图检索和模态协调机制,实现大规模图结构理解的可扩展性和性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02196 2026-01-12 cs.LG 70%

ACDZero: MCTS Agent for Mastering Automated Cyber Defense

ACDZero:用于掌握自动化网络防御的MCTS代理

Yu Li, Sizhe Tang, Rongqian Chen, Fei Xu Yu, Guangyu Jiang, Mahdi Imani, Nathaniel D. Bastian, Tian Lan

机构 * Dept of ECE, George Washington University(电子工程系,乔治华盛顿大学) Dept of ECE, Northeastern University(电子工程系,东北大学) Dept of EECS, United States Military Academy(电子工程与科学系,美国军事学院)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.LG

AI总结 ACDZero通过基于MCTS的规划策略和图神经网络实现高效自动化网络防御,提升防御奖励和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21674 2026-01-12 cs.DB cs.AI 70%

QueryGym: Step-by-Step Interaction with Relational Databases

QueryGym: 关系数据库中的分步交互

Haritha Ananthakrishnan, Harsha Kokel, Kelsey Sikes, Debarun Bhattacharjya, Michael Katz, Shirin Sohrabi, Kavitha Srinivas

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 QueryGym通过提供关系数据库分步交互环境,促进LLM查询规划代理的透明评估与错误修复研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05465 2026-01-12 cs.AI 70%

PRISMA: Reinforcement Learning Guided Two-Stage Policy Optimization in Multi-Agent Architecture for Open-Domain Multi-Hop Question Answering

PRISMA:基于强化学习的多智能体架构中两阶段策略优化

Yu Liu, Wenxiao Zhang, Cong Cao, Wenxuan Lu, Fangfang Yuan, Diandian Guo, Kun Peng, Qiang Sun, Kaiyan Zhang, Yanbing Liu, Jin B. Hong, Bowen Zhou, Zhiyuan Ma

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 PRISMA通过两阶段组相对策略优化,结合推理引导协作,解决多跳问答中的检索崩溃和学习不稳定问题,实现高性能和稳定部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05356 2026-01-12 cs.RO cs.AI cs.MA q-bio.QM 70%

PRISM: Protocol Refinement through Intelligent Simulation Modeling

通过智能仿真建模实现协议优化:PRISM

Brian Hsu, Priyanka V Setty, Rory M Butler, Ryan Lewis, Casey Stone, Rebecca Weinberg, Thomas Brettin, Rick Stevens, Ian Foster, Arvind Ramanathan

机构 * Argonne National Laboratory(阿贡国家实验室)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 PRISM通过智能仿真建模实现实验协议的自动化设计、验证和执行,结合语言模型代理、数字孪生验证和机器人执行,提供端到端的实验流程解决方案。

Comments 43 pages, 8 figures, submitted to RSC Digital Discovery. Equal contribution: B. Hsu, P.V. Setty, R.M. Butler. Corresponding author: A. Ramanathan

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05293 2026-01-12 cs.CR cs.AI 70%

A Survey of Agentic AI and Cybersecurity: Challenges, Opportunities and Use-case Prototypes

代理AI与网络安全的综述:挑战、机遇与用例原型

Sahaya Jestus Lazer, Kshitiz Aryal, Maanak Gupta, Elisa Bertino

机构 * Tennessee Tech University(田纳西科技大学) University of Nebraska Omaha(内布拉斯加大学奥马哈分校) Purdue University(普渡大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文综述了代理AI在网络安全中的应用,探讨了其在防御和攻击方面的双重用途,分析了系统性风险,并展示了三个实际用例以说明其在网络安全中的行为和影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05376 2026-01-12 cs.AI cs.CL 62%

The Persona Paradox: Medical Personas as Behavioral Priors in Clinical Language Models

医疗人设悖论:临床语言模型中的行为先验

Tassallah Abdullahi, Shrestha Ghosh, Hamish S Fraser, Daniel León Tramontini, Adeel Abbasi, Ghada Bourjeily, Carsten Eickhoff, Ritambhara Singh

机构 * Brown University(布朗大学) University of Tuebingen(图宾根大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究揭示医疗人设在临床语言模型中产生上下文依赖的性能权衡,显示其在重症护理任务中提升表现,但在初级护理中降低性能,且互动风格影响风险倾向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06021 2026-01-12 cs.CL 57%

Chaining the Evidence: Robust Reinforcement Learning for Deep Search Agents with Citation-Aware Rubric Rewards

证据链的构建:基于引用感知的鲁棒深度搜索代理强化学习

Jiajie Zhang, Xin Lv, Ling Feng, Lei Hou, Juanzi Li

机构 * Tsinghua University(清华大学) Zhipu AI(智谱AI)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出引用感知评分框架和组相对策略优化方法,用于提升深度搜索代理的鲁棒性和推理质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05478 2026-01-12 cs.CL 57%

The Facade of Truth: Uncovering and Mitigating LLM Susceptibility to Deceptive Evidence

真相的 facade:揭示并缓解 LLM 对欺骗性证据的易感性

Herun Wan, Jiaying Wu, Minnan Luo, Fanxiao Li, Zhi Zeng, Min-Yen Kan

机构 * Xi’an Jiaotong University(西安交通大学) National University of Singapore(新加坡国立大学) Yunnan University(云南大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出 MisBelief 框架揭示 LLM 对复杂欺骗性证据的脆弱性,并提出 DIS 机制缓解这一问题,提升模型对误导性证据的抵御能力。

详情

展开后加载摘要…

URL PDF HTML 收藏