arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 5849 信号源:cs.CL, cs.AI, cs.LG

1. 其他推理 5849 篇

1809.01077 2018-09-05 cs.CC cs.GT cs.SI math.PR 71%

Reasoning in Bayesian Opinion Exchange Networks Is PSPACE-Hard

Jan Hązła, Ali Jadbabaie, Elchanan Mossel, M. Amin Rahimian

专题命中 其他推理 :reasoning(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24848 2026-08-26 cs.CL 新提交 70%

BrowserForge: Scaling Web Episode via Parallel Browser Sandboxes

BrowserForge:通过并行浏览器沙盒扩展网页交互序列数据规模

Fei Tang, Huawen Shen, Zhiqiong Lu, Zhengxi Lu, Pengyuan Lyu, Chengquan Zhang, Weiming Lu, Jun Xiao, Yueting Zhuang, Yongliang Shen

机构 * Zhejiang University(浙江大学) Tencent(腾讯)

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 提出BrowserForge框架,通过并行浏览器沙盒从开放网络生成20余万条不同网站的网页交互轨迹,微调多模态模型后在两个基准任务上性能显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22916 2026-08-25 cs.CL 新提交 70%

Knowing Isn't Always Saying: When Do Spatial Encodings Reach Answers in Vision-Language Models?

知晓并非总能表达:视觉语言模型中空间编码何时能抵达答案?

Zeyu Wang, Xinming Xu

机构 * Peking University(北京大学) Tsinghua University(清华大学)

专题命中 其他推理 :chain-of-thought(abstract,abstract_cn);分类 cs.CL

AI总结 本研究针对视觉语言模型的空间编码何时能抵达答案的问题,采用方向干预方法,揭示了因果影响仅出现在中深层、文本思维链与视觉接地提示的不同作用等传输模式,为解决编码-接地差距提供了新视角。

Comments Accepted to appear in the EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10963 2026-08-12 cs.CL 新提交 70%

REAP: Relation-Aware Elicitation and Parsing for Closed-Book Knowledge Base Construction from LLMs

REAP:面向基于大语言模型的闭卷知识库构建的关系感知引出与解析

Thanh-Dan Bui, Thanh-Trung Do, Tuan-Phong Nguyen

机构 * VNU University of Engineering and Technology(VNU工程技术大学)

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 该研究提出REAP系统,基于Mistral-Small-24B-Instruct-2501模型,结合结构化思维链推理等技术,在2026年AKBC共享任务闭卷知识库构建任务中取得宏F1值0.62,相关代码已公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09643 2026-08-11 cs.CR cs.LG 新提交 70%

Activation Probes Surface Code-Security Signals that the Model's Output Misses

激活探针:挖掘模型输出遗漏的表面代码安全信号

Ivan Wiryadi

专题命中 其他推理 :chain-of-thought(abstract,abstract_cn);分类 cs.LG

AI总结 本研究提出用线性探针分析开源审查器模型的激活值,发现其携带了仅通过模型提示无法获取的代码安全信号,可有效区分有漏洞与修复后的函数。

Comments 6 pages, 1 figure. Accepted at the TAIGR workshop, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18693 2026-07-22 cs.CL 新提交 70%

Rationale-Guided Knowledge Distillation for Cross-Lingual Stance Detection

用于跨语言立场检测的基于理由引导的知识蒸馏

Qiuli Zhou, Jingyuan Yao, Shengeng Tang, Hongzhi Chen, Jun Tang, Richang Hong

机构 * School of Foreign Studies, Hefei University of Technology(合肥工业大学外国语学院) School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机与信息工程学院) Hefei Institute of Technology(合肥学院)

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 针对跨语言立场检测中现有方法忽视推理过程及大语言模型存在局限性的问题,提出基于理由引导的知识蒸馏框架,用思维链提示引导大语言模型生成理由并提炼知识至学生模型,设计双路径蒸馏机制及对比学习策略,实验证明该方法优于基线。

Comments 23 pages, 7 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07233 2026-07-07 cs.AI 70%

From "Thinking" to "Justifying": Aligning High-Stakes Explainability with Professional Communication Standards

从‘思考’到‘证明’:将高风险可解释性与专业沟通标准对齐

Chen Qian, Yimeng Wang, Yu Chen, Lingfei Wu, Andreas Stathopoulos

机构 * William & Mary(威廉玛丽学院) Anytime AI

专题命中 其他推理 :chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 本文提出‘结果->证明’方法,通过结构化可解释性框架SEF提升系统输出的可验证性与可靠性,在三个领域四个任务中验证了该方法的有效性。

Journal ref Findings of the Association for Computational Linguistics: ACL 2026, pp. 24628-24637

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26489 2026-06-26 cs.CL 新提交 70%

Comparing BERT Sentence-Pair Classification and Few-Shot LLM Prompting for Detecting Threat and Solution Framing in German Climate News

比较BERT句子对分类与少样本LLM提示在检测德国气候新闻中的威胁和解决方案框架

Raven Adam, David Maier, Marie Kogler

机构 * University of Graz(格拉茨大学) Technical University of Graz(格拉茨技术大学)

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 针对德语气候新闻句子级框架检测,比较了微调BERT(句子对分类)与少样本LLM提示(Llama 4)方法,BERT在F1上达到0.83,优于LLM的0.78。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21228 2026-06-24 cs.LG 新提交 70%

Sakana Fugu Technical Report

Sakana Fugu 技术报告

Yujin Tang, Edoardo Cetin, Jinglue Xu, Qi Sun, Stefan Nielsen, Vincent Richard, Haruto Goda, Iaroslav Tymchenko, Nhan Nguyen, Hyunin Lee, Mari Ashiga, Shashank Kotyan, So Kuroki, Tarin Clanuwat

机构 * Sakana AI

专题命中 其他推理 :reasoning(abstract,abstract_cn);分类 cs.LG

AI总结 提出Fugu系列协调模型,通过动态代理框架组合多个LLM专长,在多项基准上达到最优性能,并描述其训练范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26253 2026-06-09 cs.CL 版本更新 70%

Pragmatic Theories Enhance Understanding of Implied Meanings in LLMs

语用理论增强对LLM中隐含意义的理解

Takuma Sato, Seiya Kawano, Koichiro Yoshino

机构 * Nara Institute of Science and Technology(奈良科学技術大學) RIKEN(理化学研究所) Guardian Robot Project(守護機器人專案) Kyoto Institute of Technology(京都科技大學) Institute of Science Tokyo(東京科學研究所)

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本研究提出以语用理论(如Grice语用学和关联理论)作为提示,引导语言模型逐步推理,在隐含意义理解任务上相比0-shot思维链提升高达9.6%的得分。

Comments Correction of minor typographical errors in the references

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07380 2026-06-08 cs.CL 版本更新 70%

Mining Useful General Data for Low-Resource Domain Adaptation

挖掘低资源领域适应的有用通用数据

Pingjie Wang, Hongcheng Liu, Yusheng Liao, Ziqing Fan, Yaxin Du, Shuo Tang, Yanfeng Wang, Yu Wang

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 针对低资源领域数据稀缺问题,提出NTK-Selector方法,利用神经正切核从通用数据中筛选有用样本,显著提升领域适应效果。

Comments 39 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08665 2026-06-04 cs.CL 70%

Hint Tuning: Less Data Makes Better Reasoners

Hint Tuning:更少的数据造就更好的推理者

Siqi Fan, Minghao Li, Xiaoqian Ma, Xiusheng Huang, Zhuo Chen, Bowen Qin, Liujie Zhang, Shuo Shang, Weihang Chen

机构 * University of Electronic Science and Technology of China(电子科技大学) Xiaohongshu Inc.(小红书公司) National University of Singapore(新加坡国立大学)

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 提出Hint Tuning方法,通过自动构建三种提示状态(无提示、稀疏提示、完整提示)的训练数据,使推理模型根据问题难度校准推理深度,仅用1K样本即可在多个主流推理模型上平均减少31.5%的token生成,同时保持竞争性准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01532 2026-06-03 cs.LG cs.CC 70%

Rethinking the Role of Positional Encoding: Sliding-Window Transformers without PE Remain Turing Complete

重新思考位置编码的作用:无PE的滑动窗口Transformer仍具图灵完备性

Qian Li, Xinyu Mao, Shang-Hua Teng

机构 * Shenzhen Research Institute of Big Data(深圳大数据研究院) University of Southern California(南加州大学)

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.LG

AI总结 本文证明,在滑动窗口机制下,无需位置编码的Transformer仍可通过窗口演化模拟图灵完备的Post机器,从而具备通用计算能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12784 2026-05-15 cs.LG cs.NE q-bio.QM 70%

ToolMol: Evolutionary Agentic Framework for Multi-objective Drug Discovery

ToolMol:多目标药物发现的进化代理框架

Andrew Y. Zhou, Sharvaree Vadgama, Sumanth Varambally, Peter Eckmann, Michael K. Gilson, Rose Yu

机构 * Department of Computer Science(计算机科学系) Skaggs School of Pharmacy(斯卡格斯药学院) Department of Computer Science, Stanford University(斯坦福大学计算机科学系)

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.LG

AI总结 ToolMol结合多目标遗传算法与代理LLM操作符,通过迭代更新配体群体,实现多目标属性优化,发现具有更强预测结合亲和力的药物候选物。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10794 2026-05-12 cs.CR cs.AI 70%

Can You Keep a Secret? Involuntary Information Leakage in Language Model Writing

你能保密吗?语言模型写作中的非自愿信息泄露

Ari Holtzman, Peter West

机构 * University of Chicago(芝加哥大学) University of British Columbia(不列颠哥伦比亚大学)

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 研究测试语言模型能否隐瞒提示信息,发现五种前沿模型通过主题选择、意象和设定等主题泄露秘密词,泄露率高达79%,且模型主动隐藏时仍可被检测到。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18002 2026-04-21 cs.LG 70%

Neural Garbage Collection: Learning to Forget while Learning to Reason

神经垃圾回收:在学习推理的同时学习遗忘

Michael Y. Li, Jubayer Ibn Hamid, Emily B. Fox, Noah D. Goodman

机构 * Stanford University(斯坦福大学)

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.LG

AI总结 本文提出神经垃圾回收(NGC),通过端到端学习使语言模型在推理时自动管理内存,无需人工设计规则,实现内存压缩与效率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17319 2026-04-21 cs.CV cs.CL 70%

E2E-GMNER: End-to-End Generative Grounded Multimodal Named Entity Recognition

E2E-GMNER:端到端生成式 grounded 多模态命名实体识别

Meng Zhang, Jinzhong Ning, Xiaolong Wu, Hongfei Lin, Yijia Zhang

机构 * Dalian Maritime University(大连海事大学) Dalian University of Technology(大连理工大学)

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本文提出E2E-GMNER,通过端到端生成框架统一实体识别、语义类型预测和视觉定位,采用链式推理和GRBP提升鲁棒性,实验证明其在多模态命名实体识别任务中表现优异。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06627 2026-04-09 cs.CL 70%

DiffuMask: Diffusion Language Model for Token-level Prompt Pruning

DiffuMask: 用于令牌级提示压缩的扩散语言模型

Caleb Zheng, Jyotika Singh, Fang Tu, Weiyi Sun, Sujeeth Bharadwaj, Yassine Benajiba, Sujith Ravi, Eli Shlizerman, Dan Roth

机构 * University of Washington(华盛顿大学) Oracle AI(甲骨文人工智能)

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 DiffuMask通过迭代掩码预测实现快速并行提示压缩,保留关键推理上下文,实现80%的提示长度缩减,同时保持或提升准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29678 2026-04-02 cs.AI 70%

View-oriented Conversation Compiler for Agent Trace Analysis

面向视角的对话编译器用于代理轨迹分析

Lvmin Zhang, Maneesh Agrawala

机构 * Stanford University(斯坦福大学)

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出VCC编译器,将原始代理JSONL日志转换为结构化视角,提升轨迹分析质量,减少token消耗并提升模型性能。

Comments Code: https://github.com/lllyasviel/VCC

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18325 2026-03-20 cs.LG stat.ML 70%

Learning to Reason with Curriculum I: Provable Benefits of Autocurriculum

学习与课程学习:自课程学习的可证明收益

Nived Rajaraman, Audrey Huang, Miro Dudik, Robert Schapire, Dylan J. Foster, Akshay Krishnamurthy

机构 * Microsoft Research(微软研究院)

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.LG

AI总结 本文研究了自课程学习在提升语言模型推理能力方面的有效性,通过自适应数据选择技术,在监督微调和强化学习中分别减少了训练数据和计算成本。

Comments 39 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23184 2026-03-10 cs.CL 70%

PonderLM-2: Pretraining LLM with Latent Thoughts in Continuous Space

PonderLM-2: 在连续空间中通过潜在思想预训练语言模型

Boyi Zeng, He Li, Shixiang Song, Yixuan Wang, Zitong Wang, Ziwei He, Xinbing Wang, Zhouhan Lin

机构 * LUMIA Lab(LUMIA实验室) School of Artificial Intelligence(人工智能学院) Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院) Sun Yat-sen University(中山大学)

专题命中 其他推理 :chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 PonderLM-2通过在预训练过程中引入潜在思想的连续空间优化,提升了语言模型的生成能力与下游任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01250 2026-02-03 cs.CL 70%

GemDetox at TextDetox CLEF 2025: Enhancing a Massively Multilingual Model for Text Detoxification on Low-resource Languages

GemDetox在TextDetox CLEF 2025中的应用:增强大规模多语言模型以在低资源语言上进行文本去毒化

Trung Duc Anh Dang, Ferdinando Pio D'Elia

机构 * Centre for Language Technology, University of Copenhagen, Denmark(语言技术中心,哥本哈根大学,丹麦)

专题命中 其他推理 :chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 GemDetox在TextDetox CLEF 2025中通过参数高效微调和提示技术提升多语言文本去毒化性能,尤其在低资源语言上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09631 2026-01-26 cs.CL 70%

LLMs Got Rhythm? Hybrid Phonological Filtering for Greek Poetry Rhyme Detection and Generation

LLMs Got Rhythm? 希腊诗歌押韵检测与生成的混合语音过滤

Stergios Chatzikyriakidis, Anastasia Natsina

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本文提出混合语音学算法与LLMs结合,解决希腊诗歌押韵检测与生成问题,通过验证循环提升性能至73.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10058 2026-01-16 cs.LG 70%

Unlabeled Data Can Provably Enhance In-Context Learning of Transformers

未标记数据可以证明性地增强Transformer的上下文学习

Renpu Liu, Jing Yang

机构 * University of Virginia(弗吉尼亚大学)

专题命中 其他推理 :chain-of-thought(abstract);CoT(abstract);分类 cs.LG

AI总结 本文提出了一种增强ICL框架,通过结合标记和未标记数据,利用CoT提示使Transformer模拟EM算法,从而证明性地提升ICL性能。

Comments Published as a conference paper at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06416 2026-01-15 cs.AI cs.HC 70%

Advancing AI Negotiations: A Large-Scale Autonomous Negotiation Competition

推进人工智能谈判:大规模自主谈判竞赛

Michelle Vaccaro, Michael Caosun, Harang Ju, Sinan Aral, Jared R. Curhan

机构 * MIT Sloan School of Management(麻省理工学院斯隆管理学院) Johns Hopkins Carey Business School(约翰霍普金斯大学卡里商学院)

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文通过大规模自主谈判竞赛发现,温暖特质在AI谈判中表现优异,主导策略在价值争夺中有效,需建立新的AI谈判理论以优化代理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02983 2026-01-07 cs.SD cs.AI 70%

Interpretable All-Type Audio Deepfake Detection with Audio LLMs via Frequency-Time Reinforcement Learning

通过频率-时间强化学习实现可解释的多类型音频深度伪造检测

Yuankun Xie, Xiaoxuan Guo, Jiayi Zhou, Tao Wang, Jian Liu, Ruibo Fu, Xiaopeng Wang, Haonan Cheng, Long Ye

机构 * Communication University of China(中国通信大学) Machine Intelligence, Ant Group(蚂蚁集团机器智能部) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 其他推理 :chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 本文提出FT-GRPO方法,通过频率-时间强化学习实现多类型音频深度伪造检测的可解释性与高性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00923 2026-01-06 cs.AI 70%

Context Collapse: In-Context Learning and Model Collapse

上下文崩溃:上下文学习与模型崩溃

Josef Ott

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本研究探讨了大型语言模型中上下文学习与模型崩溃现象,通过数学分析揭示了上下文长度与模型稳定性之间的关系。

Comments Master's thesis

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10684 2026-01-05 cs.CL cs.CY 70%

SpiderGen: Towards Procedure Generation For Carbon Life Cycle Assessments with Generative AI

SpiderGen:面向碳生命周期评估的流程生成方法

Anupama Sitaraman, Bharathan Balaji, Yuvraj Agarwal

机构 * Amazon(亚马逊)

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 SpiderGen利用生成式AI生成碳生命周期评估的流程图,准确率达65%,显著降低评估成本和人力投入。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24347 2025-12-24 cs.CL eess.AS 70%

Fewer Hallucinations, More Verification: A Three-Stage LLM-Based Framework for ASR Error Correction

更少的幻觉,更多的验证:一种基于LLM的三阶段框架用于语音识别错误纠正

Yangui Fang, Baixu Chen, Jing Peng, Xu Li, Yu Xi, Chengwei Zhang, Guohui Zhong

机构 * Huazhong University of Science and Technology, School of Electronic Information and Communications(华中科技大学电子信息与通信学院) MoE Key Lab of Artificial Intelligence, AI Institute, X-LANCE Lab, Shanghai Jiao Tong University, Shanghai, China(人工智能联合实验室、AI研究院、X-LANCE实验室、上海交通大学) AISpeech Ltd, Suzhou, China(上海苏州AISpeech有限公司)

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本文提出一种基于LLM的三阶段框架,用于减少语音识别错误纠正中的幻觉问题,通过预检测、链式思维修正和推理验证提高纠正准确性。

Comments This paper has been ACCEPTED for publication in ASRU

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25510 2025-12-23 cs.LG cs.AR 70%

EEsizer: LLM-Based AI Agent for Sizing of Analog and Mixed Signal Circuit

EEsizer: 基于LLM的模拟和混合信号电路尺寸设计AI代理

Chang Liu, Danial Chitnis

机构 * The University of Edinburgh(爱丁堡大学) The School of Engineering(工程学院) Institute for Integrated Micro and Nano Systems(集成微纳系统研究所)

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.LG

AI总结 EEsizer是一种基于LLM的AI代理,通过整合大语言模型与电路仿真器和自定义数据分析功能,实现了模拟和混合信号电路尺寸设计的自动化,展示了在先进节点上的适应性和鲁棒性。

Journal ref IEEE Transactions on Circuits and Systems I: Regular Papers, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏