arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 18971 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 18971 篇

2608.08964 2026-08-11 cs.LG 新提交 83%

Math-Vision Diagrams: A Comprehensive Benchmark for Evaluating LLM Mathematical Diagram Generation Capabilities

数学视觉图表:评估大型语言模型数学图表生成能力的综合基准

Harish Kashyap, Kiran Byadarhaly, Sriram Chakaravarthy, Sanyukta Tuti, Aryan Mistry

机构 * Pandita AI Inc.(潘迪塔人工智能公司)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本研究推出首个专门评估LLMs数学图表生成能力的基准Math-Vision Diagrams,涵盖文本到代码与图像范式,测试发现LLMs在该任务上存在困难,相关资源将开源。

Comments Accepted at ICANN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00959 2026-08-11 cs.AI 版本更新 83%

Towards Understanding Modality Interaction in Multimodal Language Models via Partial Information Decomposition

通过部分信息分解理解多模态语言模型中的模态交互

Wanlong Fang, Tianle Zhang, Wen Tao, Alvin Chan

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.AI

AI总结 引入部分信息分解(PID)框架,分离感官和语言输入的独特、冗余和协同贡献,揭示多模态大模型中的模态使用模式,并扩展至三模态系统。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07796 2026-08-11 cs.CL 版本更新 83%

Thinking Is Not Telling: Information Disclosure in User-Service LLM Agents

思考使大语言模型代理变得内向:强制性思考在用户参与代理中的反效果

Jiatong Li, Changdae Oh, Hyeong Kyu Choi, Jindong Wang, Sharon Li

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.CL

AI总结 本文研究了强制性思考在用户参与代理中的反效果,发现其导致性能下降,而主动透明性可提升代理性能。

Comments 26 pages, 5 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07261 2026-08-10 cs.CL 新提交 83%

Why Knowing Both Hops Is Not Enough: Understanding Two-Hop Generalization in Language Models

仅知道两跳信息是不够:理解语言模型中的两跳泛化

Zili Zhang, Yilin Wang, Heng Wang, Herun Wan, Minnan Luo

机构 * Xi’an Jiaotong University(西安交通大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 本研究针对语言模型两跳查询失败问题,在受控环境训练Transformer,揭示其泛化规律与跨层不匹配机制,提出循环式训练策略以提升分布外两跳泛化能力。

Comments 24 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05097 2026-08-06 cs.CL 新提交 83%

Same Formulas, Different Semantics: Do Language Models Follow Modal Logic Specifications?

相同公式,不同语义:语言模型是否遵循模态逻辑规范?

Réemi Andrieu, Damien Sileo

机构 * Univ. Lille(里尔大学) Inria(法国国家信息与自动化研究所) CNRS(法国国家科学研究中心) Centrale Lille(里尔中央理工学院) UMR 9189 - CRIStAL(UMR 9189 - CRIStAL(法国国家科研中心联合研究机构))

专题命中 推理与问题求解 :language model(title,abstract);prompting(abstract);分类 cs.CL

AI总结 该研究探究语言模型是否遵循模态逻辑规范,构建成对模态问题测试五款模型,发现遵循规定模态语义依赖推理模式与模型身份,发布相关产物。

Comments 9 pages. Code: https://github.com/sileod/modal-semantics-reasoning. Data and artifacts: https://huggingface.co/datasets/sileod/modal-semantics-reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04719 2026-08-06 cs.AI 新提交 83%

Diagnosing Tool-Selection Reasoning in LLM Agents with Canary Tools

用金丝雀工具诊断大语言模型智能体的工具选择推理

Atul Anand, Sourav Chattaraj

专题命中 推理与问题求解 :LLM(title,summary_cn);分类 cs.AI

AI总结 本研究引入金丝雀工具诊断LLM智能体的工具选择推理,通过多维度分类法评估8个模型,发现模型能力提升会降低易感性,分类法具能力分层性,且发布了相关框架与数据。

Comments 10 pages, 9 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00014 2026-08-04 cs.AI 新提交 83%

CoT-Core: Accelerating LLM Evaluation via CoT-Aware Coreset Selection

CoT-Core:通过感知思维链的核心集选择加速大语言模型评估

Qihua Pan, Zhenheng Tang, Peijie Dong, Xiang Liu, Huacan Wang, Bo Li, Xiaowen Chu

机构 * Nanjing University(南京大学) The Hong Kong University of Science and Technology(香港科技大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 CoT-Core是无训练的核心问题选择框架,通过感知大语言模型的思维链推理轨迹聚类问题,可大幅降低LLMs评估成本,且在GSM8K等多数据集上维持高保真度分数估计。

Comments 23 pages, 3 figures, 10 tables. Includes appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17999 2026-08-04 cs.AI cs.CV 版本更新 83%

Do Maps Still Matter for Machines: Revisiting the Role of Choropleth Maps in Foundation Model Spatial Understanding

地图对机器来说仍然重要吗:重新审视分级统计图在基础模型空间理解中的作用

Zhiwei Wei, Yonghe Sun, Zhenjia Liu, Wenjia Xu, Chao He, Weihua Dong, Chunbo Liu, Hua Liao

专题命中 推理与问题求解 :foundation model(title,abstract);prompting(abstract);分类 cs.AI

AI总结 研究探讨分级统计图对基础模型空间理解的作用,引入ChoroplethMap-Bench基准,在三种输入条件下评估22个模型,发现地图能显著提升空间推理,尤其结合符号数据及高层次空间模式理解任务时,证明地图是基础模型空间推理的重要外部表示。

Comments 34 pages, 4 figures, and 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15776 2026-08-03 cs.AI 版本更新 83%

NeurOWL: An LLM-Based Neural-symbolic Framework for Incomplete OWL Ontology Reasoning

NeurOWL:基于大语言模型的神经符号框架用于不完整OWL本体推理

Hui Yang, Jiaoyan Chen, Yiping Song, Renate Schmidt, Wen Zhang

机构 * The University of Manchester(曼彻斯特大学) Zhejiang University(浙江大学)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究不完整OWL本体的包含关系推理问题,提出NeurOWL框架,通过大语言模型和本体嵌入联合执行验证和溯因,利用形式与文本语义,在多领域真实本体上评估,展现强大稳健性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01982 2026-08-03 cs.CV cs.AI q-bio.BM 版本更新 83%

MolSight: A Graph-Aware Vision-Language Model for Unified Chemical Image Understanding

MolSight: 一种用于统一化学图像理解的图感知视觉语言模型

Wenda Wang, Yihan Tong, Yuwei Hu, Xuchen Pan, Zhewei Wei, Yaliang Li, Bolin Ding

机构 * Renmin University of China(中国人民大学)

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.AI

AI总结 提出MolSight框架,通过分子拓扑模块和分子接地模块增强视觉语言模型对分子图像的结构理解,在多项化学视觉理解任务中显著优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27304 2026-07-31 cs.LG cs.CV 新提交 83%

Position, Not Provenance: Separating Reasoning Mediation from Sycophancy in Medical Vision-Language Models

位置,而非来源:在医学视觉-语言模型中分离推理中介与逢迎行为

Supratik Bhowal, Subhrajyoti Basu, Aritra Gir Mahanta, Anik Pal Chowdhury

机构 * IEM Kolkata(印度工程管理学院 Kolkata校区) School of UEMK Kolkata(UEMK Kolkata学院) Heritage Institute of Technology Kolkata(加尔各答遗产技术学院) Indian Institute of Information Technology, Kalyani(卡利亚尼印度信息技术学院)

专题命中 推理与问题求解 :language model(title,abstract);prompting(abstract);分类 cs.LG

AI总结 本研究提出CoT-Mediate框架,结合双臂协议与来源控制干预,在VQA-RAD数据集上评估LLaVA-Med和MedGemma,发现上下文位置而非声明来源是医学VLMs使用生成推理的主要决定因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26160 2026-07-30 cs.AI 新提交 83%

GuideSkill: Evolving Executable LLM Agent Skills for Guideline-Grounded Clinical Reasoning

GuideSkill:面向基于指南的临床推理的可执行大语言模型智能体技能演化框架

Lang Cao, Yuhao Shen, Tianyang Luo, Simo Du, Hao Peng, Yue Guo

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.AI

AI总结 本文提出与模型无关的GuideSkill框架,通过可执行技能结合指南流程与病例诊断模式,在多基准和骨干模型上显著提升临床推理性能,技能可靠且实用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03881 2026-07-29 cs.CY cs.AI cs.HC 版本更新 83%

LLM-generated personalized nudges for improving pro-environmental behavior: Field evidence from resource conservation

利用大型语言模型的迭代个性化增强行为提示:一项关于电力和热水节约的实地实验

Zonghan Li, Yi Liu, Chunyan Wang, Song Tong, Kaiping Peng, Feng Ji

机构 * School of Environment, Tsinghua University(清华大学环境学院) Department of Applied Psychology and Human Development, University of Toronto(多伦多大学应用心理学与人类发展系) State Key Laboratory of Regional Environment and Sustainability, Tsinghua University(清华大学区域环境与可持续性国家重点实验室) Department of Psychology, Beijing Normal University at Zhuhai(北京师范大学珠海校区心理学系) Department of Psychology and Cognitive Sciences, Tsinghua University(清华大学心理学与认知科学系)

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.AI

AI总结 本研究利用大型语言模型实现迭代个性化,通过实地实验发现其在促进节能方面效果显著,且在前两轮干预中表现更优,但热水节约效果较弱且随时间减弱。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21933 2026-07-27 cs.AI 新提交 83%

Semiotic logical hexagon theory for LLM logical reasoning

用于大语言模型逻辑推理的符号逻辑六边形理论

Yunyao Zhang, Xinglang Zhang, Zeliang Chen, Junqing Yu, Zikai Song

机构 * Huazhong University of Science and Technology(华中科技大学)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究大语言模型逻辑推理中语义组织的影响,提出HexLogicAgent框架,先组织自然语言含义再结构化验证推理。发现不完整语义表示是推理失败主因,建模语义对立结构可延迟性能下降,实验证明该框架能提高推理可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21558 2026-07-24 cs.AI 新提交 83%

Beyond Sycophancy: Structured Resistance and Compliance in LLM Moral Reasoning

超越谄媚:大语言模型道德推理中的结构化抵抗与顺从

Baihui Wang, Bernard Koch

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究大语言模型道德推理中超越谄媚的结构化抵抗与顺从,通过三项研究揭示其判断修正沿与人类社会心理学现象平行的三个维度结构化,为区分建设性信念修正与谄媚顺从提供原则基础,助力道德交互更好对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21550 2026-07-24 cs.LG 新提交 83%

X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment

X³-OPD:通过策略对齐将推理能力提炼到大型音频-语言模型中

Dongjie Fu, Di Cao, Xize Cheng, Zihan Zhang, Wenxu Jia, Yifu Chen, Shengpeng Ji, Yu Zhang, Tao Jin

机构 * Tencent Hunyuan(腾讯混元) Zhejiang University(浙江大学)

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.LG

AI总结 针对大型音频-语言模型逻辑推理能力不足,提出X³-OPD跨模态策略蒸馏框架,借助教师模型指导与构建的三层对称语料库训练学生模型,实验证明该方法能提升音频推理及思维链质量,还能保留模型域转移下的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18249 2026-07-22 q-bio.QM cs.AI 新提交 83%

MechAInistic: An LLM-guided Multi-Agent System for Reasoning over Genome-Scale Constraint-Based Metabolic Models

MechAInistic:一种由大语言模型引导的多智能体系统,用于基于基因组规模的约束代谢模型进行推理

Josh Loecker, Narayna Puraja, William Bryan, Bhanwar Lal Puniya, Ahmed Abdeen Hamed, Tomáš Helikar

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究旨在降低基于约束的代谢建模使用门槛,开发了MechAInistic多智能体系统,借助大语言模型,围绕特定模式将自然语言问题转化为可执行工作流程,通过两个免疫细胞代谢模型用例验证,能生成可追溯的治疗假设。

Comments 23 pages, 6 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12815 2026-07-21 cs.AI 版本更新 83%

Visual Access Boundaries in Vision-Language Model Reasoning

视觉语言模型推理中的视觉访问边界

Hiroto Osaka, Shohei Taniguchi, Gouki Minegishi, Kai Yamashita, Masahiro Suzuki, Yutaka Matsuo

机构 * The University of Tokyo(东京大学)

专题命中 推理与问题求解 :language model(title,abstract);prompting(abstract);分类 cs.AI

AI总结 研究视觉语言模型推理中CoT提示扩展的内容,通过视觉访问扫描定义VAB,发现CoT不主要靠延长图像令牌访问提效,而是扩展语言侧计算,且CoT收益受感知读出限制,瓶颈在读出非计数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15277 2026-07-17 cs.CL 新提交 83%

Partition, Prompt, Aggregate: Statistical Self-Consistency in Language Models

划分、提示、聚合:语言模型中的统计自一致性

Patrik Wolf, Thomas Kleine Buening, Andreas Krause, Celestine Mendler-Dünner

专题命中 推理与问题求解 :language model(title);LLM(abstract);prompting(abstract);分类 cs.CL

AI总结 研究语言模型估计是否遵循自一致性原则,用二叉树划分总体,以子总体描述提示模型并聚合结果,发现广泛违反一致性,揭示宏观谬误模式,表明模型虽有子总体知识但未有效用于总体估计,建立了评估语言模型的新准则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14753 2026-07-17 cs.SD cs.AI 新提交 83%

Large Audio Language Models for Spoofing-Aware Speaker Verification

用于防欺骗语音识别的大型音频语言模型

Sofya Savelyeva, Mariia Perunova, Evgeny Kushnir, Artem Dvirniak, Dmitrii Korzh, Oleg Y. Rogov

机构 * Applied AI Institute(应用人工智能研究所) MIRAI(未来人工智能研究机构) HSE(高等经济学院) MTUCI(莫斯科国立通信与信息技术大学)

专题命中 推理与问题求解 :language model(title,abstract);prompting(abstract);分类 cs.AI

AI总结 研究用于防欺骗语音识别的大型音频语言模型,通过零样本提示等多种方式进行系统评估,发现预训练模型零样本时不佳,特定任务适应可改善,还找到多种实现竞争力性能的途径,为统一防欺骗语音识别提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23276 2026-07-15 cs.LG cs.MA 版本更新 83%

Auditable Context-Aware HFMD Forecasting with Structured LLM Agents

基于结构化大语言模型代理的可审计上下文感知手足口病预测

Joongwon Chae, Runming Wang, Chen Xiong, Gong Yunhan, Lian Zhang, Ji Jiansong, Dongmei Yu, Peiwu Qin

机构 * Institute of Biomedicine and Health Engineering, Tsinghua Shenzhen International Graduate School (SIGS), Tsinghua University, Shenzhen, China(清华大学深圳国际研究生院生物医学与健康工程学院) The Fifth Affiliated Hospital of Wenzhou Medical University, Lishui 323000, China(温州医科大学第五附属医院) Hengqin Laboratory, Zhuhai, China(横琴实验室) The First Hospital of Hebei Medical University, Shijiazhuang, China(河北医科大学第一医院)

专题命中 推理与问题求解 :LLM(title,abstract);foundation model(abstract);分类 cs.LG

AI总结 研究针对手足口病预测,提出双代理神经符号框架,由基于大语言模型的事件解释器和预测生成器组成,通过摄取异构信号并结合历史病例数进行预测,在两个数据集评估中实现有竞争力的点准确性、可靠区间及可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16728 2026-07-14 cs.LG 版本更新 83%

The Cost of Reasoning: Chain-of-Thought Induces Overconfidence in Vision-Language Models

推理的成本:链式推理诱导视觉-语言模型的过度自信

Robert Welch, Emir Konuk, Kevin Smith

机构 * KTH Royal Institute of Technology, Stockholm, Sweden(皇家理工学院) Science for Life Laboratory, Stockholm, Sweden(生命科学实验室)

专题命中 推理与问题求解 :language model(title,abstract);prompting(abstract);分类 cs.LG

AI总结 研究发现链式推理会降低视觉-语言模型的不确定性估计质量,主要机制是隐式答案条件化,导致模型过度自信。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04673 2026-07-14 cs.AI 版本更新 83%

Trojan Horse Prompting: Jailbreaking Conversational Multimodal Models by Forging Assistant Message

木马提示:通过伪造助手消息来破解对话式多模态模型

Wei Duan, Li Qian

专题命中 推理与问题求解 :prompting(title,abstract);LLM(abstract);分类 cs.AI

AI总结 研究针对对话式多模态模型的安全漏洞,提出木马提示越狱技术,通过伪造对话历史绕过安全机制,在谷歌Gemini-2.0上实验显示其攻击成功率高于现有方法,揭示对话AI安全缺陷,呼吁转变验证范式。

Comments We stopped working on this idea because we realized that there was a paper submitted before it that took almost identical approach

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06757 2026-07-09 cs.AI cs.MA 新提交 83%

LLM-powered reasoning in agent-based modeling

基于代理建模中的大语言模型驱动推理

Sifat Afroj Moon, Dakotah Maguire, Adam Spannaus, Joe Tuccillo, Maksudul Alam, Sudip K. Seal, John Gounley, Heidi Hanson

机构 * ORNL(橡树岭国家实验室)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对传统基于代理建模(ABM)依赖静态先验无法适应实时变化的问题,提出利用大语言模型(LLMs)的可扩展混合代理和语言驱动的流行病(HALE)建模框架,并通过模拟COVID-19验证其可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30170 2026-07-09 cs.MM cs.CV cs.LG 版本更新 83%

Unveiling the Visual Counting Bottleneck in Vision-Language Models

揭示视觉语言模型中的视觉计数瓶颈

Xingzhou Pang, Yifan Hou, Junling Wang, Mrinmaya Sachan

机构 * Department of Computer Science, ETH Zürich(苏黎世联邦理工学院计算机科学系)

专题命中 推理与问题求解 :language model(title,abstract);foundation model(abstract);分类 cs.LG

AI总结 通过分解视觉计数为三个认知阶段,发现视觉语言模型在符号映射阶段失败,提出断裂数量假说:模型学习到分离的模态特定统计流形,无法实现跨模态对齐。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18784 2026-07-09 cs.AI 版本更新 83%

Successor-Generator Planning with LLM-generated Heuristics

基于大语言模型生成启发式策略的后继生成器规划

Alexander Tuisov, Yonatan Vernik, Alexander Shleyfman

机构 * Computer Science Department, Bar-Ilan University(巴伊兰大学计算机科学系)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究借助大语言模型,从规划任务中生成特定问题启发式函数并集成到搜索算法。该方法在多规划基准测试中性能优异,还能解决传统形式难表达的问题,经评估展现出有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04394 2026-07-07 cs.AI cs.SC 新提交 83%

MechMath Agent Team: LLM Driven Agents for Mathematical Research

机械数学智能体团队:用于数学研究的大语言模型驱动智能体

Yichuan Cao, Ruichen Qiu, Junqi Liu, Jiaqi Wang, Dakai Guo, Ruyong Feng, Lihong Zhi, Xiao-Shan Gao

机构 * State Key Laboratory of Mathematical Sciences, Academy of Mathematics and Systems Science, CAS(中国科学院数学与系统科学研究院数学科学国家重点实验室) School of Mathematical Sciences, University of Chinese Academy of Sciences(中国科学院大学数学科学学院) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学高等研究院)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对数学研究给现有推理系统带来的挑战,提出机械数学智能体团队,设计三方架构,实例化三个专业智能体,闭环协作生成形式化认证的数学证明,经评估可在研究全周期辅助,有通用架构、系统实例及实证验证三大贡献。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02873 2026-07-07 cs.SE cs.AI cs.CR 新提交 83%

Determinants and Limits of LLM Security-Tool Orchestration: A Study with HexStrike-AI

大语言模型安全工具编排的决定因素与限制:基于HexStrike-AI的研究

Romain Gerard, Assmaa Zeghaider, Yan Guo

机构 * University of Science and Technology of China(中国科学技术大学) Suzhou Institute for Advanced Research(苏州研究院)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 以HexStrikeAI为测试平台,通过评估系统、诊断故障并改进,运行多类挑战,发现驱动客户端是固定模型的首要因素,整体解决率提升,剩余故障受推理或环境限制,还讨论了编排器评估及局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23844 2026-07-07 cs.CL 版本更新 83%

Language Models as Higher-Order Planning Formalizers

语言模型规划器无法扩展,但形式化器可以吗?

Owen Jiang, Cassie Huang, Ashish Sabharwal, Li Zhang

机构 * Drexel University(德雷克斯el大学) Allen Institute for AI(人工智能研究院)

专题命中 推理与问题求解 :language model(title);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 研究发现语言模型形式化器在规划问题中表现优于规划器,通过分治技术提升鲁棒性,并引入形式化挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13517 2026-07-07 cs.CL 版本更新 83%

Think Deep, Not Just Long: Measuring LLM Reasoning Effort via Deep-Thinking Tokens

深入思考,而非仅靠长度:通过深度思考令牌测量大语言模型推理工作量

Wei-Lin Chen, Liqian Peng, Tian Tan, Chao Zhao, Blake JianHang Chen, Ziqian Lin, Alec Go, Yu Meng

机构 * University of Virginia(弗吉尼亚大学) Google(谷歌)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究通过识别深度思考令牌量化推理时间工作量,在多个基准和模型上验证深度思考比例与准确率正相关,据此引入Think@n策略提升推理效率并降低成本。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏