The Effect of Scripts and Formats on LLM Numeracy
脚本和格式对LLM数理能力的影响
专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 研究探讨了不同数字脚本和格式对LLM数理能力的影响,发现当输入使用不常见脚本或格式时,LLM准确性显著下降,但通过提示策略可缩小差距。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
脚本和格式对LLM数理能力的影响
专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 研究探讨了不同数字脚本和格式对LLM数理能力的影响,发现当输入使用不常见脚本或格式时,LLM准确性显著下降,但通过提示策略可缩小差距。
自我污名并非单一概念,但通用共情是:面向吸毒者的人物条件化LLM支持
机构 * Department of Information Science(信息科学系)
专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL
AI总结 针对吸毒者自我污名表达异质性问题,提出基于潜在剖面分析的四人物类型学,并用序列贝叶斯和循环神经网络从有限发帖历史中恢复人物类型,发现人物匹配响应虽能实现行为转变,但临床专家更偏好通用共情。
学习精炼隐藏状态以实现可靠的LLM推理
机构 * Tongyu0924
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 提出ReLAR框架,通过强化学习引导的潜在状态精炼,自适应调整推理步数和方向,提升复杂多步推理的准确性和稳定性,降低推理开销。
Comments Code is available at tongyu0924/Learning-to-Refine-Hidden-States
上下文模型预测生成:从语言模型到物理的开放词汇运动合成
机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) ; Department of Networked Intelligence, Peng Cheng Laboratory(鹏城实验室网络智能部) ; School of Computer Science and Engineering, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)计算机科学与工程学院)
专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.AI
AI总结 提出ICMPG框架,结合语言模型规划与推理时物理反馈,通过上下文感知运动生成和模型预测生成模块实现语义忠实且物理合理的开放词汇运动合成。
MINIF2F-DAFNY: 通过自动主动验证的LLM引导数学定理证明
机构 * University of Cambridge, Cambridge, UK(剑桥大学) ; Amazon Web Services, London, UK(亚马逊网络服务(伦敦)) ; Amazon Web Services, Boston, USA(亚马逊网络服务(波士顿))
专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.LG
AI总结 提出首个将数学基准miniF2F翻译到自动主动验证器Dafny的数据集,评估8个LLM的证明生成能力,最佳模型Claude Opus 4.6达到62.7%的累积通过率,比空证明基线提升23.8个百分点。
超越Logprobs:基于LLM的文档字段提取的多信号置信度引擎
机构 * Perfios Software Solutions Pvt. Ltd.(Perfios软件解决方案私人有限公司)
专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL
AI总结 提出ExtractConf,通过双视角文档解析(字段引导与文档引导)的不一致性,融合多信号实现高可靠置信度估计,在DocILE上AUC达0.928,准确率99.1%。
Comments Extended version of a paper accepted (Oral) at the RobustifAI Workshop, IJCAI-ECAI 2026, Bremen, Germany. 9 pages, 5 figures, 2 tables
RL提升LLM推理能力的关键更新因素是什么?
机构 * School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院) ; Microsoft Research(微软研究院) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 通过理论分析RLVR更新,发现离策略程度影响重要性采样比率分布和裁剪行为,提出自适应裁剪策略优化(ACPO),在多种推理基准上优于DAPO和CISPO。
评估基于大语言模型的议会辩论总结的论证内容
机构 * School of Computer Science, University College Dublin(都柏林大学计算机科学学院) ; School of Politics and International Relations, University College Dublin(都柏林大学政治与国际关系学院) ; Department of Informatics, King’s College London(伦敦国王学院信息学院)
专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 本文提出一种评估议会辩论总结的框架,通过计算论证方法评估总结对辩论论证内容的忠实性,以欧洲议会辩论为例验证方法有效性。
Comments Accepted at KR'26 In The Wild Track. Camera Ready with additional supplementary materials
形式化并缓解大语言模型注意力中的结构失真以实现零样本图推理
机构 * University of Michigan(密歇根大学) ; Amazon(亚马逊)
专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 本文形式化了大语言模型处理文本属性图时因图线性化导致的结构失真机制,并提出轻量级推理时修改方法GaLA,通过校正注意力偏差提升零样本图推理性能。
Comments Accepted to KDD 2026
解锁大语言模型代码修正的迭代反馈循环
机构 * Iowa State University(爱荷华州立大学)
专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 研究通过执行反馈迭代修正代码的能力,提出评估指标并分析推理与非推理模型在利用反馈上的差异,发现推理模型显著优于非推理模型,且语法和运行时错误比逻辑错误更易修正。
Comments 22 pages, 14th Computing Conference 2026
超越标量:通过几何进展和稳定性评估与理解LLM推理
专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.AI
AI总结 提出TRACED框架,利用几何运动学将推理轨迹分解为进展和稳定性,揭示正确推理与幻觉的拓扑差异,实现鲁棒的推理质量评估。
Comments Accepted by ICML2026
MARS: 用于并行LLM测试时扩展的边际对抗风险控制停止策略
机构 * Amazon(亚马逊) ; Stanford University(斯坦福大学) ; University of Pennsylvania(宾夕法尼亚大学)
专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.AI
AI总结 提出MARS停止规则,通过监测中间检查点的聚合投票并利用对抗性边界估计未来投票变化,在保证准确率的同时节省25-47%的自一致性token。
GPO:从关键步骤中学习以改进大语言模型推理
机构 * Department of Computer Science Northwestern University(计算机科学系西北大学) ; AI Foundations Capital One(人工智能基础资本 one) ; Meta AI
专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 提出引导式关键优化(GPO)微调策略,通过识别推理轨迹中的关键步骤并优先学习,显著提升大语言模型的多步推理能力。
Comments 39th Conference on Neural Information Processing Systems (NeurIPS 2025)
PAEC:面向RLVR中LLM推理的位置感知熵校准
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) ; Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) ; School of Computer Science and Technology, University of Chinese Academy of Sciences(中国科学院大学计算机科学与技术学院)
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 提出位置感知熵校准(PAEC),通过局部top-p熵和top-2候选竞争构建软掩码,并施加基于锚点的下界惩罚,防止决策相关位置熵崩溃,提升数学推理性能。
Comments 22 pages, 7 figures
三思而后行:基于意图引导推理的LLM位置预测
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Shanghai Jiao Tong University(上海交通大学) ; The Hong Kong University of Science and Technology(香港科技大学) ; Fudan University(复旦大学) ; Shanghai Innovation Institute(上海创新研究院)
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 提出IntentPOI框架,通过两阶段意图引导推理(先推断用户出行意图,再基于意图选择POI),将位置预测从直接轨迹匹配转化为意图推理,在三个真实数据集上超越11个基线。
从正确性到效用:基于增益的LLM推理前缀评估
机构 * Fudan University(复旦大学) ; Shanghai Innovation Institute(上海创新研究院)
专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL
AI总结 提出前缀增益概念,训练前缀效用模型(PUM)通过成对排序目标评估推理前缀对成功率的提升,在数学推理任务中优于传统正确性评估。
何时深度思考:用于LLM推理的抑制性深思
机构 * University of Birmingham, United Kingdom(英国伯明翰大学)
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 提出IDPR框架,通过抑制控制器根据快速答案决定是否启动慢速推理,在数学推理测试集上仅调用8.20%的慢速推理,准确率从47.90%提升至48.92%。
不要让大语言模型读图:让图思考
机构 * Mindoverflow ; University of Waterloo(多伦多大学) ; Carnegie Mellon University(卡内基梅隆大学) ; Foothill College(foothill学院) ; Purdue University(普渡大学) ; University of Wisconsin(威斯康星大学) ; Apple(苹果公司)
专题命中 推理与问题求解 :LLM(title,summary_cn);分类 cs.AI
AI总结 通过3000多次对照实验,研究显式信念图在合作多智能体推理中是否提升LLM性能,发现集成架构决定图的价值,识别出“规划者违抗”现象,并证明图深度收益递减。
Comments main body has 9 pages, 4 figures, under review for COLM 2026 conference
认知异质性动力学:基于大语言模型模拟的多阶段供应链中行为偏差研究
机构 * Harbin Institute of Technology(哈尔滨工业大学) ; The Hong Kong Polytechnic University(香港理工大学)
专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文通过引入大语言模型模拟多阶段供应链,基于分层推理框架分析认知异质性对智能体交互的影响,发现信息共享可缓解短视和自利行为导致的系统效率低下。
Comments Accepted to the Main Conference of ACL 2026. 18 pages, 8 figures in total (9 pages, 7 figures for the main text)
结构线索能否拯救LLM?评估大规模文档流中的语言模型
机构 * Boston University(波士顿大学) ; Korea University(韩国大学)
专题命中 推理与问题求解 :language model(title,abstract);LLM(title_cn,abstract_cn);分类 cs.CL
AI总结 本文提出StreamBench基准,通过主题聚类、时序问答和摘要任务评估语言模型在混合多事件的文档流中的表现,发现结构线索能提升聚类和时序QA性能,但时序推理仍是挑战。
Comments KDD 2026
基于动态信任感知的稀疏通信拓扑用于基于LLM的多智能体共识
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 提出DySCo动态稀疏共识机制,通过信任感知的边选择降低通信开销并保持共识质量。
Comments 11 pages, 3 figures, 5 tables
并非所有翻转都是顺从:多智能体LLM辩论中的立场趋同分解
机构 * Beijing Institute of Technology(北京理工大学) ; University of Osaka(大阪大学) ; Shenzhen University(深圳大学)
专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL
AI总结 通过三源分解框架,将多智能体辩论中的答案趋同分解为自发不稳定性、立场诱导的从众和推理诱导的说服,并揭示从众主要是有害的,可通过干预降低。
将语言模型与基于物理的模拟相结合用于无机材料的合成
机构 * Johns Hopkins Applied Physics Laboratory(约翰霍普金斯应用物理实验室) ; Johns Hopkins University(约翰霍普金斯大学)
专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.AI
AI总结 提出一种结合热力学数据库与简化动力学模型的混合框架,评估大语言模型在无机材料合成规划中的表现,以铌氧体系为例证明其能生成更可行的合成策略。
Comments Accepted to the AI for Accelerated Materials Design (AI4Mat) Workshop at Neurips 2025
前沿大语言模型在空间意象推理中的局限性
机构 * Institute of Mathematics and Statistics – University of São Paulo(数学统计研究所 – 圣保罗大学)
专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本研究通过引入外部“意象模块”辅助3D模型旋转任务,发现即使外包整体3D状态维护,前沿模型仍缺乏基础视觉空间原语,导致准确率最高仅62.5%。
Comments 25 pages. v2: Title updated; added a section on object/spatial imagery and propositional reasoning; added new experimental results for the single-object rotation probe
GRUFF:德语中LLM的代词忠实度、推理与偏见
机构 * JobMatchMe GmbH(JobMatchMe公司) ; Trustworthy AI Lab(可信人工智能实验室) ; Heidelberg Institute for Theoretical Studies(海德堡理论研究所)
专题命中 推理与问题求解 :LLM(title,title_cn);language model(abstract);分类 cs.CL
AI总结 通过构建大规模德语数据集GRUFF,研究大型语言模型在四种性别一致系统与四组代词上的代词忠实度,发现模型在无显式上下文时对阳性和阴性实体表现出强语法一致,但对新代词xier和en较弱,且职业刻板印象在不同语法格和模型间相关性低。
HEART-Bench: 大语言模型智能体是否表现出类似人类的心理学?
机构 * Shanghai Jiao Tong University(上海交通大学) ; Imperial College London(伦敦帝国理工学院) ; Quwan Group(启元集团) ; University of Washington(华盛顿大学) ; South China Normal University(华南师范大学)
专题命中 推理与问题求解 :LLM(title,summary_cn);分类 cs.CL
AI总结 提出HEART-Bench基准,通过构建基于大五人格和自传体记忆的虚拟角色,在DIAMONDS情境框架下评估LLM智能体能否展现一致的人类心理特征。
Comments GitHub: https://github.com/peng-weihan/HEART-BENCH
原地反馈:多轮专家-LLM协作的可靠精炼方法
机构 * Graduate School of Artificial Intelligence, POSTECH(POSTECH人工智能研究生院) ; Department of Computer Science and Engineering, POSTECH(POSTECH计算机科学与工程系)
专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.LG
AI总结 提出原地反馈交互范式,通过用户直接编辑模型先前响应并让模型从编辑上下文继续生成,在五个推理密集型基准上优于标准多轮反馈且更省token,用户研究证实其能提高最终输出满意度并降低疲劳。
Comments 42pages
通过标准化威胁狩猎评估LLM辅助蓝队
机构 * State University of New York at Binghamton(纽约州立大学布ingham顿分校) ; University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) ; Duke University(杜克大学)
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文提出CyberTeam基准,通过构建标准化工作流和模块化操作步骤,评估大语言模型在蓝队威胁狩猎中的有效性,并揭示标准化设计带来的改进与开放式推理的局限性。
Comments ICML'26
Formula-One Prompting:一种可组合的方程优先前缀用于应用数学
机构 * SCB DataX, SCBX Group(SCB数据X,SCBX集团)
专题命中 推理与问题求解 :prompting(title,title_cn);pretraining(abstract);分类 cs.CL
AI总结 提出公式提示(FP)和Formula-One提示(F-1),通过先形式化问题中的控制方程再求解,在多个应用数学基准上优于思维链和程序思维提示,平均提升5.76和8.42个百分点。
面向CUDA内核生成中自进化LLM代理的反馈到计划决策
机构 * Department of Computer Science and Technology, Tsinghua University, Beijing, China(清华大学计算机科学与技术系) ; Beijing National Research Center for Information Science and Technology, Beijing, China(北京信息科学国家研究中心)
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 通过轨迹冻结和选择性反馈注入,提出CUDAnalyst框架以归因规划决策对反馈组件的贡献,揭示显式规划仅在反馈对齐时有效,且有效规划源于结构化多反馈交互。
Comments ICML 2026 accpeted, camera-ready in progress