Meta Prompting for AI Systems
为AI系统引入元提示
专题命中 推理与问题求解 :prompting(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 通过元提示框架提升大语言模型的推理能力,实现高效的问题解决与自我优化。
Comments Project Page: https://github.com/meta-prompting/meta-prompting
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
为AI系统引入元提示
专题命中 推理与问题求解 :prompting(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 通过元提示框架提升大语言模型的推理能力,实现高效的问题解决与自我优化。
Comments Project Page: https://github.com/meta-prompting/meta-prompting
对人格引导对大语言模型能力影响的系统分析
机构 * School of Computer Science and Engineering, Northeastern University, Shenyang 110819, China(东北大学计算机科学与工程学院,沈阳 110819,中国) ; School of Computing and Information Systems, Singapore Management University, Singapore 178902, Singapore(新加坡管理大学计算机与信息系统学院,新加坡 178902,新加坡) ; School of Computer and Communication Engineering, Northeastern University, Qinhuangdao 066004, China(东北大学计算机与通信工程学院,秦皇岛 066004,中国)
专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本文通过NPTI框架诱导大模型五种人格特质,发现人格引导对认知任务性能有稳定影响,且不同特质对任务表现有不同影响,提出动态人格路由策略提升性能。
Journal ref Chen, J., Wang, M., Xie, T., Feng, S., & Liu, Y. (2026). A Systematic Analysis of the Impact of Persona Steering on LLM Capabilities. Proceedings of the Annual Meeting of the Cognitive Science Society, 48
专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)
Comments ICLR 2024 Workshop on Reliable and Responsible Foundation Models
超越事实知识:大型语言模型中步骤级过程规则推理的基准测试与学习
机构 * University of Chinese Academy of Sciences(中国科学院大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Academy of Mathematics and Systems Science, Chinese Academy of Sciences(中国科学院数学与系统科学研究院)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL
AI总结 本研究针对大型语言模型的过程规则推理不足,构建RuleWorld基准,提出DynaRule框架,在10K规则下将平均QA准确率提19个点,Recall@1超85%,大幅优于基线。
Comments Accepted by EMNLP 2026 Findings
大语言模型能否实现“超线程”?
机构 * Alibaba Group(阿里巴巴集团)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL
AI总结 该研究提出模型超线程假说,设计三种条件评估并行功能加载等,在 AIME 2025 开发集上获最高准确率,为超线程假说提供初步证据,推动推理扩展视角转变。
Comments 12 pages
AdaR:为大语言模型(LLM)配备自适应推理能力的框架
机构 * Nanjing University(南京大学) ; Meituan Inc.(美团公司)
专题命中 推理与问题求解 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 针对现有LLM数学推理的鲁棒性与泛化性缺陷,本文提出AdaR框架,通过RLVR训练及数据质量保障方法,有效提升了LLM数学推理能力并缓解了相关缺陷。
面向多模态大语言模型的符合规则的视觉空间规划
机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机研究所) ; Yinwang Intelligent Technology Co., Ltd(银湾智能科技有限公司)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI
AI总结 该研究针对多模态大语言模型的规则遵循空间规划问题,构建了RuleMaze基准,提出语言-逻辑-函数混合方法和解耦多模态规划(DMP),提升了规则遵循度与规划成功率。
评估评估者:面向大语言模型推理的验证自主等级(L0-L5)
专题命中 推理与问题求解 :LLM(title,abstract);language model(abstract,comments);large language model(abstract);分类 cs.CL
AI总结 该研究提出验证自主等级(VAL)元标准,解决验证领域的等级概念混淆,明确不同验证方案的完备性边界,相关代码与评估材料已公开。
Comments v2: reproducibility study (kappa~0.8), agent-security case (PPMF), anchor semantics, 15+ fixes. Code and data: https://github.com/1549080929-debug/math_agent Keywords: LLM verification; verification autonomy; completeness; ground truth; trustworthy AI Writing and implementation assisted by an AI language model; all experiments, data, and research decisions are the author's own
大语言模型后训练中基于流形覆盖与稀疏特征覆盖的分层数据选择
专题命中 推理与问题求解 :LLM(title,summary_cn);post-training(title);分类 cs.LG
AI总结 本文提出MASS算法,将LLM后训练的数据选择建模为分层覆盖问题,在Vision Flan与LLaVA-CoT上仅用少量数据即可达到或超过全量训练效果,且优于现有基线方法。
ALPS:通过数学构造衡量大语言模型的有效创造力
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI
AI总结 本研究提出ALPS基准,通过要求生成可证正确的原创数学结构或证明其不存在的任务,评估大语言模型的有效创造力,测试发现现有推理模型在证明侧成功率14%、构造侧为0,多数实例未被解决并发布完整ALPS资源。
Comments 14 pages, 3 figures
大型语言模型战略思维的脆弱性
机构 * IESE(IESE商学院)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI
AI总结 该研究开发框架拆解博弈中信念形成等环节,发现前沿LLMs的战略思维存在但具脆弱性,随复杂性提升会出现逻辑转变与启发式规则,警示其作为战略主体应用需谨慎。
Foam-Agent:迈向自动化智能CFD工作流程
机构 * Department of Computer Science, Rensselaer Polytechnic Institute(里士满理工学院计算机科学系) ; Department of Mechanical, Aerospace, and Nuclear Engineering, Rensselaer Polytechnic Institute(里士满理工学院机械、航空航天与核工程系) ; Department of Computer Science and Engineering, University of California San Diego(加州大学圣地亚哥分校计算机科学与工程系) ; College of Education, Zhejiang Normal University(浙江师范大学教育学院) ; School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI
AI总结 Foam-Agent通过多智能体框架和大型语言模型,实现自动化CFD工作流程,显著提升模拟效率和成功率。
Comments 34 pages, 9 figures, 9 tables
Journal ref Computer Methods in Applied Mechanics and Engineering, Vol. 461, 119271 (2026)
大语言模型无需规划即可说服理论之心理论
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL
AI总结 大语言模型通过战略性揭示信息说服目标,无需显式理论之心推理,实验显示其在说服任务中表现优于人类。
机构 * Institute for Energy Systems, School of Engineering, The University of Edinburgh(能源系统研究所,工程学院,爱丁堡大学) ; Nadara, Lisbon, Portugal(纳达拉,里斯本,葡萄牙)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL
利用大语言模型进行因果发现:一种基于约束和论证的方法
机构 * Department of Computing(计算系) ; Imperial College London(帝国理工学院伦敦分校)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI
AI总结 本文提出利用大语言模型作为不完美的专家,结合语义结构先验和条件独立性证据,实现因果发现的先进方法。
Comments Accepted at UAI 2026. 37 pages, including appendix
面向多模态大语言模型的多分支策略优化
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; Sichuan University(四川大学) ; Shanghai University(上海大学) ; Huawei Technologies Ltd.(华为技术有限公司)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI
AI总结 该研究针对多模态大语言模型统一信用分配的缺陷,提出MBPO框架,通过树结构与分支相对优势分配信用,结合时间回放缓冲区提升性能,在多模态推理基准上优于基线。
Comments 10 pages,8 figures
RareLens:通过对齐不同的大语言模型推理实现端到端罕见病护理
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI
AI总结 针对罕见病诊断难题,RareLens系统利用不同大语言模型推理的差异,通过四个协同模块实现全病程临床决策支持,在真实数据集和外部研究中表现出色,证明对齐模型推理是高不确定性临床决策的有效策略。
Comments 100 pages 7 figures
从推理到代理:大型语言模型强化学习中的信用分配
机构 * Independent Researcher(独立研究员)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL
AI总结 本文探讨了大型语言模型强化学习中信用分配问题,总结了47种方法,并提出了可重用的资源,指出从推理到代理的转变使信用分配更加复杂,推动了新的方法发展。
Comments 50 pages, 4 figures. v3: expanded to a unified 69-paper corpus through July 31, 2026; adds restored-state identification results, blind coding of a 42-paper full-text subset, a source-located reporting audit, the CA-ID Card, and replay-fidelity analysis
AgentPatch:用于合并智能体多模态大语言模型的由粗到细弱任务修复
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI
AI总结 针对智能体多模态大语言模型合并时的弱任务退化与关键行为遗忘问题,提出无需训练的AgentPatch框架,通过由粗到细修复实现能力平衡,提升合并模型性能。
基于大语言模型的反事实分析
机构 * Stevens Institute of Technology(史蒂文斯理工学院)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI
AI总结 本文研究用GPT-3.5模型开展在线借贷反事实分析,经提示工程优化后其预测性能接近梯度提升回归,验证了LLMs用于反事实分析的潜力。
从暴力到语义洞察:基于LLM的性能引导数据转换设计
机构 * Computer Vision Lab, CAIDAS & IFI, University of Würzburg(计算机视觉实验室、CAIDAS与IFI、乌尔姆大学)
专题命中 推理与问题求解 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 本文提出了一种基于LLM的性能引导数据转换设计方法,通过经验反馈实现闭环优化,减少穷举搜索需求,提升代码生成的准确性与任务对齐性。
超越准确率:大型语言模型统计推理的多维度评估
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL
AI总结 本研究结合多维度分析框架评估15款LLMs的统计推理,发现仅用准确率无法全面描述其统计推理能力,且存在厂商专属解释风格差异。
Comments 15 pages, 5 tables, 2 figures, presented at JSM 2026 and submitted for publication
大语言模型自适应元推理的认知需求引导
机构 * Thomson Reuters Foundational Research(汤森路透基础研究部) ; Imperial College London(帝国理工学院)
专题命中 推理与问题求解 :large language model(title);language model(title);LLM(abstract,abstract_cn);分类 cs.AI
AI总结 该研究提出无需训练的元推理框架CDS,通过认知量表刻画需求,在三类大模型和六个基准上较直接调用、标准CoT分别提升21.9%、9%准确率,难数学编码任务增益显著。
Comments 21 pages, 3 figures
大型语言模型能否执行父订单?
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL
AI总结 该研究针对算法交易的父订单执行问题,提出分层框架PACE,基于深交所数据验证其性能优于现有方法,表明LLMs可辅助人类交易者执行决策。
LEEPS:用于大语言模型中高效RLVR的潜在引导探索-利用提示采样
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL
AI总结 LEEPS是一种潜在引导探索-利用提示采样器,通过自适应分配rollout预算等方式优化提示采样,在6个数学推理基准和3个OOD通用推理基准上均取得最优性能,且训练开销较小。
Comments 15pages
DICA:多模态大语言模型中的双指标引导对比对齐
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI
AI总结 研究针对多模态大语言模型的问题,提出双指标引导对比对齐方法(DICA),通过跟踪视觉注意力熵和输出图像相关性两个指标,根据异常情况触发对比对齐,实验证明该方法能提升模型可靠性,优于现有方法。
评估用于符号安全协议分析的大语言模型
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI
AI总结 研究评估大语言模型对符号安全协议的分析能力,通过在130个协议上测试GPT和DeepSeek,发现聊天与推理模型各有优劣,在认证目标上表现差,保密性较好,结果不稳定,整体LLMs无法与形式化验证相比,仅可作预筛选。
Comments 36 pages, 5 figures
大语言模型是算法上盲目
机构 * School of Computer Engineering, Manipal Institute of Technology, Bengaluru, India(马尼帕尔理工学院计算机工程学院,班加罗尔,印度)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL
AI总结 研究发现大语言模型在算法推理上存在系统性失败,主要贡献是揭示了算法盲目的本质,即声明性知识与校准过程预测之间的差距。
Comments Code available at https://github.com/sohv/algorithmic-blindness
FindStatBench:在组合代码合成上评估大语言模型
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI
AI总结 介绍用于评估大语言模型组合代码合成能力的FindStatBench基准,涵盖多种合成任务,通过特定方式评分并评估11个系统,发现开源闭源系统准确率趋同、示例可能有害、存在输出预算问题等,揭示统计合成与映射合成的差异及相关问题。
释放多模态大语言模型用于野外无训练的人机交互检测
机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机技术研究所)
专题命中 推理与问题求解 :large language model(title);language model(title);foundation model(abstract);prompting(abstract)
AI总结 该研究针对传统人机交互检测方法在开放世界和组合场景中泛化能力受限的问题,提出无训练的AgentHOI框架,利用基础模型多模态推理能力,通过上下文感知多轮推理和多方面交互定位机制,在实际场景中取得优于现有监督和弱监督方法的性能。