LLMs Show No Signs Of Individuated Metacognition
LLMs 未显示出个体化元认知的迹象
机构 * Pareto AI
专题命中 数学推理 :reasoning(abstract);分类 cs.LG
AI总结 通过因素分析和校准方法,研究20个前沿大语言模型在六个基准上的置信度判断,发现模型间置信度差异主要由共享的难度因子和决策阈值决定,而非个体化元认知,数学推理中的表面例外实为混淆效应。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
LLMs 未显示出个体化元认知的迹象
机构 * Pareto AI
专题命中 数学推理 :reasoning(abstract);分类 cs.LG
AI总结 通过因素分析和校准方法,研究20个前沿大语言模型在六个基准上的置信度判断,发现模型间置信度差异主要由共享的难度因子和决策阈值决定,而非个体化元认知,数学推理中的表面例外实为混淆效应。
InfiGFusion:通过高效Gromov-Wasserstein进行图对逻辑蒸馏的模型融合
机构 * The Hong Kong Polytechnic University(香港理工大学) ; Zhejiang University(浙江大学) ; Daya Bay Technology and Innovation Research Institute(大亚湾技术与创新研究院)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL
AI总结 提出InfiGFusion,一种结构感知的模型融合框架,通过图对逻辑蒸馏损失显式建模词汇维度间的语义依赖,并利用排序闭式近似将Gromov-Wasserstein距离的计算复杂度从O(n^4)降至O(n log n),在多个基准上超越现有方法。
FuRA: 基于谱预条件的全秩参数高效微调
机构 * University of California at Santa Barbara(加州大学圣芭芭拉分校) ; Amazon Lab126(亚马逊实验室126)
专题命中 数学推理 :reasoning(abstract);分类 cs.LG
AI总结 提出FuRA方法,通过块张量列车分解实现全秩谱预条件,在保持参数效率的同时提升微调性能,在LLM和VLM任务上优于全微调和LoRA。
通过能力选择性子空间投影实现自我策略蒸馏
机构 * University of Cambridge(剑桥大学) ; HKUST(香港科技大学) ; University of Chicago(芝加哥大学)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL
AI总结 本文提出Self-Policy Distillation(SPD),通过从模型自身梯度中提取低维能力子空间,将关键值(KV)激活投影到该子空间,并在标准下一项预测损失下进行微调,实现了无需外部信号的通用且能力选择性的自我蒸馏方法。
通过语言模型功能调用实现反思式提示调优
机构 * Megagon Labs(梅加穹实验室)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL
AI总结 本文提出了一种名为Reflective Prompt Tuning (RPT)的框架,利用语言模型功能调用模拟人类提示工程师的迭代工作流程,通过诊断函数评估目标模型,生成结构化诊断报告,并利用历史报告优化提示,从而提升提示效果和置信度校准。
Comments 17 pages, 6 figures
基于流形的注意力引导
机构 * University of California, San Diego(加州大学圣地亚哥分校)
专题命中 数学推理 :reasoning(abstract);分类 cs.LG
AI总结 本文提出了一种基于流形的注意力引导方法,通过在推理过程中监控注意力头与正确性流形的距离,动态纠正偏差,从而提高大语言模型在数学推理、代码生成和分子生成等任务中的表现。
通过单token数字嵌入提升语言模型的数值处理效率
机构 * Chair for AI in Healthcare and Medicine, Technical University of Munich (TUM) and TUM University Hospital, Munich, Germany(人工智能在医疗和医学中的Chair,慕尼黑技术大学(TUM)和慕尼黑技术大学医院,德国慕尼黑) ; Department of Computing, Imperial College London, UK(计算系,伦敦帝国学院,英国) ; Munich Center for Machine Learning (MCML), Munich, Germany(慕尼黑机器学习中心(MCML),德国慕尼黑) ; Hasso Plattner Institute for Digital Engineering, University of Potsdam, Germany(哈索·platzer研究所数字工程学院,波茨坦大学,德国)
专题命中 数学推理 :reasoning(abstract);分类 cs.LG
AI总结 本文提出BitTokens,一种利用IEEE 754二进制浮点表示将数字编码为单token的方法,使语言模型能更高效地处理数值计算,从而提升其解决复杂问题的能力。
学习手柄:在接口约束下的可证明收敛的工作流学习
机构 * Stern School of Business(斯特恩商学院) ; New York University(纽约大学) ; Department of Computer Science(计算机科学系) ; Dartmouth College(达特茅斯学院) ; Virginia Tech(弗吉尼亚理工大学)
专题命中 数学推理 :reasoning(abstract);分类 cs.AI
AI总结 该研究探讨了在接口约束下的工作流学习问题,提出了一种异步去中心化的Q学习算法IC-Q,并给出了神经IC-Q的有限样本界,证明了在去中心化部分可观测性下的神经Q学习的第一个有限样本保证。
AdaSwitch: 一种在小型和大型代理之间自适应切换以实现有效的云-本地协作学习方法
机构 * State Key Laboratory of General Artificial Intelligence, Peking University, Beijing, China(一般人工智能国家重点实验室,北京大学,北京,中国) ; School of Intelligence Science and Technology, Peking University(智能科学与技术学院,北京大学) ; East China Normal University(东华大学) ; Chinese Academy of Sciences(中国科学院) ; Baidu Inc(百度公司) ; Beijing Institute of Technology(北京理工大学) ; University of Birmingham(伯明翰大学)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL
AI总结 本文提出了一种新的LLM使用范式,通过自适应机制在云端和本地部署的LLM之间切换,以提高任务完成性能和效率,通过本地代理处理简单推理步骤,云代理处理复杂推理步骤,实验表明该方法在多个基准测试中有效提升了本地代理的性能。
Comments EMNLP 2024 Main Conference
自回归序列的矩阵解耦浓度:稀疏长上下文奖励的维度无关保证
机构 * School of Mathematics and Statistics, Beijing Institute of Technology, Beijing 100872, China(北京理工大学数学系,北京理工大学,北京100872,中国)
专题命中 数学推理 :reasoning(abstract);分类 cs.LG
AI总结 本文提出矩阵解耦浓度框架,通过严格因果依赖解析和目标敏感性向量的精确矩阵-向量乘法,解决自回归模型中依赖结构与目标敏感性分离的问题,提供维度无关的方差代理和长上下文推理的稳定性保证。
超越基准:MathArena作为LLMs数学评估平台
机构 * ETH Zurich(苏黎世联邦理工学院) ; INSAIT
专题命中 数学推理 :reasoning(abstract);分类 cs.CL
AI总结 本文提出MathArena作为持续维护的数学评估平台,涵盖广泛任务,展示前沿模型在数学推理中的进步。
T2T-LA:一种用于图学习的拓扑到拓扑LLM代理,无需特征访问或任务知识
机构 * MTU(MTU大学)
专题命中 数学推理 :reasoning(abstract);分类 cs.LG
AI总结 本文提出T2T-LA,一种无需特征访问或任务知识的拓扑到拓扑LLM代理,通过学习失败拓扑与评分之间的关系,实现图学习中的拓扑推理。
ICRL: 通过强化学习学习内化自我批评
机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Nanjing University(南京大学) ; Sun Yat-sen University(中山大学) ; National University of Singapore(新加坡国立大学) ; Nanyang Technological University(南洋理工大学) ; SAP ; Microsoft Research(微软研究院)
专题命中 数学推理 :reasoning(abstract);分类 cs.AI
AI总结 本文提出ICRL框架,通过联合训练求解器和批评者,使求解器在无外部批评时也能自我改进,提升代理和数学推理任务性能。
InfoSFT: 通过信息感知的标记加权学习更多并忘记更少
机构 * University of Pennsylvania(宾夕法尼亚大学) ; University of Southern California(南加州大学)
专题命中 数学推理 :chain-of-thought(abstract);分类 cs.LG
AI总结 InfoSFT通过信息感知的标记加权方案改进监督微调,提升泛化能力并保留原有能力,适用于数学、代码和推理任务。
基于数据的时序属性监控(扩展版)
机构 * INESC-ID/Instituto Superior Técnico, Universidade de Lisboa, Portugal(葡萄牙里斯本大学理工学院/INESC-ID) ; Free University of Bozen-Bolzano, Italy(意大利博登-博洛尼亚自由大学)
专题命中 数学推理 :reasoning(abstract);分类 cs.AI
AI总结 本文提出了一种新的监控框架,用于处理带有任意SMT理论的有限轨迹LTLfMT属性,结合自动机方法和自动推理技术,解决了时序逻辑的挑战,并首次识别出可判定的实用片段。
Comments This is the extended version of a paper accepted to IJCAI 2026
谄媚是一种教育安全风险:为什么LLM导师需要谄媚基准
机构 * Technical University of Munich, Munich, Germany(慕尼黑技术大学,慕尼黑,德国) ; Munich Center for Machine Learning, Munich, Germany(慕尼黑机器学习中心,慕尼黑,德国)
专题命中 数学推理 :reasoning(abstract);分类 cs.AI
AI总结 本文探讨LLM导师需通过谄媚基准测试来评估其在教育中的安全风险,指出模型在面对社会-知识压力时的脆弱性及改进方向。
从失败中学习:具有可验证奖励的纠正导向策略优化
机构 * Chinese Information Processing Laboratory, Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所信息处理实验室) ; University of Chinese Academy of Sciences(中国科学院大学) ; Xiaohongshu Inc(小红书公司)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL
AI总结 本文提出CIPO方法,通过将失败轨迹转化为纠正监督,提升大语言模型的推理和纠错能力,在11个基准测试中优于基线方法。
Comments Work on progress
动态嵌套层级:在机器学习架构中开创自我进化以实现终身智能
机构 * Institute of Technology University of Tartu(塔尔图技术大学) ; S Holding OÜ(3S控股公司)
专题命中 数学推理 :reasoning(abstract);分类 cs.LG
AI总结 本文提出动态嵌套层级,通过自适应调整优化层级、嵌套结构和更新频率,解决现有模型在非平稳环境中的适应性问题,推动终身学习的发展。
Comments 12 pages, 1 figure
Journal ref Frontiers in Artificial Intelligence, 2026
面向6G自主网络的智能偏差教程
机构 * i2CAT Foundation(i2CAT基金会) ; Hostelworld Group(Hostelworld集团) ; Technical University of Catalonia (UPC)(技术大学(加泰罗尼亚)) ; Khalifa University of Science and Technology(卡里玛大学) ; ISI/ATH ; University of Patras(帕特拉大学)
专题命中 数学推理 :reasoning(abstract);分类 cs.AI
AI总结 本文探讨了在6G自主网络中因人类设计引入的认知偏差问题,通过两个案例展示如何利用智能体AI缓解锚定偏差和时间偏差,提升网络管理和边缘计算的效率与节能效果。
Comments 26 pages, 18 figures, 4 tables, link to source code available. Accepted at IEEE OJCOMS
SkillFlow: 以流程驱动的递归技能进化用于代理编排
机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; National University of Singapore(新加坡国立大学) ; Nanyang Technological University(南洋理工大学) ; Zhejiang University(浙江大学)
专题命中 数学推理 :reasoning(abstract);分类 cs.AI
AI总结 SkillFlow通过流程驱动的递归技能进化解决代理编排中的策略崩溃、梯度方差高和无指导技能进化问题,实现高效任务编排。
Comments 49 pages, 5 figures, 6 tables
用于大型语言模型的分布校正离线数据蒸馏
机构 * George Mason University(乔治·马歇尔大学)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL
AI总结 本文提出一种分布校正的离线推理蒸馏框架,通过适应性强调与学生模型推理分布更一致的教师监督,提升推理准确性并保持指令遵循能力。
TRIAGE:在资源限制下评估大语言模型的前瞻性元认知控制
机构 * University of California, Riverside, USA(加州大学河滨分校) ; University of Maryland, Baltimore County, USA(马里兰大学巴尔的摩县分校)
专题命中 数学推理 :reasoning(abstract);分类 cs.AI
AI总结 研究评估了大语言模型在资源限制下的前瞻性元认知控制能力,通过Triage框架测试不同模型在多个领域的表现,揭示了现有模型在该能力上的显著差距。
expo: 通过自适应KL调节和高斯课程采样优先政策优化
专题命中 数学推理 :reasoning(abstract);分类 cs.AI
AI总结 本文提出EXPO算法,通过自适应KL调节和高斯课程采样提升策略探索效率,实验表明其在数学推理任务中显著优于传统GRPO方法。
Comments Duplicate submission of arXiv:2605.11403
通过概率塑造的锐度引导组相对策略优化
专题命中 数学推理 :reasoning(abstract);分类 cs.LG
AI总结 本文提出GRPO-SG,通过降低可能引起过大梯度的token权重,提升RLVR的泛化能力,实验显示在数学推理、逻辑谜题和工具增强问答中表现更优。
迈向顺序公平性:通过双组优势优化缓解大语言模型的顺序敏感性
机构 * School of Software and Microelectronics, Peking University(软件与微电子学院,北京大学)
专题命中 数学推理 :reasoning(abstract);分类 cs.LG
AI总结 本文提出双组优势优化(DGAO),通过平衡组内准确性优势和组间稳定性优势,缓解LLM的顺序敏感性,提升模型在RAG、数学推理和分类任务中的性能。
概率校准是语言模型中的可训练能力
机构 * Chandar Research Lab(昌达尔研究实验室) ; Mila – Quebec AI Institute(魁北克人工智能研究所) ; LAMA-WeST Lab(LAMA-WeST实验室) ; Polytechnique Montréal(蒙特利尔理工学院) ; Université de Montréal(蒙特利尔大学) ; Independent researcher(独立研究者)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL
AI总结 本文研究通过微调提升语言模型的概率校准能力,发现两种微调方法在不同任务中表现各异,硬目标方法在结构化数值采样更优,软目标方法在广泛随机生成任务中表现更好。
EVOCHAMBER:在个体、团队和种群层面进行多智能体系统的测试时间共进化
机构 * Oregon State University(俄勒冈州立大学) ; University of Wisconsin–Madison(威斯康星大学麦迪逊分校) ; Johnson & Johnson(强生公司) ; Pennsylvania State University(宾夕法尼亚州立大学) ; AG2AI, Inc.(AG2AI公司)
专题命中 数学推理 :reasoning(abstract);分类 cs.AI
AI总结 EVOCHAMBER通过在多智能体系统中实现测试时间共进化,解决了传统方法在跨智能体学习和专业化保留上的不足,通过协作梦境协议和群体生命周期操作,在不同任务流上实现了显著的性能提升。
LLMs改进LLMs:测试时扩展的代理发现
机构 * UMD(马里兰大学) ; UVA(弗吉尼亚大学) ; WUSTL(华盛顿大学) ; UNC(北卡罗来纳大学) ; Google(谷歌) ; Meta
专题命中 数学推理 :reasoning(abstract);分类 cs.CL
AI总结 本文提出AutoTTS框架,通过环境驱动的方法自动发现测试时扩展策略,提升大语言模型性能,实验表明其在数学推理基准上的准确率与成本平衡优于人工设计基线。
Comments 25 pages
MoshiRAG: 异步知识检索用于全双工语音语言模型
机构 * Toyota Technological Institute at Chicago(丰田技术研究所(芝加哥))
专题命中 数学推理 :reasoning(abstract);分类 cs.CL
AI总结 本文提出MoshiRAG,通过异步框架结合紧凑接口与选择性检索,提升全双工语音模型的事实性,同时保持交互性。
Comments Accepted to ICML 2026
GIFT: 用于扩散语言模型的引导重要性感知微调
机构 * Institute for Interdisciplinary Information Sciences(交叉信息科学研究院)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL
AI总结 本文提出GIFT方法,通过根据熵分配不同重要性权重来优化扩散语言模型的微调,从而在多个基准测试中优于标准SFT。
Comments preprint