Semantic Integrity Failures in Document-to-LLM Supply Chains
文档到LLM供应链中的语义完整性失败
专题命中 推理与问题求解 :LLM(title,title_cn)
AI总结 研究文档到LLM应用中的隐藏提取层导致的split-view PDF攻击,发现25种提取间隙,评估16个处理栈和7个商业LLM服务,提出静态扫描工具。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
文档到LLM供应链中的语义完整性失败
专题命中 推理与问题求解 :LLM(title,title_cn)
AI总结 研究文档到LLM应用中的隐藏提取层导致的split-view PDF攻击,发现25种提取间隙,评估16个处理栈和7个商业LLM服务,提出静态扫描工具。
GaussTrace:基于证据的LLM推理的3D高斯泼溅模型溯源分析
机构 * University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学)
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 提出GaussTrace框架,通过属性统计分析和假设驱动的编辑模拟,结合大语言模型链式推理,构建3D高斯泼溅模型的有向溯源图,无需训练或编辑历史。
Comments Accepted by ICML2026
SGTO-MAS:面向多智能体大语言模型系统的安全大猩猩部队优化
专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract)
AI总结 提出一种基于大猩猩部队优化的安全感知多智能体LLM协调方法,通过信任建模、风险感知和集体智能的联合优化,在性能、安全性和效率间取得平衡。
大语言模型及其对力学与空间几何的认知能力
机构 * University of Innsbruck(因斯布鲁克大学) ; University of Augsburg(奥格斯堡大学)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI
AI总结 本研究构建了全自动基准MecEng,评估32个开放权重及2个专有LLMs的机械工程认知,发现其刚体任务成功率达86.0%,但柔性多体任务仍具挑战,且该能力正快速提升但仍易出错。
嵌入器的困境:大型语言模型(LLM)性能更优,但代价是什么?
机构 * Harvard University(哈佛大学) ; Stanford University(斯坦福大学)
专题命中 推理与问题求解 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 该研究对比LLM与嵌入模型在37项任务的性能与成本,发现二者性能接近但LLM成本高、速度慢,建议嵌入模型用于通用任务,LLM用于推理密集型检索。
Comments Accepted to COLM 2026
关于智能体大语言模型漏洞的理解、识别与缓解
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI
AI总结 本研究针对智能体大语言模型安全开展系统文献综述,提出四层漏洞分类法,发现攻击研究多于防御研究、感知层漏洞研究占比偏高等现状,识别7个开放问题及架构耦合的核心不安全根源。
你会步行去洗车吗?揭示大型语言模型在常识推理中的显著性偏差
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL
AI总结 本研究构建SaliTrap基准数据集,发现主流LLMs存在显著性偏差,其常识推理失败源于知识被干扰项抑制,而非知识缺失,轻量级推理时提示可大幅缓解该问题。
GSM-Plus-BN:大语言模型中孟加拉语数学推理的基于扰动的基准测试
机构 * Southeast University(东南大学) ; Ahsanullah University of Science and Technology(阿山努拉科技大学)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL
AI总结 研究针对大语言模型中孟加拉语数学推理评估缺乏的问题,引入GSM-Plus-BN数据集,用9000个样本评估六个开源LLMs,对比标准提示和思维链提示,发现大模型鲁棒性好,思维链提示有提升,但与英语基准有差距,为相关研究提供新资源和基线。
打破似然陷阱:面向大语言模型解码的方差校准调制
机构 * School of Computer and Information Engineering, Henan University(河南大学计算机与信息工程学院) ; Department of Statistics, LMU Munich(慕尼黑大学统计系) ; Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)
专题命中 推理与问题求解 :LLM(summary_cn,abstract_cn);large language model(title);language model(title);分类 cs.CL
AI总结 提出方差校准调制(VCM),通过上下文PMI搜索和自适应自去偏置两种动态机制,在截断前重塑概率分布,以缓解LLM的似然陷阱问题,提升生成多样性、连贯性和推理准确性。
Comments Under Review
推理、奖励、优化:面向小语言模型物理推理的带结构化反馈步级纠错方法
机构 * IIIT Delhi(印度信息技术学院德里分校) ; IIT BHU(印度理工学院(巴纳拉斯印度教大学)) ; IIT Kanpur(印度理工学院坎普尔分校) ; NII Tokyo(日本国立情报学研究所) ; Microsoft Research India(微软印度研究院)
专题命中 推理与问题求解 :language model(title,abstract);small language model(title,abstract);prompting(abstract);分类 cs.AI
AI总结 针对小语言模型物理推理的步级错误传播问题,提出含结构化反馈的步级奖励框架,无需偏好数据,大幅提升推理准确率并降低各类错误占比。
关于强化学习中奖励函数对大语言模型置信度校准的有效性
机构 * School of Computing National University of Singapore(新加坡国立大学计算机学院) ; Institute of Advanced Intelligence and Computing(高级智能与计算研究所) ; Agency for Science, Technology and Research(科技研究局) ; Department of Electrical & Computer Engineering(电气与计算机工程系)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG
AI总结 研究大语言模型用强化学习训练以提升推理准确性和表达置信度时,奖励函数的设计问题。提出不可破解置信奖励方案概念并定义相关奖励方案谱,指出实际数据集中存在的问题及最佳校准奖励方案因数据集和应用而异。
Comments 50 pages, 8 figures
基于多模态大语言模型的第一视角事故视频中的责任分配估计
机构 * Keio University(庆应大学)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI
AI总结 研究第一视角事故视频中责任分配估计新任务,构建大语言模型辅助的责任标注管道并在多输入设置下微调模型,实验证明多模态大语言模型能有效执行该任务。
从识别到理解:利用LLM解锁认知时间序列推理
机构 * Institute of Digital Twin, Eastern Institute of Technology(东方理工数字孪生研究所) ; Zhejiang University(浙江大学) ; Munich Center for Machine Learning, LMU(慕尼黑机器学习中心,慕尼黑大学)
专题命中 推理与问题求解 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 针对现有时间序列任务与LLM能力不匹配的问题,提出多模态基准TSCognition和统一框架TSAlign,通过认知推理任务和语义对齐提升LLM的时间序列推理性能。
QMFOL:通过可量化的一元一阶逻辑测试用例生成来基准测试大语言模型推理
机构 * Huazhong University of Science and Technology(华中科技大学) ; Nanyang Technological University(南洋理工大学) ; Hubei University(湖北大学) ; East China Normal University(华东师范大学) ; National University of Singapore(新加坡国立大学)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.AI
AI总结 提出QMFOL框架,通过可控制复杂度的合取/析取模式生成一元一阶逻辑推理任务,并构建包含2880个实例的基准QMFOLBench,评估显示逻辑复杂度增加导致性能下降和计算开销上升。
LLM 能当 CEO 吗?基于多角色智能体模拟的战略资源重新配置基准测试
机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学) ; Yale University(耶鲁大学)
专题命中 推理与问题求解 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 提出 CEO-Bench,一个多智能体基准,评估 LLM 在约束丰富的组织环境中进行多轮战略资源重新配置的能力,发现模型在结构有效性上表现良好,但在战略校准上存在系统性失败模式。
Comments 13 pages
大型语言模型中出现的模块化认知架构
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG;LLM(comments)
AI总结 该研究探究大型语言模型是否会出现类似人类大脑的模块化认知架构,经对4个认知领域46项任务的回路分析,发现其会形成相似模块化架构,表明模块化可能是智能系统的基本属性。
轻量级多模态模型能否评估LLM的推理性能?一项面向计算最优文档推理的研究
机构 * Phi Labs(菲实验室) ; Quantiphi(宽梯斐科技)
专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL、cs.AI
AI总结 本研究提出轻量级多模态模型DRB,基于新基准BudgetDoc实现文档任务中LLM推理预算的动态分配,在降低成本的同时多数情况下达到或优于固定最大预算的性能,具备跨模型泛化潜力。
ZetaGPT:无位置编码的状态空间注意力语言模型的参考实现
专题命中 推理与问题求解 :language model(title,abstract);RLHF(abstract,abstract_cn);small language model(abstract);pretraining(abstract)
AI总结 ZetaGPT是首款无显式位置编码的开源小型语言模型,它将因果状态空间方程与自注意力结合,提供全开源训练流水线,为无位置编码语言模型的研究提供紧凑可复现的参考实现。
关注自身思维:通过1.58比特量化视角打破推理型大语言模型的后训练量化障碍
机构 * Intel Labs China(英特尔中国实验室)
专题命中 推理与问题求解 :LLM(summary_cn,abstract);post-training(title,abstract);分类 cs.CL、cs.AI
AI总结 该研究提出ScaleQ-1.58三值后训练量化框架,通过集成AYOT校准方法,提升推理型LLM量化性能,该框架可扩展且泛化性强,仅需少量校准token即可实现优异效果。
Comments This research work was completed and submitted for publication in early May 2026. The project page: https://github.com/IntelChina-AI/BitTern
迈向可靠的人工智能辅助模拟设计:用于逐次逼近寄存器型模数转换器生成的模板约束大语言模型智能体
机构 * Massachusetts Institute of Technology(麻省理工学院)
专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 研究针对大语言模型在模拟电子设计自动化应用的瓶颈,提出端到端多步骤的ATLAS框架,利用专家知识结合模板约束生成,能生成成功通过仿真验证的SAR ADC,为集成LLMs到可靠模拟设计方法奠定基础。
超越逻辑形式:LLM提取的谬误分类模式
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 提出利用大语言模型从谬误示例中归纳提取抽象逻辑结构与上下文线索的模式,用于谬误分类,在多个实验设置中显著优于零样本基线并跨数据集验证泛化性。
选择与改进:理解推理后训练的机制
机构 * Microsoft Research NYC(微软研究院纽约) ; UIUC(伊利诺伊大学厄巴纳-香槟分校)
专题命中 推理与问题求解 :SFT(summary_cn,abstract);post-training(title,abstract);分类 cs.AI、cs.LG
AI总结 通过控制实验揭示强化学习后训练通过策略选择和策略改进两种机制提升推理能力,并指出SFT数据和RL数据的不同作用。
评估 Gemini Flash 上的高级提示工程用于多跳生物医学问答
机构 * Saudi Med AI Lab (SMAIL)(沙特医学人工智能实验室(SMAIL)) ; Prince Sultan University(普森国王大学) ; Al-Baha University(阿勒巴哈大学)
专题命中 推理与问题求解 :LLM(summary_cn,abstract_cn);prompting(title);large language model(abstract);language model(abstract)
AI总结 本研究通过设计多组件提示(角色扮演、多步思维链示例和格式规则),在 Gemini 2.0 Flash 上实现概念级得分0.720,显著优于基线0.565,并接近下一代模型性能,证明高级提示设计对释放LLM推理能力至关重要。
Comments 8 pages, proceedings of the BioCreative IX Challenge and Workshop (BC9) at IJCAI 2025
Journal ref Proc. BioCreative IX Workshop (BC9), IJCAI 2025, Montreal, Canada
从存储到访问:通过显式预激活与隐式推理实现大语言模型中参数化知识的可验证激活
机构 * ByteDance(字节跳动) ; Huazhong University of Science and Technology(华中科技大学)
专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 本研究提出VAKE框架,通过两阶段强化学习将LLM的显式知识提取能力迁移至隐式推理,可激活参数化知识,在多基准上优于基线且具备跨数据集迁移性。
社会视听问答的推理:我们处于什么阶段?
机构 * Inria(法国国家信息与自动化研究所) ; Univ. Grenoble Alpes(格勒诺布尔大学) ; CNRS(法国国家科学研究中心) ; University of Twente(特文特大学)
专题命中 推理与问题求解 :SFT(summary_cn,abstract);large language model(abstract,abstract_cn);language model(abstract,abstract_cn)
AI总结 本文针对社会视听问答研究,发现IntentBench存在高噪声,Vanilla SFT基线性能优于现有推理方法,仅用文本模态即可实现与视频相当的性能,并发布了IntentBench-Prime等资源。
Comments Accepted at HCMIW ECCV workshop. Code available here: https://github.com/koenv759/VanillaSFT
训练用于自解释忠实性的大语言模型
机构 * Imperial College London(帝国理工学院)
专题命中 推理与问题求解 :large language model(title);language model(title);LLM(abstract);prompting(abstract)
AI总结 提出强化学习方法,将忠实性度量改为训练目标,研究模型能否检测及优化影响决策因素以提高自解释忠实性。实验用随机词和用户偏差插入,微调模型在忠实性度量上显著改进,交叉干预泛化有模型依赖等情况,为减少不忠实推理提供路径。
Comments To appear at the ICLR 2026 Workshop on Representational Alignment (Re-Align), 10 pages (long paper)
用大语言模型绘制狭窄走廊
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract)
AI总结 研究探讨大语言模型能否将国家历史在二维空间路径的框架付诸实践,引入可重现流程,制作12国轨迹图集并比较四个模型,评估与专家指数的一致性及模型间一致性,还讨论了大语言模型注释器和人类专家偏差差异。
用于物联网支持的自动驾驶的大语言模型增强可微轨迹规划
机构 * State Key Laboratory of Automotive Simulation and Control, Jilin University(吉林大学汽车仿真与控制国家重点实验室) ; Center of Research for Cyber Security and Network (CSNET), Faculty of Computer Science and Information Technology, Universiti Malaya(马来西亚大学计算机科学与信息技术学院网络安全与网络研究中心) ; Interdisciplinary Centre for Security, Reliability and Trust (SnT), University of Luxembourg(卢森堡大学安全、可靠性与信任跨学科中心) ; IMT, Department of Humanities and Technology, Roskilde University(罗斯基勒大学人文与技术系IMT) ; Center for Security, Theory and Algorithmic Research, International Institute of Information Technology(国际信息技术研究所安全、理论与算法研究中心) ; Department of Computer Science and Engineering, College of Informatics, Korea University(韩国大学信息学院计算机科学与工程系)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract)
AI总结 针对物联网支持的自动驾驶规划问题,提出大语言模型增强可微轨迹规划框架。通过以周围智能体为中心的数据增强、复杂度感知的语义增强模块及可微优化模块,提升规划效果,在相关基准测试中取得高分,验证了在线部署和实时闭环执行能力。
Comments 13 pages, 5 figures
大语言模型对软件工程术语的理解不可靠
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract)
AI总结 研究大语言模型对软件工程术语的理解程度,通过用正确及伪造定义提示,测量分类准确率与推理令牌合理性,发现多数模型虽能检测伪造定义,但存在拒绝正确定义的偏差,明确推理未持续改善结果,揭示了LLMs在术语理解上的问题。
LLM自主网络中优先连接与玻璃天花板效应的涌现
专题命中 推理与问题求解 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract)
AI总结 研究LLM代理自主选择合作者时网络结构的涌现,发现优先连接和类型依赖的玻璃天花板效应,通过平均场模型证明中心性收敛,实验验证了网络动态对集体性能的影响。