PSSD: Making Large Language Models Self-denial via Human Psyche Structure
专题命中 推理与问题求解 :large language model(title);language model(title);分类 cs.CL、cs.AI
Comments WWW '25
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 推理与问题求解 :large language model(title);language model(title);分类 cs.CL、cs.AI
Comments WWW '25
专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)
Comments 10 pages, 4 figures, 4 tables (24 pages, 9 figures, 9 tables including references and appendices)
专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)
专题命中 推理与问题求解 :large language model(title);language model(title);分类 cs.AI、cs.LG
Comments Accepted at ICLR'24
专题命中 推理与问题求解 :large language model(title);language model(title);分类 cs.CL、cs.AI
专题命中 推理与问题求解 :large language model(title);language model(title);分类 cs.CL、cs.AI
Comments EMNLP 2023 Main
专题命中 推理与问题求解 :large language model(title);language model(title);分类 cs.CL、cs.AI
Comments Presented at the Generative-IR Workshop during SIGIR 2023. https://coda.io/@sigir/gen-ir
专题命中 推理与问题求解 :large language model(title);language model(title);分类 cs.CL、cs.LG
专题命中 推理与问题求解 :large language model(title);language model(title);分类 cs.CL、cs.AI
Comments 12 pages
专题命中 推理与问题求解 :large language model(title);language model(title);分类 cs.CL、cs.AI
Comments 11 pages, 2 figures
用于将多模态语言模型与剩余使用寿命关联的时间序列检索
机构 * University of Luxembourg(卢森堡大学)
专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出时间序列检索关联的多模态大语言模型框架,在C-MAPSS基准FD001分区实验显示,该方法可提升RUL预测的误差与稳定性,且效果随模型容量变化。
执行证明内存:通过验证实际发生的内容防御大语言模型智能体的伪造推理攻击
专题命中 推理与问题求解 :LLM(title,abstract);language model(abstract)
AI总结 该研究针对大语言模型智能体的伪造推理攻击,提出执行证明内存(PoEM)防御方案,通过维护防篡改的HMAC链式分类账验证实际执行步骤,使攻击成功率降至0%,且误报率极低、开销微小。
Comments 8 pages, 6 figures, 5 tables. Code: https://github.com/bithabib/ai_security
推理如何塑造大语言模型生成代码中的社会偏见?
专题命中 推理与问题求解 :LLM(title,abstract_cn);large language model(abstract);language model(abstract)
AI总结 该研究首次系统探究基于推理的代码生成中的社会偏见,发现推理可降低偏见但会影响代码质量,进而提出ProbeDebias框架,有效检测并缓解代码偏见,同时保持较高质量。
Comments ASE 2026
在线推理校准:测试时训练使可泛化的符合性大语言模型推理
机构 * Department of Electrical Engineering and Computer Science (MIT EECS)(麻省理工学院电气工程与计算机科学系) ; Computer Science and Artificial Intelligence Laboratory (MIT CSAIL)(麻省理工学院计算机科学与人工智能实验室) ; Laboratory for Information and Decision Systems (MIT LIDS)(麻省理工学院信息与决策系统实验室) ; Computational Science and Engineering (MIT CSE)(麻省理工学院计算科学与工程) ; Massachusetts Institute of Technology(麻省理工学院)
专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出ORCA框架,通过测试时训练和符合性预测校准推理过程,提升大语言模型在分布变化下的效率和泛化能力,实验证明其在不同任务中具有更高的性能。
Comments Published as a conference paper at COLM 2026; 22 pages
它认为有多难?分析大型语言模型思维链轨迹中感知步骤的推理能量
机构 * UC Merced(加州大学默塞德分校) ; UC San Diego(加州大学圣迭戈分校) ; UIUC(伊利诺伊大学厄巴纳-香槟分校) ; Adobe Research(奥多比研究院)
专题命中 推理与问题求解 :LLM(title,summary_cn);分类 cs.CL、cs.AI、cs.LG
AI总结 该研究提出SARE框架量化LLM思维链各步骤的推理能量,发现推理能量不均匀、错误轨迹关键节点能量更低,SARE特征性能优于或匹配输出置信度基线,揭示内部几何动态含预测信息。
Comments 13 pages, 3 figures
ALIBI:通过对抗性代码注释对基于大语言模型的漏洞检测器进行自适应智能体攻击
专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract)
AI总结 研究如何通过对抗性代码注释对基于大语言模型的漏洞检测器进行自适应智能体攻击,提出ALIBI框架,将现实世界漏洞修复提交转换为编码任务评估多个检测器,发现其高度易受攻击,揭示攻击面并推动安全意识设计。
自动填充:使用专业语言模型准确预测缺失值
专题命中 推理与问题求解 :language model(title,abstract);small language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究表格数据缺失值预测问题,提出自动填充方法,通过后训练三个针对不同能力的专业小语言模型并结合校准集成机制,相比现有推理模型在保证高精度的同时大幅降低成本。
Comments VLDB 2026
ARMOR:使用离策略锚样本稳定在线大语言模型强化学习
机构 * University of Science and Technology of China(中国科学技术大学) ; Peking University(北京大学) ; Dartmouth College(达特茅斯学院)
专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究大语言模型强化学习训练不稳定问题,提出ARMOR框架,通过锚展开利用离策略数据保留解决方案模式,混合优化重新制定策略目标实现可控探索,经实验验证可有效减轻验证崩溃,提升性能。
GhostShell:用于并发实体编程的流式大语言模型函数调用
专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract)
AI总结 研究提出GhostShell方法,利用大语言模型进行实体系统的流式和并发行为编程。通过定义函数令牌及多通道调度算法协调调用,在机器人原型上评估,该方法在任务完成率等方面表现出色,尤其在协调并发动作上优势明显。
Comments 22 pages, 7 figures, conference
棱柱形合成:基于梯度的数据多样化提升语言模型推理中的泛化能力
机构 * NVIDIA Research(NVIDIA研究部) ; University of Washington(华盛顿大学) ; University of Southern California(南加州大学)
专题命中 推理与问题求解 :LLM(title,abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究语言模型训练数据多样性对泛化的作用,提出基于梯度熵的G - Vendi指标,进而构建棱柱形合成框架生成多样合成数据,有效提升模型性能,在多个基准测试中表现优于依赖更大数据生成器的模型。
MoT:用于有效代码生成的思维模块化提示
专题命中 推理与问题求解 :prompting(title,abstract);large language model(abstract);language model(abstract)
AI总结 研究针对大语言模型代码生成中现有提示技术不足,提出MoT技术,利用模块化原则分解问题,用MLR图构建推理过程,经实验对比六种基线技术,在八个基准上显著提升代码生成性能,Pass@1分数达58.1%至95.1%。
用于扩散语言模型的掩码感知策略梯度
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究针对强化学习扩展到MDLMs的难题,将MDLM生成形式化为两阶段动作MDP,使策略梯度分解为令牌项和掩码项,结合优化这两项在数学推理和编码基准测试中取得了最优成绩。
Comments Accepted at COLM 2026
按需思考:基于大语言模型排序的模型感知推理路由
专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 研究基于大语言模型排序时推理时机与效果问题,提出推理路由框架,利用生成前信号决定推理与否,能自适应选策略,经实验验证该框架可提高排序效用并减少令牌消耗,解决准确性与效率权衡问题。
Comments Accepted by SIGIR2026
主权企业语言模型的本体增强蒸馏与上下文审查:机制验证与负面结果的组合方法研究
机构 * AgenticOS(智能操作系统)
专题命中 推理与问题求解 :language model(title,abstract);preference optimization(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究针对受数据驻留规则约束的金融机构需求,结合本体增强蒸馏机制验证与上下文审查方法,对Qwen3.6 - 27B学生模型进行训练及测试,结果不支持模型在多方面的优势,为企业语言模型应用提供参考。
Comments 15 pages, 2 figures. Combined proof-of-mechanism and negative-results method article consolidating ontology-amplified distillation with contextuality-audit routing for enterprise agents
使用具有迭代重新规划的基础模型进行零售商店中的移动操作任务规划
机构 * TCS Research, Tata Consultancy Services Ltd.(塔塔咨询服务公司TCS研究院)
专题命中 推理与问题求解 :foundation model(title,abstract);large language model(abstract);language model(abstract)
AI总结 研究零售场景补货问题,利用大语言模型和视觉语言模型,结合定制移动操作平台、用户驱动提示及反馈迭代重新规划方法纠错,在模拟环境验证端到端系统,为零售自动化提供了新的任务规划方案。
用于无人机群的以大语言模型为中心的智能体人工智能:架构、使能技术及开放问题
专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract)
AI总结 研究针对无人机群实际部署受限问题,提出以大语言模型为中心的智能体人工智能LAUS,回顾相关使能技术,分析威胁,确定包括抗幻觉推理等在内的开放研究挑战。
Comments 8 pages, 4 figures, 2 tables
基于推理的检索:用于能源改造推荐的语言模型成本控制基准
专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract_cn);large language model(abstract)
AI总结 研究为建筑推荐节能措施问题,通过树集成解决EUI预测,发现推荐任务框架影响模型选择,对八个大语言模型基准测试,表明其过度推荐,检索可缩小差距,还给出成本控制下模型的效果。
ESC:面向可靠视觉语言模型的情感自我纠正
机构 * 1 GenAI4E Lab 2 University of Information Technology, Ho Chi Minh City, Vietnam 3 Universit\"at Trier, Germany 4 Ho Chi Minh University of Technology, Ho Chi Minh City, Vietnam 5 PAMI Lab, Vietnamese German University, Vietnam 6 Vietnam National University, Ho Chi Minh City, Vietnam 7 Carnegie Mellon University, USA 8 Omoshiroi AI, USA 9 Harvard University, USA 10 Basis Research Institute 11 PASSIO Laboratory, North Carolina A\&T State University, USA 12 Mohamed bin Zayed University of Artificial Intelligence, UAE 13 Northwestern University, USA [4pt] Equal contribution. Corresponding author
专题命中 推理与问题求解 :language model(title,abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出训练无关的ESC框架,通过外部验证器检测错误初始响应并注入情感反馈,促使VLM自我纠正,提升安全、幻觉、感知和多模态推理等任务的可靠性。
Comments ECCV Main Track 2026 (113 pages, 15 tables, 65 figures). Project Page: https://genai4e.github.io/ESC/?
机器会在人类感到困难的地方也遇到困难吗?大语言模型与人类对混淆代码的理解
专题命中 推理与问题求解 :LLM(title,abstract_cn);large language model(abstract);language model(abstract)
AI总结 基于人类对混淆代码理解的研究,评估大语言模型是否共享人类在混淆代码下的失败模式,发现推理调优模型与人类困难模式显著对齐,而指令调优模型相关性接近零。
Comments 13 pages, 15 figures
视觉会撒谎,一致性说话:在视觉-语言模型中解耦空间注意力与可靠性
机构 * University of California, Santa Barbara(加州大学圣塔芭芭拉分校) ; Algoverse AI Research(Algoverse AI研究) ; University of California, Berkeley(加州大学伯克利分校)
专题命中 推理与问题求解 :language model(title,abstract);foundation model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出VLM可靠性探针(VRP),通过结构注意力指标和生成动态分析,发现空间注意力与准确性几乎无关(R≈0.001),而自一致性是可靠性的主要预测因子(R=0.429),揭示了视觉特征与最终生成之间的符号脱离现象。
Comments 16 pages. Accepted to the ICLR 2026 Workshop on Multimodal Intelligence. Code: https://github.com/itsloganmann/VLM-Reliability-Probe