DiPT: Enhancing LLM reasoning through diversified perspective-taking
机构 * Virginia Tech(弗吉尼亚理工大学) ; UC Davis(加州大学戴维斯分校)
专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI、cs.LG
Comments LLM Reasoning with Perspectives, NAACL 2025 Findings
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
机构 * Virginia Tech(弗吉尼亚理工大学) ; UC Davis(加州大学戴维斯分校)
专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI、cs.LG
Comments LLM Reasoning with Perspectives, NAACL 2025 Findings
专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI、cs.LG
Comments (2nd version with correction to algorithm) 11 pages, 8 figures, 5 algorithms. A companion Colaboratory tutorial is available at https://github.com/deepmind/deepmind-research/tree/master/causal_reasoning
专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI、cs.LG
Comments Probabilistic reasoning, Winograd Schema Challenge, Deep learning, Neural Networks, Distributed Representation
大语言模型后训练中基于流形覆盖与稀疏特征覆盖的分层数据选择
专题命中 其他推理 :CoT(summary_cn,abstract);分类 cs.LG
AI总结 本文提出MASS算法,将LLM后训练的数据选择建模为分层覆盖问题,在Vision Flan与LLaVA-CoT上仅用少量数据即可达到或超过全量训练效果,且优于现有基线方法。
Data-DPO:面向大语言模型后训练中目标模型数据选择的直接偏好优化
专题命中 其他推理 :CoT(summary_cn,abstract);分类 cs.LG
AI总结 针对现有数据选择方法忽略数据与目标模型能力分布兼容性的问题,提出Data-DPO方法,结合目标模型偏好、外部质量评分与边际多样性筛选数据,在Vision-Flan和LLaVA-CoT上性能优于基线及全数据训练。
“你撒谎了吗?”评估不同规模模型和信念验证模型生物体的谎言检测器
机构 * AI Security Institute(AI安全研究所)
专题命中 其他推理 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.AI
AI总结 本研究通过构建13个信念可验证的推理模型生物体和多样化提示撒谎测试集,评估了四种谎言检测器在不同规模模型上的表现,发现基于激活和概率的检测器在训练模型生物体上性能显著下降,而思维链法官保持较强性能,但存在伪影。
Comments 12 pages, 6 figures
通过大语言模型进行安全代码审查的洞察:能力、障碍及影响因素
机构 * School of Computer Science, Wuhan University, China(武汉大学计算机科学学院) ; School of Mathematical and Computational Sciences, Massey University(梅西大学数学与计算科学学院) ; School of Computing Technologies, RMIT University, Australia(皇家墨尔本理工学院计算技术学院)
专题命中 其他推理 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.AI
AI总结 本文通过实证研究探讨大语言模型在安全代码审查中的潜力,比较了七种LLM与静态分析工具的性能,发现LLM在检测安全缺陷方面表现优异,且特定提示策略对性能有显著影响。
Comments 30 pages, 13 images, 10 tables, Manuscript revision submitted to a journal (2026)
从执行轨迹生成可验证的推理链
机构 * IBM Research, India(印度IBM研究院) ; IBM Research, Japan(日本IBM研究院)
专题命中 其他推理 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.AI
AI总结 本文提出通过生成执行轨迹验证的推理链,提升模型在代码推理和生成中的准确性,实验显示验证质量显著提升模型性能。
专题命中 其他推理 :CoT(abstract,comments);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 37 pages, 23 figures. v1: results using InstructGPT, v2.0: added the Codex experiments, v2.1: added the missing test MedMCQA results for Codex 5-shot CoT and using k=100 samples, v3.0: added results for open source models -- ready for publication (final version)
超越模仿:通过推理进度过滤在线策略蒸馏
专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 针对在线策略蒸馏中教师奖励与真实推理进度不匹配的问题,提出R2-OPD方法,通过过滤冲突奖励提升推理性能,实现对标准OPD的改进。
rEDMRec:将大语言模型推理提炼为可编辑的体验记忆用于推荐
专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 rEDMRec将教师LLM推理提炼为四类可编辑体验记忆,轻量级学生LLM通过检索记忆排序,在多数据集和主干模型上优于零样本、少样本、RAG及GraphRAG,记忆优化可提升推荐性能并降低重复率。
LLaMA 3.1 8B中结构感知数值推理的机制可解释性
机构 * Northeastern University(东北大学) ; EmbodyX Inc.(EmbodyX公司)
专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 本研究从机制可解释性视角探究LLaMA 3.1 8B,通过构建需捕捉结构的数值序列任务,发现其可无监督计算存储一阶差分,还揭示其通过类诱导回路机制完成数值推理。
Co-RL:多智能体强化学习中多样群体涌现的无监督推理
机构 * University of Exeter(埃克塞特大学) ; ByteDance(字节跳动) ; Johns Hopkins University(约翰斯·霍普金斯大学) ; UC San Diego(加州大学圣迭戈分校)
专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 本研究提出Co-RL框架,通过参数不共享的多智能体协作训练,利用同伴奖励减少对真实标注的依赖,提升纯文本及多模态任务的推理性能,缓解训练崩溃与响应同质化问题。
Comments 30 pages, 5 figures, 11 tables
通过联合多任务学习增强科学课堂话语分析以进行推理组件分类
机构 * Department of Computer Science, Kennesaw State University(肯纳邦大学计算机科学系) ; Bagwell College of Education, Kennesaw State University(肯纳邦大学巴格威尔教育学院)
专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 本文提出ADAS系统,通过联合多任务学习对教师和学生话语进行类型和推理组件分类,解决少数类标签不平衡问题,提升课堂话语分析效率。
纠缠于表征:大型语言模型中文化偏见的机制性探究
机构 * University of Copenhagen(哥本哈根大学) ; KAIST(韩国科学技术院)
专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 本研究提出Culturescope方法,通过机制性可解释性探讨LLMs中文化偏见的来源,揭示低资源文化对文化偏见的抗性及模型参数知识的限制。
Comments 22 pages, 15 figures
DR.GAP:采用解耦推理的性别感知提示缓解大语言模型中的偏见
专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 该研究针对大语言模型的性别偏见问题,提出DR.GAP方法,通过生成无性别推理轨迹作为上下文示例,在不修改模型参数的情况下缓解偏见,且可扩展至视觉语言模型,经多任务多模型实验验证有效。
机构 * Data Science & AI Research Institute, China Unicom(中国unicom数据科学与人工智能研究院) ; Unicom Data Intelligence, China Unicom(中国unicom数据智能) ; School of Computer Science and Software Engineering, Southwest Petroleum University(西南石油大学计算机科学与软件工程学院)
专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
Comments Accepet by EMNLP 2025 Findings (11 pages, 1 figures)
Journal ref Findings of the Association for Computational Linguistics: EMNLP 2025, pages 10230-10240, Suzhou, China. Association for Computational Linguistics
保留、定制还是退出:大语言模型推理服务中的默认设计与代币定价
专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 该研究针对LLM推理服务的供需交互建立Stackelberg博弈模型,推导最优解,明确默认设置的影响条件,实验验证模型并展示均衡相关因素。
人类放弃,推理模型坚持:将难度登记与深思分配分离
机构 * The University of Hong Kong(香港大学)
专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 本文通过分离难度登记与深思分配,发现人类与大型推理模型(LRM)在问题解决中的时间/令牌分配模式相反:人类在错误问题上用时更少,而LRM在错误问题上使用更多令牌。
判断-结果差距:医疗决策中的大语言模型道德推理
专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 该研究发现LLMs在医疗决策中存在判断-结果差距,即虽认同患者对危害健康行为负有责任,但拒绝将该判断用于稀缺医疗资源分配,且随推理能力提升会放大与人类的道德分歧。
Comments Accepted at AIES 2026
关于大语言模型中条件PAC有效推理不可能性的注记
机构 * Department of Statistics and Data Science(统计与数据科学系)
专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 该研究证明了在无分布设定下,大语言模型无法实现条件PAC有效推理,指出任何满足此条件的算法必须依赖专家模型。
注意输出上限:输出预算机制会改变测得的多语言推理差距
专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.LG
AI总结 该研究发现多语言推理差距受输出token预算机制影响,通过固定Qwen模型的预算峰值等实验,提出应将输出上限作为独立变量,报告不同预算机制下的准确率。
Comments 15 pages, 2 figures, 11 tables. Under review
基于拓扑的不完整知识图谱推理与图基软提示
机构 * Chalmers University of Technology and University of Gothenburg, Sweden(楚姆勒大学技术学院和哥德堡大学,瑞典) ; Technical University of Denmark, Kgs. Lyngby, Denmark(丹麦技术大学,基斯勒吕辛,丹麦)
专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 本文提出基于图的软提示框架,通过图神经网络编码子图生成软提示,使LLM在更丰富的结构上下文中推理,减少缺失边的影响,提升多跳KBQA性能。
Comments 17 pages, 2 figures
大模型为何妥协:医学谄媚背后的对话因素与推理
机构 * Virginia Tech(弗吉尼亚理工大学) ; Shanghai Tongren Hospital, Shanghai Jiao Tong University School of Medicine(上海交通大学医学院附属同仁医院) ; Emory University(埃默里大学)
专题命中 其他推理 :reasoning(title);chain-of-thought(abstract);分类 cs.CL、cs.AI
AI总结 研究发现医学谄媚是对话属性而非模型属性,通过5个开放权重模型和500个MedQuAD问题的120万次试验,揭示了对话因素对医学谄媚的影响及思维链轨迹的解释。
Comments 21 pages, 7 figures, 14 tables
从‘我们’到‘我’:基于演绎推理的理论指导叙事转变
机构 * Syracuse University(苏塞克斯大学) ; Arizona State University(亚利桑那州立大学)
专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 本文提出基于演绎推理和社会科学理论的神经符号方法,用于改进大型语言模型的叙述转变能力,在多个模型上实现了显著的性能提升。
学会选择,而非重新学习:硬路由推理LoRA混合
机构 * Halmstad University(哈尔姆斯塔德大学) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 提出硬路由MoR-LoRA框架,通过硬top-1路由组合冻结的推理LoRA专家,保留专家行为且可训练参数少于软路由方法。
Comments Code available at: https://github.com/sar-molavi/hard-routed-mor-lora
推理还是记忆:大语言模型能理解并生成中国歇后语谜语吗?
专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 研究通过在新歇后语游戏中测试大语言模型,用多项选择题、自由形式解释生成和新歇后语创作评估其能力,发现前沿中文模型记忆能力较强,新歇后语创作中Gemini 3.1 Pro表现出色,但LLMs整体创造力仍落后于人类专家,凸显数据污染对评估LLMs推理能力的影响。
Comments 20 pages; exp 3 is work in progress
先回答再编辑:用于保留效用的反蒸馏的推理骨架编辑
机构 * School of Computer Science and Engineering, UNSW Sydney(新南威尔士大学计算机科学与工程学院) ; School of Artificial Intelligence, Shenzhen University(深圳大学人工智能学院)
专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 针对专有大语言模型易受知识蒸馏影响的问题,提出骨架引导推理编辑框架SGRE,通过先回答再编辑的方式,借鉴认知负荷理论对推理痕迹进行修改,在降低蒸馏效果的同时保持推理准确性和痕迹自然度。
Comments 21 pages,8 figures
O-VAD:通过以对象为中心的跟踪和推理进行工业视频异常检测
机构 * Carnegie Mellon University(卡内基梅隆大学) ; University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) ; Griffith University(格里菲斯大学)
专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 针对工业视频异常检测,现有基于VLM的方法在工业场景中性能不佳的问题,提出无训练的智能框架O-VAD,通过跟踪对象时空动态和推理状态轨迹来检测异常,在多数据集实验中优于多种方法且能提供可解释报告。
Comments Accepted to ECCV 2026
推理前先承诺:开放权重语言模型中答案预承诺的行为再现及初步激活水平证据
专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 研究聊天模型在简单问题上先承诺答案而非推导的现象,通过行为再现和初步激活水平证据揭示错误承诺情况,还指出方法学上问题措辞对结果的影响,强调阳性对照对解读阴性预言机结果的重要性。
Comments 8 pages. Code, data, and all reported statistics: https://github.com/JO-HEEJIN/interview_mate/tree/docs/car-wash-repro/car_wash/paper_4