Judgment-of-Thought Prompting: A Courtroom-Inspired Framework for Binary Logical Reasoning with Large Language Models
机构 * Soongsil University(松溪大学)
专题命中 推理与问题求解 :prompting(title,abstract);large language model(title);language model(title);分类 cs.AI
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
机构 * Soongsil University(松溪大学)
专题命中 推理与问题求解 :prompting(title,abstract);large language model(title);language model(title);分类 cs.AI
专题命中 推理与问题求解 :prompting(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)
专题命中 推理与问题求解 :prompting(title,abstract);large language model(title);language model(title);分类 cs.CL
Comments 8 pages
专题命中 推理与问题求解 :language model(title,abstract);large language model(title,abstract);分类 cs.CL、cs.AI、cs.LG;LLM(comments)
Comments Arabic-centric, foundation model, large-language model, LLM, generative model, instruction-tuned, Jais, Jais-chat
AI聊天机器人中的广告:大型语言模型如何应对利益冲突分析
机构 * Princeton University(普林斯顿大学) ; University of Washington(华盛顿大学)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI
AI总结 本文分析了大型语言模型在面临用户与公司利益冲突时的决策问题,通过实验发现多数模型优先考虑公司利益而非用户福祉,展示了在广告推荐中潜在的风险。
Comments COLM 2026
大型语言模型在规则应用中展现出概念掌握能力的证据
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI
AI总结 本文通过两项心理学实验发现,Gemini Pro等部分LLMs在规则应用上展现类人表现,证实LLMs掌握规则概念,对法律决策与哲学探究有启示。
无验证器的测试时扩展的一致性方法
专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract,abstract_cn);language model(abstract,abstract_cn);分类 cs.CL、cs.LG
AI总结 本文针对现有基于置信度的无验证器测试时扩展(VF-TTS)方法在复杂任务上失效的问题,提出一致性(consilience)框架,通过评估置信度时间不对称性提升LLM推理性能,在数学和代码生成任务上优于基线。
图上辩论:大语言模型在不确定知识图谱上的可靠且自适应推理
机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) ; Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University)(教育部新一代人工智能技术及其跨学科应用重点实验室(东南大学))
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI
AI总结 研究大语言模型在不确定知识图谱上问答时的问题,提出Debate-on-Graph框架,设计启发式搜索算法提取子图并引入多智能体辩论机制,经实验验证该框架能实现可靠且自适应推理,性能优于现有方法。
Comments 18 pages, Accepted by ECML-PKDD 2026
在LLM表示中预测脑活动的左右不对称性随着其正式语言能力的出现而出现
机构 * Centre d’Analyse et de Mathématique Sociales CNRS, EHESS, Paris, France(分析与数学社会中心 CNRS,EHESS,巴黎,法国) ; Cognitive Neuroimaging Unit CNRS, INSERM, CEA, Neurospin Center, 91191 Gif-sur-Yvette, France(认知神经成像单元 CNRS,INSERM,CEA,Neurospin中心,法国91191 Gif-sur-Yvette)
专题命中 推理与问题求解 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 研究发现LLM的正式语言能力与大脑预测活动的左右不对称性同步发展,且与算术或世界知识任务无关。
Journal ref Neurobiology of Language 2026
SPARK:大语言模型中基于敏感性的潜在推理状态分析与引导
机构 * Xi’an Jiaotong University(西安交通大学) ; Peking University(北京大学) ; Tencent(腾讯)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI
AI总结 研究大语言模型推理失败问题,提出SPARK方法,利用隐藏状态响应诊断推理状态并引导测试时干预,通过长度控制敏感性等手段,在实验中提升了Qwen3系列模型性能,证明敏感性对推理失败诊断及干预的作用。
从求解器到研究:前沿研究中的大语言模型驱动形式数学
机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校) ; Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI
AI总结 探讨AI4Math领域进展,指出当前系统处理前沿数学问题有局限。主张从预定义求解器转向研究代理,对该领域进行系统综述,识别现有系统局限性,为AI4Math未来发展规划战略路线图。
多视角思考用于大型语言模型中的偏见缓解
机构 * Dept. Computing Science, Alberta Machine Intelligence Institute (Amii) University of Alberta, Canada(计算科学系,阿尔伯塔机器智能研究所(Amii),阿尔伯塔大学,加拿大) ; Canada CIFAR AI Chair, Amii(加拿大 CIFAR 人工智能主席,Amii)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI
AI总结 本文提出多视角思考(MPT)框架,通过鼓励多视角推理减少社会偏见,实验表明其在降低偏见的同时保持了核心推理能力。
Comments 15 pages
Journal ref Findings of the Association for Computational Linguistics: ACL 2026, pp. 27895-27909, 2026
面向可泛化与可证据的核磁共振分子结构解析:基于大语言模型智能体的方法
机构 * Information Hub, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)信息中心) ; State Key Laboratory of Precision and Intelligent Chemistry, University of Science and Technology of China(中国科学技术大学精密与智能化学国家重点实验室) ; State Key Laboratory of Physical Chemistry of Solid Surface, College of Chemistry and Chemical Engineering, Xiamen University(厦门大学化学系固态表面物理化学国家重点实验室) ; The University of Hong Kong(香港大学) ; Peking Union Medical College and Chinese Academy of Medical Sciences(北京协和医学院中国医学科学院) ; The Hong Kong University of Science and Technology(香港科技大学) ; Hunan University(湖南大学) ; AI for Science Center, Shanghai Artificial Intelligence Laboratory(上海人工智能实验室人工智能科学中心)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.AI、cs.LG
AI总结 提出NMRAgent智能体,结合大语言模型、光谱分析工具和化学知识图谱,通过证据推理实现高精度、可解释的分子结构解析,在新型骨架测试集上Top-1准确率提升46.5%。
本体引导的反向思维使大语言模型在知识图谱问答中更强
机构 * Harbin Institute of Technology(哈尔滨工业大学) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; Joint Laboratory of HIT and iFLYTEK(哈工大与科大讯飞联合实验室) ; University of Science and Technology of China(中国科学技术大学) ; Pengcheng Laboratory(鹏城实验室)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI
AI总结 本文提出Ontology-Guided Reverse Thinking框架,通过反向推理构建路径,提升大语言模型在知识图谱问答中的表现,实验表明其在WebQSP和CWQ数据集上达到最佳性能。
Comments We now public our source codes
向LLM讲述数字:用于时间序列预测的多小波数字嵌入
机构 * University of Southern California(南加州大学) ; Meta ; Google DeepMind(谷歌DeepMind)
专题命中 推理与问题求解 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 提出TempoWave,一种即插即用的多小波数字嵌入接口,将标量观测映射为数字级嵌入,以对齐LLM的离散分词与连续数值,提升时间序列预测的排序准确性和可靠性。
Comments Camera Ready version of IJCAI 2026
通过基于 Lean 的上下文证明学习利用 LLM 发现新定理
机构 * OMRON SINIC X Corporation(OMRON SINIC X公司) ; RIKEN AIP ; NexaScience ; CyberAgent ; Kyoto University(京都大学) ; RIKEN AGIS ; Shiga University(大坂大学) ; NII NISTEP
专题命中 推理与问题求解 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 提出猜想-证明循环(CPL)框架,利用 LLM 在 Lean 4 中迭代生成数学猜想并尝试证明,通过上下文学习重用先前定理的证明策略,提高难证定理的发现率。
Comments 12 pages, 3 figures
一种用于加速罕见病诊断的专用推理大语言模型:随机AI辅助医生试验
机构 * Tsinghua Medicine, Tsinghua University(清华大学医学部,清华大学) ; Department of Ophthalmology, Peking Union Medical College Hospital, Chinese Academy of Medical Sciences & Peking Union Medical College(北京大学人民医院眼科,中国医学科学院 & 北京大学医学部) ; Department of Statistics and Data Science, Tsinghua University(清华大学统计与数据科学系) ; Department of Rheumatology and Clinical Immunology, Peking Union Medical College Hospital, Chinese Academy of Medical Sciences & Peking Union Medical College(北京大学人民医院风湿免疫科,中国医学科学院 & 北京大学医学部) ; Department of Rare Diseases, Peking Union Medical College Hospital, Chinese Academy of Medical Sciences & Peking Union Medical College(北京大学人民医院罕见病科,中国医学科学院 & 北京大学医学部) ; Department of Dermatology, Xijing Hospital, Air Force Medical University(西安空军军医大学西京医院皮肤科) ; School of Computer Science and Technology, East China Normal University (ECNU)(东华大学计算机科学与技术学院) ; Department of Neurosurgery, Xuanwu Hospital, Capital Medical University(首都医科大学宣武医院神经外科) ; Department of Ophthalmology, National University of Singapore(新加坡国立大学眼科) ; Singapore Eye Research Institute, Singapore National Eye Centre(新加坡眼科学研究所,新加坡国家眼科中心) ; Ophthalmology and Visual Science Academic Clinical Program, Duke-NUS Medical School(杜克-国立新加坡大学医学学校眼科与视觉科学学术临床项目) ; Department of Pediatrics, The First Hospital of Tsinghua University(清华大学第一医院儿科) ; College of Future Technology, Peking University(北京大学未来技术学院) ; School of Health and Wellbeing, University of Glasgow(格拉斯哥大学健康与福祉学院)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI
AI总结 提出开源推理大模型RaDaR(32B参数),通过增强推理训练和合成数据,在罕见病诊断中超越DeepSeek-R1等模型,随机试验显示其辅助使医生诊断准确率提升21.44个百分点。
Comments 36 pages, 5 figures
使用未见过的随机变量问题对LLM的数学推理进行基准测试
机构 * The Hong Kong Polytechnic University(香港理工大学) ; University of Electronic Science and Technology of China(电子科技大学) ; Tencent Youtu Lab(腾讯优图实验室) ; Beihang University(北京航空航天大学) ; Simon Fraser University(西蒙弗雷泽大学)
专题命中 推理与问题求解 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 针对现有数学基准的可靠性问题,提出RV-Bench方法,通过生成随机变量问题评估LLM的真实推理能力,发现模型在已见和未见数据分布上的能力不平衡,且推理泛化有限但可通过测试时扩展提升。
Comments Accepted to AAAI2026
OGD4All: 基于大语言模型的可访问地理空间开放政府数据交互框架
机构 * Professorship of Computational Social Science, ETH Zurich(计算社会科学教授职位,苏黎世联邦理工学院) ; Esri R&D Center Zurich(埃斯里苏黎世研发中心) ; Complexity Science Hub(复杂性科学中心)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.AI、cs.LG
AI总结 提出OGD4All框架,结合语义检索、智能体推理和沙盒执行,实现基于大语言模型的地理空间开放政府数据交互,在430个数据集上达到98%分析正确率和94%召回率,有效减少幻觉风险。
Comments Author Accepted Manuscript (AAM). Proceedings of 2026 IEEE CAI (Granada, Spain). Update manuscript with final DOI. Code & data available at: https://github.com/ethz-coss/ogd4all
Journal ref 2026 IEEE Conference on Artificial Intelligence (CAI), pp. 882-888
LLM 在掷骰子时有多可靠?
机构 * Università degli Studi di Firenze(佛罗伦萨大学)
专题命中 推理与问题求解 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 通过离散概率问题基准测试,发现 LLM 在标准问题上准确率 0.96,但在反直觉问题上仅 0.59,且存在 token 偏差和误导提示的脆弱性。
Ex-Omni:为全模态大语言模型赋能3D面部动画生成
机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; LIGHTSPEED ; Independent Researcher(独立研究员)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.CL、cs.AI
AI总结 提出Ex-Omni模型,通过混合形状感知语音单元生成器和解码器解耦语义推理与时间生成,并引入统一令牌查询门控融合机制,实现全模态大语言模型同步生成语音和3D面部动画。
从USD场景到知识图谱:基于LLM的零样本本体接地
机构 * Technical University of Berlin(柏林工业大学) ; Fraunhofer FOKUS(弗劳恩霍夫开放通信系统研究所)
专题命中 推理与问题求解 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 研究利用大语言模型(LLM)零样本地将3D场景对象自动映射到本体类别,无需训练,在厨房场景中达到90-96%准确率,并揭示语义线索是关键。
Comments Accepted to the IEEE ICRA 2026 International Joint Workshop on Ontologies, Semantic Maps and Autonomous Robotics Standardization (J-WOSMARS 2026), Vienna, 2026
全局XAI方法能否揭示LLM中的注入行为?SHAP vs 规则提取 vs RuleSHAP
机构 * Collegium Helveticum at ETH Zurich(苏黎世联邦理工学院霍夫曼学院) ; Università della Svizzera italiana(瑞士联邦理工学院)
专题命中 推理与问题求解 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 研究通过统计验证的抽象将全局LLM信念映射为数值分数,提出RuleSHAP算法,结合全局SHAP与规则归纳,以更好地捕捉非单变量触发因素,平均MRR@1比RuleFit提升82%。
Comments Accepted for publication at KDD'2026
AutoTool: 面向智能体推理的动态工具选择与集成
机构 * Nanyang Technological University(南洋理工大学)
专题命中 推理与问题求解 :SFT(summary_cn,abstract);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 提出AutoTool框架,通过双阶段优化(SFT+RL轨迹稳定化和KL正则化Plackett-Luce排序)使大语言模型具备动态工具选择能力,在数学、科学、代码和多模态推理等任务上平均提升6.4%-7.7%。
Comments ICML2026; Best Paper Award at ICCV 2025 Workshop on Multi-Modal Reasoning for Agentic Intelligence
一种用于LLM可靠证明生成的神经符号方法:以欧几里得几何为例
机构 * The Hebrew University of Jerusalem(特拉维夫大学)
专题命中 推理与问题求解 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 提出一种结合LLM生成能力与结构化组件的神经符号方法,通过类比问题检索和形式验证器反馈,显著提升欧几里得几何证明的准确性。
Comments long paper
评估大型语言模型在复杂隐藏角色游戏中的表现
机构 * University of Göttingen(哥廷根大学)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI
AI总结 本研究通过社交推理游戏《秘密希特勒》评估大型语言模型的推理、说服和欺骗能力,引入新指标并发现当前模型在复杂多轮操纵中效果不佳。
Comments Master's thesis, University of Göttingen
前沿大语言模型与最先进的规划器相媲美
机构 * University of Oxford(牛津大学) ; Federal University of Rio Grande do Sul(里约格兰德杜斯尔大学) ; Linköping University(林霍普大学)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.AI、cs.LG
AI总结 研究显示前沿大语言模型在规划任务中超越传统规划器, Gemini 3.1 Pro在标准任务中表现突出,GPT-5表现接近基线,且在符号规划中仍具竞争力,揭示了大语言模型规划能力的提升趋势。
学习,快速与缓慢:迈向能够持续适应的LLM
机构 * UC Berkeley(加州大学伯克利分校) ; Mila(蒙特利尔大学人工智能研究所) ; UT Austin(得克萨斯大学奥斯汀分校) ; Eragon Periodic Labs ; Mirendil Video
专题命中 推理与问题求解 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 本文提出一种快速-缓慢学习框架,通过将模型参数作为缓慢权重和优化上下文作为快速权重,提升LLM在连续学习中的样本效率和性能,减少灾难性遗忘。
Comments 29 pages, 14 figures, including appendix; Blog post: https://gepa-ai.github.io/gepa/blog/2026/05/11/learning-fast-and-slow/
超越语言:大型语言模型中的格式无关推理子空间
机构 * University of Southern California(南加州大学) ; Duke University(杜克大学)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.CL、cs.LG
AI总结 研究揭示大型语言模型中存在格式无关推理子空间(FARS),通过TriForm基准测试发现,FARS能增强概念结构并抑制形式信息,且在不同架构中表现一致,支持柏拉图表示假设。
Comments Preprint. 13 pages, 13 figures, 12 tables
相对动能效用用于推理感知的结构剪枝在大语言模型中
机构 * School of Mathematics, Southeast University(东南大学数学学院)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.LG
AI总结 本文提出相对动能效用框架,通过连续动能积分提升结构剪枝效果,实验证明在高稀疏度下提升模型性能,尤其在GSM8K数据集上表现优异。
Comments 15 pages, 3 figures