arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-24 至 2026-08-24 共收录 11 信号源:cs.CL, cs.AI, cs.LG

1. 其他推理 11 篇

2508.08879 2026-08-24 cs.CL cs.AI 版本更新 81%

CulTrace: Tracing Internal Cultural Reasoning in Large Language Models

纠缠于表征:大型语言模型中文化偏见的机制性探究

Haeun Yu, Arnav Arora, Seogyeong Jeong, Nadav Borenstein, Siddhesh Pawar, Jisu Shin, Jiho Jin, Junho Myung, Alice Oh, Isabelle Augenstein

机构 * University of Copenhagen(哥本哈根大学) KAIST(韩国科学技术院)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究提出Culturescope方法,通过机制性可解释性探讨LLMs中文化偏见的来源,揭示低资源文化对文化偏见的抗性及模型参数知识的限制。

Comments 22 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22193 2026-08-24 cs.CL 版本更新 79%

Scale or Reason? A Compute-Equivalent Analysis of Reasoning Distillation

规模还是推理?推理蒸馏的计算等价分析

Nicolas Boizard, Hippolyte Gisserot-Boukhlef, Kevin El Haddad, Céline Hudelot, Pierre Colombo

机构 * Diabolocom Artefact Research Center Equall ISIA Lab, University of Mons(ISIA实验室,蒙斯大学) MICS, CentraleSupélec, Université Paris-Saclay(MICS,CentraleSupélec,巴黎萨克雷大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL

AI总结 通过控制实验,在相同计算预算下比较推理蒸馏与标准指令微调,发现指令微调在多数配置下处于帕累托前沿,而推理蒸馏仅在7B以上开放任务中有效,混合25-50%推理数据可低成本获得大部分收益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21022 2026-08-24 cs.CV cs.MM 新提交 78%

Recognition-Conditioned Reasoning: A Training-Free Multimodal-LLM Pipeline for Fine-Grained Micro-Action Understanding

识别条件推理:一种用于细粒度微动作理解的无训练多模态大语言模型流水线

Fengshun Wang, Jin'ang Han, Zhigang Tu

机构 * Wuhan University(武汉大学)

专题命中 其他推理 :reasoning(title,abstract)

AI总结 该研究提出一种无训练的多模态大语言模型流水线,动态分配子任务至适配的模型,在2026年MAC微动作挑战赛MA-Bench赛道的开放式任务上获显著性能优势,取得第一名。

Comments Accept at ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21296 2026-08-24 cs.MA 新提交 75%

Level-k Distinguishable Mechanisms for Evaluating Bounded Rationality in LLMs

用于评估大型语言模型(LLMs)有限理性的k级可区分机制

Binchi Zhang, Atrisha Sarkar

专题命中 其他推理 :chain-of-thought(abstract,abstract_cn);reasoning(abstract)

AI总结 该研究提出k级可区分机制,通过新型博弈结构评估LLMs的策略深度,发现递归推理下模型策略深度准确,对手博弈的归纳推理会降低性能,明确策略心智化可提升表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21252 2026-08-24 cs.CL cs.AI cs.DB cs.IR 新提交 62%

EnSI-RAG: Entity-Structure-Indexed Retrieval-Augmented Generation for Long-Document Question Answering

EnSI-RAG:面向长文档问答的实体结构索引增强检索生成框架

Xuanyu Meng, Jiashuo Sun, Jash Rajesh Parekh, Jiawei Han

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对长文档问答的RAG方法缺陷,提出EnSI-RAG框架,构建以实体为中心的索引,在Loong和Oolong数据集上平均准确率达78.24,较基准提升6.62个百分点,验证了其有效性。

Comments 21 pages, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21218 2026-08-24 cs.AI cs.CL cs.IR 新提交 62%

Enhancing LLMs in Predictive Political QA with Semi-Structured Data

利用半结构化数据增强大型语言模型(LLMs)在预测性政治问答(QA)中的表现

Yinan Liu, Zihan Zhou, Zichun Jin, Xinyu Wang, Bin Wang, Xiaochun Yang

机构 * School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究针对预测性政治问答任务,提出双视图框架PSL,结合半结构化政治记录提取立场与结构信号,在三个真实数据集及多个LLM上均优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20402 2026-08-24 cs.CL cs.AI 新提交 62%

LingShu: A Large-Scale Symptom-Centric Contextualized Knowledge Graph Bridging Traditional Chinese Medicine and Modern Biomedicine

灵枢(LingShu):连接中医与现代生物医学的大规模以症状为中心的上下文知识图谱

Rui Hua, Zixin Shu, Kai Chang, Dengying Yan, Jianan Xia, Hui Zhu, Shujie Song, Shurui Yang, Tongxin Wang, Yue Yin, Yu Wei, Lijuan Pei, Yunhui Hu, Hao Xu, Mingzhong Xiao, Xiaodong Li, Haibin Yu, Runshun Zhang, Wenjia Wang, Baoyan Liu, Xuezhong Zhou

机构 * Beijing Jiaotong University(北京交通大学) Hubei Provincial Hospital of Traditional Chinese Medicine(湖北省中医院) Hubei University of Chinese Medicine(湖北中医药大学) Hubei Province Academy of Traditional Chinese Medicine(湖北省中医药研究院) China Academy of Chinese Medical Sciences(中国中医科学院) Xiyuan Hospital(西苑医院) National Clinical Research Center for Chinese Medicine Cardiology(国家中医心血管病临床医学研究中心) Hubei Provincial Clinical Research Center for Acupuncture and Moxibustion in Obesity Treatment(湖北省肥胖病针灸临床研究中心) Hubei Shizhen Laboratory(湖北时珍实验室) Tianjin Ta(天津(此处原文未完整,按原文提取))

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出以症状为中心的LingShu知识图谱,整合多源数据构建混合数据模型,连接中医与现代生物医学,开发集成图可视化等功能的网络平台,为跨医学领域知识关联提供支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20390 2026-08-24 cs.CL cs.AI cs.CY 新提交 62%

Ansari: A Retrieval-Grounded Islamic AI Assistant -- Architecture, Deployment, and Lessons from 140,000 Conversations

Ansari:基于检索的伊斯兰AI助手——架构、部署及14万次对话的经验教训

M Waleed Kadous, Amr Elsayed, Abdullah Al Nahas, Ashraf Haress

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究推出基于检索的伊斯兰AI助手Ansari,其经多平台部署后处理14万次跨语言对话,在IslamicMMLU等基准中表现优异,为信仰敏感型LLM部署提供了经验。

Comments 10 pages, 1 figure, 3 tables. Live system: this https URL (https://askansari.ai). Code: this https URL (https://github.com/ansari-project)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16386 2026-08-24 cs.CL cs.LG 版本更新 62%

Mint-Agent: Introducing Finance-Native Agentic Foundation Models

Mint-Agent:引入金融原生智能体基础模型

Mint-Agent Team, Kun Wang, Gavin Zhang, Yaze Geng, Lei Tang, Yaoyang Yi, Zonghan Wu, Yifan Hu, Qingsong Wen, Yilei Shao

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本研究提出金融原生智能体模型Mint-Agent,通过三大支柱开发出Mint-Cu(9B)和Mint-Ag(27B),在多个金融基准测试中展现出优异的可靠性与可执行性,为可信金融智能提供了新路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20373 2026-08-24 cs.CL 新提交 57%

An ambiguity taxonomy for evaluating large language model performance on clinical registry abstraction: a multi-site prospective study

用于评估大型语言模型在临床登记处抽象任务中性能的歧义分类:一项多中心前瞻性研究

James Matheson, Betsy Castillo, Andrew Y. Shin, David Scheinker

机构 * Carta Healthcare(卡塔医疗) Stanford University School of Medicine(斯坦福大学医学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 本多中心前瞻性研究评估LLM在临床登记处抽象任务中的性能,发现其准确率远低于人类抽象人员,且随问题歧义度和临床推理要求升高而降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10725 2026-08-24 cs.CV cs.SC 版本更新 50%

Rethinking LLM Verification: Evidence Structure, Uncertainty, and Selective Refinement

重新思考大语言模型验证:证据结构、不确定性与选择性优化

Uma Ranjan, Kunal Tilaganji, Aditya Koul, Anurag Mahipal, Dashpreet Singh, Hriday Rana, Manan Jain, Sidharth Gupta, Ajo Babu George, Vineeth Balasubramanian, Nagarajan Natarajan, Amit Sharma

机构 * Indian Institute of Technology Jammu(贾姆穆印度理工学院) Microsoft Research(微软研究院) SCB Dental College and Hospital(SCB牙科学院与医院)

专题命中 其他推理 :reasoning(abstract)

AI总结 该研究针对LLMs医疗应用的安全问题,提出两阶段框架,利用模型弃权信号优化推理,在GPT-5.5、DeepSeek-R1模型及MedReason、MedQA数据集上显著提升了医疗假设验证的准确率。

Comments Withdrawn by the authors due to premature submission before final review

详情

展开后加载摘要…

URL PDF HTML 收藏