arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-24 至 2026-08-24 共收录 94 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 31 篇

2605.01048 2026-08-24 cs.CL cs.LG 版本更新 73%

Compared to What? Baselines and Metrics for Counterfactual Prompting

与什么相比?反事实提示的基线和度量标准

Zihao Yang, Mosh Levy, Yoav Goldberg, Byron C. Wallace

机构 * Northeastern University(东北大学) Bar-Ilan University(巴伊兰大学) Allen Institute for AI(人工智能研究所)

专题命中 推理评测 :CoT(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 本文探讨了反事实提示中基线和度量标准的重要性,指出单纯改变文本因素无法准确评估模型敏感性,提出通过统计检验比较干预差异与改写影响的框架,发现模型对患者性别等的敏感性在考虑一般模型敏感性后显著降低。

Comments Published as a conference paper at COLM 2026. 33 pages, 10 figures, 18 tables. Code: this https URL (https://github.com/redagavin/counterfactual-prompting-baselines); Python package (cfprompt): this https URL (https://github.com/redagavin/cfprompt)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21140 2026-08-24 cs.CV cs.AI 新提交 70%

A Modular Agent for Reliable and Auditable Spatial Relation Verification in CT Scans

用于CT扫描中可靠且可审计的空间关系验证的模块化智能体

Simon Vincent Abel, Heiko Hillenhagen, Michael Götz, Timo Ropinski, Ayhan Can Erdur, Daniel Santak Wolf

机构 * Ulm University(乌尔姆大学) Ulm University Hospital(乌尔姆大学医院) Technical University of Munich (TUM)(慕尼黑工业大学(TUM)) TUM University Hospital(慕尼黑工业大学医院) Department of Radiation Oncology, TUM University Hospital(慕尼黑工业大学医院放射肿瘤科)

专题命中 推理评测 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI

AI总结 针对医学视觉-语言模型空间推理薄弱的问题,提出模块化医学影像智能体,通过分阶段处理实现CT扫描空间关系验证,性能优于端到端基线,可作为未来医学影像智能体的构建块。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20938 2026-08-24 cs.AI 新提交 70%

No Judgment Without a Reason: Counterfactual Receipts for Versioned AI Evaluators

无理由不判断:面向版本化AI评估器的反事实收据

Ye Chen, Weining Zhang

机构 * Alibaba Group(阿里巴巴集团) Cheung Kong Graduate School of Business(长江商学院)

专题命中 推理评测 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI

AI总结 该研究针对AI评估器的推理问责问题,提出反事实收据方法与ReasonBench基准,发现模型标准准确率掩盖鲁棒性缺陷,需解耦预测与认证以实现可信审计。

Comments 26 pages, 11 tables, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18300 2026-08-24 cs.AI 版本更新 70%

The Lifecycle of LLM-as-a-Judge for Large-Scale Recommendation Explanations

用于大规模推荐解释的LLM评判模型的生命周期

Emma Yanyang Kong, JJ Tan, Ishan Gupta, Lars Olds, Claire Campbell, David Fagnan, Ratna Kavuri, Veli Balin, Rohan Gosain, Louis Garcia, Minsu Jang

机构 * Netflix(网飞公司)

专题命中 推理评测 :reasoning(abstract,abstract_cn);分类 cs.AI

AI总结 该研究提出用于Netflix大规模推荐解释评估的LLM评判模型生命周期框架,经五周A/B测试证实,其对齐的解释可提升会员对新颖内容的观看及浏览到播放会话量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20699 2026-08-24 cs.CV 新提交 67%

ArtiMo: Agent-Driven Articulated Mesh Animation

ArtiMo:智能体驱动的关节网格动画

Chunyu Zou, Peng Dai, Yi-Hua Huang, Ze Yuan, Jingwei Huang, Yeming Yao, Xiaojuan Qi

专题命中 推理评测 :reasoning(abstract);planning(abstract)

AI总结 ArtiMo是一种智能体驱动的零样本框架,结合URDF运动学约束与LLMs/VLMs,生成文本引导的关节网格动画,通过视觉自改进机制修正错误,在新基准数据集上优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20418 2026-08-24 q-bio.QM cs.AI cs.LG 新提交 62%

Rigorous Evaluation of Large Language Models for Malaria Drug Discovery: Trade-offs in Performance, Scale, and Resource Utility

用于疟疾药物发现的大型语言模型的严格评估:性能、规模与资源效用之间的权衡

Marvellous O. Ajala (1), Zainab Ashimiyu-Abdusalam (1), Comfort Adesina (1) ((1) Magami Open Sciences Initiative)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本研究构建了Malaria-Instruct数据集,评估了多款开源LLM在疟疾虚拟筛选中的表现,发现微调后的开源LLM性能优于经典ML模型和专有模型,是高效的抗疟药物发现范式。

Comments 12 pages, 4 tables, 2 figures, Ijcai2026 style

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21021 2026-08-24 cs.CL cs.AI cs.NI 新提交 62%

Free-Text Evaluation of LLMs for 5G Domain Knowledge and Fault Analysis using LLM-as-Judge

基于LLM作为评判者的5G领域知识与故障分析大模型自由文本评估

Rishiraj Sengupta, Sotiris Chatzimiltis, Mohammad Shojafar, Xiatian Zhu

机构 * Surrey Institute for People-Centered Artificial Intelligence(萨里以人为本人工智能研究院) Google(谷歌)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文以自由文本格式评估Claude-Haiku-4.5等三个轻量型LLM的5G领域知识与故障分析能力,发现其故障诊断准确率超90%但规范召回不足,Gemini-3.1-Flash-Lite效率最优适合生产部署。

Comments 6pages, 4figures. Accepted for presentation in IEEE CSCN conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20634 2026-08-24 cs.CL cs.AI 新提交 62%

AgentMercury: Your Agent Can Synthesize Verifiable Environments for Business Scenarios at scale

AgentMercury:你的智能体可规模化合成面向业务场景的可验证环境

Minbyul Jeong, Chanwoong Yoon

机构 * Meridian Intelligence Global Inc.(子午线智能全球公司) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出AgentMercury框架,可规模化合成业务场景的可执行环境,经其训练的智能体策略在企业工作流及多领域基准上表现提升,且环境构建过程可通过微调学习优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20574 2026-08-24 cs.AI cs.CY cs.LG cs.SE 新提交 62%

FlavourBench: Ranking Frontier Language Models with Executable Culinary Ground Truth

FlavourBench:基于可执行烹饪基准真值的前沿语言模型排名

Josef Chen, Erim Hayretci

机构 * Imperial College London(帝国理工学院)

专题命中 推理评测 :verifier(abstract);分类 cs.AI、cs.LG

AI总结 FlavourBench是一款自动化语言模型排名基准,以可执行烹饪系统为基准真值,评估27个前沿语言模型,发现Grok 4.6表现最优,可有效消除排行榜差异缺失,结果可靠。

Comments 10 pages, 5 figures. Evaluation of 27 frontier language-model endpoints on 534 identical tasks per model, comprising 14,418 scored model-task cells. Code: this https URL (https://github.com/josefchen/flavourbench) Dataset: this https URL (https://huggingface.co/datasets/josefchen/flavourbench) Interactive leaderboard: this https URL (https://huggingface.co/spaces/josefchen/flavourbench)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20361 2026-08-24 cs.CL cs.AI 新提交 62%

Toward Auto-Research: Mining Falsifiable Research Ideas from Paper Knowledge Graphs with Categorical Structure

迈向自动研究:利用具有分类结构的论文知识图谱挖掘可证伪的研究思路

Yuchen Wang, Zhongzhi Luan

机构 * Sino-German Joint Software Institute(中德软件联合研究所) Beihang University(北京航空航天大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对LLMs构建的自动研究思路生成系统的结构缺陷,提出基于范畴论的三层算法,可高效过滤跨领域研究思路候选,兼具高过滤比与高可证伪率,且支持日志记录。

Comments 18 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20349 2026-08-24 cs.CL cs.AI 新提交 62%

Beyond Prompt Engineering: A Systematic Analysis of Prompt Lexical Sensitivity and Its Impacts on Quality

提示工程之外:提示词词汇敏感性及其对质量影响的系统性分析

Qipeng Xie, Zi Liang, Jiafei Wu, Yufei Chen, Weizheng Wang, Wenao Ma, Zhong Ming, Haiqin Yang, Kaishun Wu

机构 * Shenzhen Technology University(深圳技术大学) The Hong Kong Polytechnic University(香港理工大学) Zhejiang Lab(之江实验室) The Chinese University of Hong Kong(香港中文大学) HKUST (Guangzhou)(香港科技大学(广州))

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对大型语言模型的提示词词汇敏感性开展大规模机制分析,揭示提示词性能稳定性缩放定律,提出自动化提示词优化智能体,可降低代码生成任务性能方差40.7%,为鲁棒提示工程提供可解释框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09748 2026-08-24 cs.DC cs.AI cs.LG cs.LO eess.SY 版本更新 62%

Defining Decentralization: An Ontological Perspective

去中心化的定义:一种本体论视角

Jakub Kacper Szeląg, Aydin Abadi, Mohammad Naseri

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本研究针对计算机领域缺乏通用去中心化定义的问题,提出基于图的本体框架,区分去中心化与分布性,引入两个新指标并实现浏览器工具,为联邦学习等系统提供一致的去中心化评估基础。

Comments 27 pages, 6 figures, preparing for submission, strengthened the formalisms behind ontological claims

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21357 2026-08-24 cs.AI 新提交 57%

VIALS: A Benchmark for Visual Interpretation of Artifacts in the Life Sciences

VIALS:生命科学领域人工产物视觉解释基准

Elaine Lau, Thanuka Udumulla, Lee Izhaki-Tavor, Francisco Guzmán, Nicholas Magazine, Jonas Mueller

机构 * Handshake AI

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究针对生命科学人工产物视觉解释的需求,构建含161项任务的VIALS基准,发现前沿视觉语言模型在该任务上存在领域知识与推理局限,凸显AI需具备此类能力以服务生命科学工作流。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21305 2026-08-24 cs.CV cs.AI 新提交 57%

Re$^3$Cap: Retrieval-Guided Refinement for Image Captioning Enhancement via Reinforcement Learning

Re³Cap:基于强化学习的图像字幕增强的检索引导优化

Haonan Jia, Shichao Dong, Zenghui Sun, Jiawen Zheng, Ziqi Miao, Gege Shi, Qiuyu Zhao, Jinsong Lan, Xiaoyong Zhu, Bo Zheng

机构 * Taobao & Tmall Group of Alibaba(阿里巴巴淘宝和天猫集团) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出Re³Cap方法,利用多模态检索作为推理信号,通过CRS和CQA优化图像字幕,在COCO-LN500基准上关系推理性能较GRPO提升8.64%,优于SFT。

Comments Accepted to EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20975 2026-08-24 cs.AI 新提交 57%

Belief Without Behavior: Measuring the Translation of Theory of Mind into Coordinated Social Action in Vision-Language Models

无行为的信念:测量视觉-语言模型中心智理论到协同社会行动的转化

Tonglin Yan, Gregoire Sergeant-Perthuis, David Rudrauf

机构 * CIAMS, Université Paris-Saclay(巴黎萨克雷大学 CIAMS) CQSB, Sorbonne Université(索邦大学 CQSB)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 该研究提出基准MOSAIC评估视觉-语言模型的心智理论到协同社会行动的转化,发现多数模型存在瓶颈,而带显式ToM模块的PCM-LLM表现优异,证实显式信念-行动耦合的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20851 2026-08-24 cs.SE cs.AI 新提交 57%

BC-Bench: Evaluating Agentic Engineering in a Domain-Specific Language for ERP

BC-Bench:在ERP领域特定语言中评估智能体工程

Haoran Sun, Klaus Marius Hansen

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 该研究推出BC-Bench基准,评估智能体工程在ERP领域DSL(AL)上的表现,发现通用基准的改进未一致迁移到AL,凸显领域特定评估的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20414 2026-08-24 cs.AI cs.CV 新提交 57%

StateSight: Benchmarking Latent Spatial-State Reconstruction in Vision-Language Models

StateSight:评测视觉语言模型中的潜在空间状态重建能力

Michelle Lin

机构 * Thomas Jefferson High School for Science and Technology(托马斯·杰斐逊科学技术高中)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本研究推出StateSight基准及配套数据集StateSight-Steps,评估视觉语言模型的潜在空间状态重建能力,发现GPT-5.5、Claude Sonnet 5的表现均逊于人类基线,格式正确的响应可能掩盖空间结构恢复失败的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23740 2026-08-24 cs.CL 版本更新 57%

ZenGen: Social Mind for LLMs

Zing:大语言模型的社交智能

ZenGen Team, Ao Xiang, Bi Jingping, Chen Jiahui, Chen Lehan, Chen Yilin, Cheng Xueqi, Fan Yixing, Gan Kairong, Gao Haowen, Gao Jinhua, Gao Shuxuan, Gong Chang, Guo Jiafeng, Guo Ruijie, Han Zhouyu, He Guangfu, He Yichun, Jiang Shuo, Jing Shaoling, Jing Ya, Lei Chenhao, Lei Yan, Li Anqi, Li Chengao, Li Haoyu, Li Shitian, Liang Xinjian, Liu Zhaoge, Lyu Xingyu, Nie Zhuwei, Pang Liang, Quan Zeping, Shan Shiguang, Shen Huawei, Tang Xinran, Tian Feng, Wang Qian, Wang Ruiping, Wang Xiaohong, Xia Zaiyu, Xiao Yi, Xu Jiayuan, Xu Kehan, Xu Qianqian, Xu Tianyu, Xu Yongjun, Yang Haoming, Yang Jun, Yao Di, Yu Xiaoming, Zhang Futong, Zhang Jie, Zhang Shixuan, Zhang Yuxuan, Zhao Xinyu, Zhao Zhuoran, Zhong Yunfei, Zhu Shengyu

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 研究大语言模型社交智能,提出Zijing框架,含测量基准SoMBench、训练方法Zing及推理架构Actio,通过实验证明社交智能大语言模型在评估、内化和落地方面需协同发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09885 2026-08-24 cs.CL 版本更新 57%

Index SLM Technical Report

索引SLM技术报告

Tianjiao Li, Lusheng Zhang, Shien He, Xiaojing Liu, Tianxing Yan, Mengran Yu, Ziang Cui, Kai Zhao, Xipeng Wang, Yang Liu, Yuxin Li

机构 * Bilibili(哔哩哔哩)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 哔哩哔哩开发Index-1.9B系列小语言模型,包括基础模型等四个模型。预训练采用特定方法,Index-1.9B-Base在标准基准测试表现出色,还进行了多项控制研究,所有模型及评估代码已公开。

Comments 16 pages, 9 figures. v3: updated author list to add Xipeng Wang

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20004 2026-08-24 cs.DB cs.CL 版本更新 57%

Human-Level Text-to-SQL via Reinforcement Learning on Verified Data, Without Pipeline Engineering

ReViSQL:实现人水平的文本到SQL

Yuxuan Zhu, Tengjun Jin, Yoojin Choi, Daniel Kang

机构 * UIUC(伊利诺伊大学厄巴纳-香槟分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出ReViSQL框架,通过高质量训练数据提升SQL推理能力,首次在BIRD基准上达到人水平准确率,且在不同模型规模下均表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06519 2026-08-24 cs.CL 版本更新 57%

MedRAGChecker: Claim-Level Verification for Biomedical Retrieval-Augmented Generation

MedRAGChecker: 用于生物医学检索增强生成的声明级验证

Yuelyu Ji, Min Gu Kwak, Hang Zhang, Xizhi Wu, Chenyu Li, Yanshan Wang

机构 * University of Pittsburgh(匹兹堡大学)

专题命中 推理评测 :verifier(abstract);分类 cs.CL

AI总结 MedRAGChecker通过声明级验证和诊断框架,提高生物医学RAG生成答案的可靠性与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21133 2026-08-24 cs.CV cs.CR 新提交 50%

Masking Is Not Enough: Generative Restoration for Multimodal De-Identification in Medical AI

仅掩码不足:面向医疗AI的多模态去标识化生成式修复

Shiva Shrestha, Zongxing Xie, Chen Zhao, Liran Ma, Zhipeng Cai, Honghui Xu

机构 * Kennesaw State University(肯尼索州立大学) Miami University(迈阿密大学) Georgia State University(佐治亚州立大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 针对医疗图像-文本数据的PHI泄漏问题,提出端到端多模态净化框架ClinX,结合图像侧生成式修复与文本侧渐进式去标识化,在MedVQA中验证其优于仅OCR掩码的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17474 2026-08-24 eess.AS cs.SD 版本更新 50%

Benchmarking Commercial Speech Recognition and Multimodal Large Language Models on Dysarthric Speech: Severity-Stratified Baselines and Architecture-Specific Prompting Effects

基于商业自动语音识别和多模态大语言模型的口吃语音零样本识别

Ali Alsayegh, Tariq Masood

专题命中 推理评测 :reasoning(abstract)

AI总结 本研究评估了商业ASR和MLLM在口吃语音识别中的性能,发现GPT-4o在重度口吃情况下显著降低WER,而Gemini变体表现下降,为辅助语音接口技术选择提供实证依据。

Comments 32 pages. Revised peer-reviewed version. Updated dataset filtering and transcript normalization, expanded four-condition prompting ablation and error analysis, and revised statistical reporting. Published in International Journal of Intelligent Systems

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他推理 11 篇

2508.08879 2026-08-24 cs.CL cs.AI 版本更新 81%

CulTrace: Tracing Internal Cultural Reasoning in Large Language Models

纠缠于表征:大型语言模型中文化偏见的机制性探究

Haeun Yu, Arnav Arora, Seogyeong Jeong, Nadav Borenstein, Siddhesh Pawar, Jisu Shin, Jiho Jin, Junho Myung, Alice Oh, Isabelle Augenstein

机构 * University of Copenhagen(哥本哈根大学) KAIST(韩国科学技术院)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究提出Culturescope方法,通过机制性可解释性探讨LLMs中文化偏见的来源,揭示低资源文化对文化偏见的抗性及模型参数知识的限制。

Comments 22 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22193 2026-08-24 cs.CL 版本更新 79%

Scale or Reason? A Compute-Equivalent Analysis of Reasoning Distillation

规模还是推理?推理蒸馏的计算等价分析

Nicolas Boizard, Hippolyte Gisserot-Boukhlef, Kevin El Haddad, Céline Hudelot, Pierre Colombo

机构 * Diabolocom Artefact Research Center Equall ISIA Lab, University of Mons(ISIA实验室,蒙斯大学) MICS, CentraleSupélec, Université Paris-Saclay(MICS,CentraleSupélec,巴黎萨克雷大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL

AI总结 通过控制实验,在相同计算预算下比较推理蒸馏与标准指令微调,发现指令微调在多数配置下处于帕累托前沿,而推理蒸馏仅在7B以上开放任务中有效,混合25-50%推理数据可低成本获得大部分收益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21022 2026-08-24 cs.CV cs.MM 新提交 78%

Recognition-Conditioned Reasoning: A Training-Free Multimodal-LLM Pipeline for Fine-Grained Micro-Action Understanding

识别条件推理:一种用于细粒度微动作理解的无训练多模态大语言模型流水线

Fengshun Wang, Jin'ang Han, Zhigang Tu

机构 * Wuhan University(武汉大学)

专题命中 其他推理 :reasoning(title,abstract)

AI总结 该研究提出一种无训练的多模态大语言模型流水线,动态分配子任务至适配的模型,在2026年MAC微动作挑战赛MA-Bench赛道的开放式任务上获显著性能优势,取得第一名。

Comments Accept at ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21296 2026-08-24 cs.MA 新提交 75%

Level-k Distinguishable Mechanisms for Evaluating Bounded Rationality in LLMs

用于评估大型语言模型(LLMs)有限理性的k级可区分机制

Binchi Zhang, Atrisha Sarkar

专题命中 其他推理 :chain-of-thought(abstract,abstract_cn);reasoning(abstract)

AI总结 该研究提出k级可区分机制,通过新型博弈结构评估LLMs的策略深度,发现递归推理下模型策略深度准确,对手博弈的归纳推理会降低性能,明确策略心智化可提升表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21252 2026-08-24 cs.CL cs.AI cs.DB cs.IR 新提交 62%

EnSI-RAG: Entity-Structure-Indexed Retrieval-Augmented Generation for Long-Document Question Answering

EnSI-RAG:面向长文档问答的实体结构索引增强检索生成框架

Xuanyu Meng, Jiashuo Sun, Jash Rajesh Parekh, Jiawei Han

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对长文档问答的RAG方法缺陷,提出EnSI-RAG框架,构建以实体为中心的索引,在Loong和Oolong数据集上平均准确率达78.24,较基准提升6.62个百分点,验证了其有效性。

Comments 21 pages, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21218 2026-08-24 cs.AI cs.CL cs.IR 新提交 62%

Enhancing LLMs in Predictive Political QA with Semi-Structured Data

利用半结构化数据增强大型语言模型(LLMs)在预测性政治问答(QA)中的表现

Yinan Liu, Zihan Zhou, Zichun Jin, Xinyu Wang, Bin Wang, Xiaochun Yang

机构 * School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究针对预测性政治问答任务,提出双视图框架PSL,结合半结构化政治记录提取立场与结构信号,在三个真实数据集及多个LLM上均优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20402 2026-08-24 cs.CL cs.AI 新提交 62%

LingShu: A Large-Scale Symptom-Centric Contextualized Knowledge Graph Bridging Traditional Chinese Medicine and Modern Biomedicine

灵枢(LingShu):连接中医与现代生物医学的大规模以症状为中心的上下文知识图谱

Rui Hua, Zixin Shu, Kai Chang, Dengying Yan, Jianan Xia, Hui Zhu, Shujie Song, Shurui Yang, Tongxin Wang, Yue Yin, Yu Wei, Lijuan Pei, Yunhui Hu, Hao Xu, Mingzhong Xiao, Xiaodong Li, Haibin Yu, Runshun Zhang, Wenjia Wang, Baoyan Liu, Xuezhong Zhou

机构 * Beijing Jiaotong University(北京交通大学) Hubei Provincial Hospital of Traditional Chinese Medicine(湖北省中医院) Hubei University of Chinese Medicine(湖北中医药大学) Hubei Province Academy of Traditional Chinese Medicine(湖北省中医药研究院) China Academy of Chinese Medical Sciences(中国中医科学院) Xiyuan Hospital(西苑医院) National Clinical Research Center for Chinese Medicine Cardiology(国家中医心血管病临床医学研究中心) Hubei Provincial Clinical Research Center for Acupuncture and Moxibustion in Obesity Treatment(湖北省肥胖病针灸临床研究中心) Hubei Shizhen Laboratory(湖北时珍实验室) Tianjin Ta(天津(此处原文未完整,按原文提取))

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出以症状为中心的LingShu知识图谱,整合多源数据构建混合数据模型,连接中医与现代生物医学,开发集成图可视化等功能的网络平台,为跨医学领域知识关联提供支持。

详情

展开后加载摘要…

URL PDF HTML 收藏