arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10530 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10530 篇

2604.10988 2026-04-14 cs.AI cs.CV 57%

WebForge: Breaking the Realism-Reproducibility-Scalability Trilemma in Browser Agent Benchmark

WebForge: 破解浏览器代理基准测试中的现实性-可重现性-可扩展性三重困境

Peng Yuan, Yuyang Yin, Yuxuan Cai, Zheng Wei

机构 * Tencent BAC(腾讯BAC) Tsinghua University(清华大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 WebForge通过四阶段流程生成自包含的网页环境,解决基准测试中的现实性、可重现性和可扩展性矛盾,构建包含934个任务的基准测试集,揭示多维评估对模型能力的深入刻画。

Comments 14 pages, 6 figures, 6 tables, plus 29-page supplementary. Code: https://github.com/yuandaxia2001/WebForge Dataset: https://huggingface.co/datasets/yuandaxia/WebForge

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10787 2026-04-14 cs.CL 57%

When Meaning Isn't Literal: Exploring Idiomatic Meaning Across Languages and Modalities

当意义不再字面化:探索跨语言和模态的隐喻意义

Sarmistha Das, Shreyas Guha, Suvrayan Bandyopadhyay, Salisa Phosit, Kitsuchart Pasupa, Sriparna Saha

机构 * Indian Institute of Technology Patna(印度理工学院巴特那分校) King Mongkut's Institute of Technology Ladkrabang(国王科技大学拉卡邦分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出Mediom多语言多模态隐喻语料库及HIDE框架,通过系统性测试揭示语言模型在隐喻理解上的缺陷,并为下一代AI系统提供文化根基的隐喻理解方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10718 2026-04-14 cs.AI 57%

SciPredict: Can LLMs Predict the Outcomes of Scientific Experiments in Natural Sciences?

SciPredict: LLMs能否预测自然科学中的实验结果?

Udari Madhushani Sehwag, Elaine Lau, Haniyeh Ehsani Oskouie, Shayan Shabihi, Erich Liang, Andrea Toledo, Guillermo Mangialardi, Sergio Fonrouge, Ed-Yeremai Hernandez Cardona, Paula Vergara, Utkarsh Tyagi, Chen Bo Calvin Zhang, Pavi Bhatter, Nicholas Johnson, Furong Huang, Ernesto Gabriel Hernandez Montoya, Bing Liu

机构 * Scale AI University of California, Los Angeles(加州大学洛杉矶分校) University of Maryland(马里兰大学) Princeton University(普林斯顿大学) Human Frontier Collective(人类前沿集体)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 SciPredict通过405个实验任务评估LLM预测科学实验结果的准确性,发现模型表现低于人类专家,且无法区分可靠与不可靠的预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05767 2026-04-14 cs.CV cs.CL 57%

Beyond the Beep: Scalable Collision Anticipation and Real-Time Explainability with BADAS-2.0

超越蜂鸣声:通过BADAS-2.0实现可扩展的碰撞预测与实时可解释性

Roni Goldshmidt, Hamish Scott, Lorenzo Niccolini, Hernan Matzner

机构 * Nexar AI

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 BADAS-2.0在长尾基准、知识蒸馏和可解释性三方面提升,通过大规模数据集扩展和轻量模型部署实现实时碰撞预测与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15481 2026-04-14 cs.LG 57%

LLM-as-Judge on a Budget

在预算限制下的人工智能语言模型作为裁判

Aadirupa Saha, Aniket Wagde, Branislav Kveton

机构 * UIC(伊利诺伊大学芝加哥分校) Adobe

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文提出一种基于多臂老虎机理论的变异性自适应方法,用于在有限预算下优化对提示-响应对的查询分配,以最小化评估误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14698 2026-04-14 cs.CL 57%

ClaimDB: A Fact Verification Benchmark over Large Structured Data

ClaimDB: 一个基于大规模结构化数据的事实验证基准

Michael Theologitis, Preetam Prabhu Srikar Dammu, Chirag Shah, Dan Suciu

机构 * University of Washington(华盛顿大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出ClaimDB基准,通过百万级记录和多表组合验证事实,发现传统阅读方法失效,需转向可执行程序推理,实验显示超过一半模型准确率低于55%。

Comments ACL 2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04932 2026-04-14 cs.CL 57%

GenProve: Learning to Generate Text with Fine-Grained Provenance

GenProve:学习生成文本的细粒度溯源

Jingxuan Wei, Xingyue Wang, Yanghaoyu Liao, Jie Dong, Yuchen Liu, Caijun Jia, Bihui Yu, Junnan Zhu

机构 * Key Laboratory of Computing Power Network and Information Security, Ministry of Education, Shandong Computer Science Center (National Supercomputer Center in Jinan), Qilu University of Technology (Shandong Academy of Sciences)(计算能力网络与信息安全教育部重点实验室,山东省计算中心(国家超级计算济南中心),齐鲁工业大学(山东省科学院)) Shenyang Institute of Computing Technology, Chinese Academy of Sciences(中国科学院沈阳计算技术研究所) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统实验室) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出GenProve框架,通过结合监督微调与组相对策略优化,提升生成文本的准确性和细粒度溯源能力,优于14个强LLM。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10297 2026-04-14 cs.CV cs.AI 57%

FashionMV: Product-Level Composed Image Retrieval with Multi-View Fashion Data

FashionMV:基于多视角时尚数据的产品级复合图像检索

Peng Yuan, Bingyin Mei, Hui Zhang

机构 * Tsinghua University(清华大学)

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出FashionMV,首个大规模多视角时尚数据集,用于产品级复合图像检索。通过构建包含127K产品、472K多视角图像和220K三元组的数据集,结合ProCIR框架,采用多阶段对话、标题对齐和思维链引导等机制,提升了检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09952 2026-04-14 cs.LG 57%

SLM Finetuning for Natural Language to Domain Specific Code Generation in Production

为生产环境中的自然语言到领域特定代码生成进行SLM微调

Renjini R. Nair, Damian K. Kowalczyk, Marco Gaudesi, Chhaya Methani

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文研究了通过微调小型语言模型提升自然语言到领域代码生成的性能与效率,展示了在生产环境中优于大模型的延迟和成本效益。

Comments 11 pages (including appendix), 5 tables, 1 figure. Submitted to arXiv as a preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09889 2026-04-14 cs.AI 57%

In-situ process monitoring for defect detection in wire-arc additive manufacturing: an agentic AI approach

现场过程监控用于焊接电弧增材制造中的缺陷检测:一种基于代理的AI方法

Pallock Halder, Satyajit Mojumder

机构 * School of Mechanical and Materials Engineering, Washington State University(华盛顿州立大学机械与材料工程学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出基于代理的AI框架,用于现场过程监控以检测焊接电弧增材制造中的缺陷。通过开发处理和监控代理,结合真实数据和分类工具,实现高准确率的缺陷检测。

Comments 42 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09644 2026-04-14 cs.CY cs.AI 57%

Detecting Corporate AI-Washing via Cross-Modal Semantic Inconsistency Learning

通过跨模态语义不一致性学习检测企业AI洗钱

Zhanjie Wen, Jingqiao Guo

机构 * School of Economics and Trade, Guangdong University of Finance(广东金融学院经济贸易学院) Department of Computer Science, Faculty of Science, Hong Kong Baptist University(香港浸会大学理学院计算机科学系)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出AWASH框架,通过跨模态主张-证据推理检测企业AI洗钱,利用AW-Bench基准测试,实现高准确率的AI能力识别。

Comments 28 pages, 6 figures, Journal Submission (Finance/Accounting & Computer Science Interdiscipline), 6 tables, 40 references, trimodal benchmark (88,412 firm-quarter observations) and end-to-end multimodal detection framework for corporate AI-washing

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22887 2026-04-14 cs.CL 57%

Infusing Theory of Mind into Socially Intelligent LLM Agents

将心智理论融入社交智能的大语言模型代理

EunJeong Hwang, Yuwei Yin, Giuseppe Carenini, Peter West, Vered Shwartz

机构 * University of British Columbia(不列颠哥伦比亚大学) Vector Institute for AI(向量人工智能研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出ToMAgent,通过结合心智理论与对话前瞻训练,提升对话效果和目标达成能力,实验表明其在社交交互评估基准中优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09514 2026-04-13 cs.CL cs.HC 57%

Many Ways to Be Fake: Benchmarking Fake News Detection Under Strategy-Driven AI Generation

多种方式的虚假:在策略驱动的人工智能生成下评估虚假新闻检测

Xinyu Wang, Sai Koneru, Wenbo Zhang, Wenliang Zheng, Saksham Ranjan, Sarah Rajtmajer

机构 * Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出MANYFAKE基准,通过多种策略驱动的提示管道生成6798篇虚假新闻文章,评估了先进检测器在处理混合真相案例时的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09360 2026-04-13 cs.SE cs.AI 57%

LLM-Rosetta: A Hub-and-Spoke Intermediate Representation for Cross-Provider LLM API Translation

LLM-Rosetta: 一个用于跨提供商LLM API翻译的枢纽-辐射中间表示

Peng Ding

机构 * University of Chicago(芝加哥大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 LLM-Rosetta通过枢纽-辐射中间表示捕捉共享语义核心,实现跨提供商LLM API双向转换,支持流式传输和状态管理,覆盖主要商业提供商,具备高效率和中立性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07720 2026-04-13 cs.AI 57%

Towards Knowledgeable Deep Research: Framework and Benchmark

走向知识导向的深度研究:框架与基准

Wenxuan Liu, Zixuan Li, Long Bai, Chunmao Zhang, Fenghui Zhang, Zhuo Chen, Wei Li, Yuxin Zuo, Fei Wang, Bingbing Xu, Xuhui Jiang, Jin Zhang, Xiaolong Jin, Jiafeng Guo, Tat-Seng Chua, Xueqi Cheng

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所人工智能安全国家重点实验室) National University of Singapore(新加坡国立大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出知识导向深度研究(KDR)任务,设计混合知识分析框架(HKA)并构建KDR-Bench基准,通过结构化与非结构化知识生成多模态报告,实验表明HKA在通用和知识导向指标上优于现有方法,且在视觉增强指标上超越Gemini DR代理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09021 2026-04-13 cs.SD cs.AI 57%

Noise-Aware In-Context Learning for Hallucination Mitigation in ALLMs

面向噪声的上下文学习用于ALLMs中的幻觉抑制

Qixuan Huang, Khalid Zaman, Masashi Unoki

机构 * Japan Advanced Institute of Science and Technology(日本先端科学技术大学院大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出噪声感知上下文学习方法,通过构建噪声先验库和引入噪声示例作为上下文先验,减少生成模型的幻觉问题,并建立音频描述任务的幻觉基准,实验表明该方法有效降低幻觉率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08987 2026-04-13 cs.AI 57%

PilotBench: A Benchmark for General Aviation Agents with Safety Constraints

PilotBench:一个具有安全约束的一般航空智能体基准

Yalun Wu, Haotian Liu, Zhoujun Li, Boyang Wang

机构 * School of Computing National University of Singapore China School of Informatics Xiamen University China CESS Beihang University China

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 PilotBench通过对比LLM与传统预报器,评估飞行轨迹和姿态预测,揭示了传统方法在精度上的优势与LLM在指令遵循上的优势,指出LLM在高负荷阶段表现下降,推动混合架构的发展。

Comments Accepted at the 2026 IEEE International Joint Conference on Neural Networks (IJCNN 2026). 6 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08885 2026-04-13 cs.LG 57%

Uncertainty-Aware Transformers: Conformal Prediction for Language Models

具有不确定性的转换器:语言模型的置信预测

Abhiram Vellore, Niraj K. Jha

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文提出CONFIDE框架,通过置信预测提升语言模型的可解释性和准确性,在BERT-tiny上测试准确率提升4.09%,并在资源受限和高风险任务中表现出鲁棒性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08703 2026-04-13 cs.MM cs.DB cs.LG 57%

QoS-QoE Translation with Large Language Model

服务质量-用户体验转换与大语言模型

Yingjie Yu, Mingyuan Wu, Ahmadreza Eslaminia, Lingzhi Zhao, Kaizhuo Yan, Klara Nahrstedt

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文提出服务质量-用户体验转换数据集,利用大语言模型进行双向转换,展示了在连续值和离散标签预测上的强性能,为多媒体质量预测与优化提供基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08597 2026-04-13 cs.DB cs.AI 57%

STIndex: A Context-Aware Multi-Dimensional Spatiotemporal Information Extraction System

STIndex:一种基于上下文的多维时空信息提取系统

Wenxiao Zhang, Yu Liu, Qiang sun, Yihao Ding, Sirui Li, Yanbing Liu, Jin B. Hong, Wei Liu

机构 * The University of Western Australia(西澳大利亚大学) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) University of Chinese Academy of Sciences(中国科学院大学) Murdoch University(莫道克大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 STIndex通过多维时空数据仓库提升无结构数据的提取效率,结合大语言模型实现上下文感知提取,提升时空实体识别精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08454 2026-04-10 cs.LG 57%

Less Approximates More: Harmonizing Performance and Confidence Faithfulness via Hybrid Post-Training for High-Stakes Tasks

少而精:通过混合后训练实现性能与置信度忠实的和谐统一

Haokai Ma, Lee Yan Zhen, Gang Yang, Yunshan Ma, Ee-Chien Chang, Tat-Seng Chua

机构 * National University of Singapore, Singapore(新加坡国立大学) Singapore Management University, Singapore(新加坡管理大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文提出HyTuning框架,通过混合后训练方法在有限监督下提升模型准确性并实现置信度忠实,支持'少而精'的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05674 2026-04-10 cs.CR cs.AI 57%

Towards Effective Offensive Security LLM Agents: Hyperparameter Tuning, LLM as a Judge, and a Lightweight CTF Benchmark

迈向高效的攻击性安全LLM代理:超参数调优、LLM作为裁判以及一个轻量级CTF基准

Minghao Shao, Nanda Rani, Kimberly Milner, Haoran Xi, Meet Udeshi, Saksham Aggarwal, Venkata Sai Charan Putrevu, Sandeep Kumar Shukla, Prashanth Krishnamurthy, Farshad Khorrami, Ramesh Karri, Muhammad Shafique

机构 * New York University(纽约大学) New York University Abu Dhabi(纽约大学阿布扎比分校) Indian Institute of Technology Kanpur(印度理工学院坎普尔分校) International Institute of Information Technology Hyderabad(国际信息技术学院海得拉巴分校)

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 本文系统研究了驱动代理成功的关键因素,提出CTFJudge框架和CTF Competency Index指标,分析超参数对性能的影响,并开放CTFTiny基准供研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07749 2026-04-10 cs.CL 57%

Beyond Social Pressure: Benchmarking Epistemic Attack in Large Language Models

超越社会压力:大型语言模型中知识攻击的基准测试

Steven Au, Sujit Noronha

机构 * Independent Researcher(独立研究员)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出PPT-Bench基准测试,用于评估大型语言模型中的知识攻击,通过不同压力类型测试模型在面对知识、价值观或身份挑战时的一致性与反应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07551 2026-04-10 cs.CR cs.AI 57%

MCP-DPT: A Defense-Placement Taxonomy and Coverage Analysis for Model Context Protocol Security

MCP-DPT:模型上下文协议安全的防御放置分类与覆盖分析

Mehrdad Rostamzadeh, Sidhant Narula, Nahom Birhan, Mohammad Ghasemigol, Daniel Takabi

机构 * Old Dominion University(老道明大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出MCP-DPT框架,分析模型上下文协议的安全性,识别防御点并揭示架构不匹配导致的安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07429 2026-04-10 cs.CV cs.AI cs.HC 57%

GameWorld: Towards Standardized and Verifiable Evaluation of Multimodal Game Agents

GameWorld: 向标准化和可验证的多模态游戏代理评估迈进

Mingyu Ouyang, Siyuan Hu, Kevin Qinghong Lin, Hwee Tou Ng, Mike Zheng Shou

机构 * National University of Singapore(新加坡国立大学) University of Oxford(牛津大学)

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 GameWorld提出一个标准化且可验证的多模态游戏代理评估基准,包含34种游戏和170个任务,通过可验证的指标评估代理能力,揭示了当前代理在视频游戏中与人类能力的差距。

Comments 23 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18472 2026-04-10 cs.AI cs.CV 57%

Cognitive Mismatch in Multimodal Large Language Models for Discrete Symbol Understanding

多模态大语言模型在离散符号理解中的认知不匹配

Yinghui Li, Jiayi Kuang, Peng Xing, Daixian Liu, Yongheng Zhang, Junnan Dong, Shu-Yu Guo, Yangning Li, Qingyu Zhou, Wenhao Jiang, Hai-Tao Zheng, Ying Shen, Liang Lin, Philip S. Yu

机构 * Tsinghua University(清华大学) Sun Yat-sen University(中山大学) Independent Researcher(独立研究员) The Hong Kong Polytechnic University(香港理工大学) Guangdong Laboratory of AI and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳)) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究发现多模态大语言模型在离散符号识别上表现欠佳,而在复杂推理任务上表现较好,揭示了当前系统依赖语言先验而非稳健视觉基础的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06582 2026-04-10 cs.IR cs.AI cs.MA 57%

Agentic SPARQL: Evaluating SPARQL-MCP-powered Intelligent Agents on the Federated KGQA Benchmark

代理SPARQL:在联邦知识图谱问答基准上评估基于SPARQL-MCP的智能代理

Daniel Dobriy, Frederik Bauer, Amr Azzam, Debayan Banerjee, Axel Polleres

机构 * WU Vienna(维也纳经济大学) Leuphana Universität Lüneburg(吕讷堡大学) Complexity Science Hub Vienna(维也纳复杂性科学中心)

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 本文探讨了基于SPARQL-MCP的智能代理在联邦SPARQL查询中的潜力,扩展了知识图谱问答基准,并评估了通过MCP集成SPARQL联邦与LLM代理的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01059 2026-04-10 cs.CL 57%

GroupGPT: A Token-efficient and Privacy-preserving Agentic Framework for Multi-User Chat Assistant

GroupGPT: 一种高效且隐私保护的多用户聊天助手代理框架

Zhuokang Shen, Yifan Wang, Hanyu Chen, Yunhang Shen, Wenxuan Huang, Gaoqi He, Jiao Xie, Rongrong Ji, Shaohui Lin

机构 * East China Normal University(华东师范大学) University of Nottingham Ningbo(宁波诺丁汉大学) Xiamen University(厦门大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 GroupGPT通过边缘-云协作架构实现高效决策,支持多模态输入,减少token使用并保护隐私,通过MUIR基准测试验证其准确性和用户接受度。

Comments 14 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26241 2026-04-10 cs.CV cs.CL 57%

Which Way Does Time Flow? A Psychophysics-Grounded Evaluation for Vision-Language Models

时间如何流逝?基于心理物理学的评估用于视觉-语言模型

Shiho Matta, Lis Kanashiro Pereira, Peitao Han, Fei Cheng, Shigeru Kitazawa

机构 * Kyoto University(京都大学) Center for Information and Neural Networks(信息与神经网络中心) National Institute of Information and Communications Technology(国立信息通信技术研究所) The University of Osaka(大阪大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文通过心理物理学验证的基准测试评估了视觉-语言模型对时间方向的理解能力,发现大多数模型表现接近随机,且在物理不可逆过程和因果手动动作上远低于人类水平。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05524 2026-04-10 cs.CL cs.IR 57%

KEO: Knowledge Extraction on OMIn via Knowledge Graphs and RAG for Safety-Critical Aviation Maintenance

KEO:通过知识图谱和RAG进行OMIn的领域知识提取

Kuangshi Ai, Jonathan A. Karr, Meng Jiang, Nitesh V. Chawla, Chaoli Wang

机构 * University of Notre Dame(圣母大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 KEO通过知识图谱和RAG框架提升航空安全维护中的领域知识提取与推理,实验显示其在全局理解上优于传统文本块RAG,同时保持对细粒度任务的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏