arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-13 至 2026-01-13 共收录 149 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 48 篇

2504.14523 2026-01-13 cs.AI 79%

Learning from Reasoning Failures via Synthetic Data Generation

通过合成数据生成学习推理失败

Gabriela Ben Melech Stan, Estelle Aflalo, Avinash Madasu, Vasudev Lal, Phillip Howard

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 通过分析LMM推理失败生成针对性合成数据,提升多模态模型在多个下游任务上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06707 2026-01-13 cs.CL 79%

Evaluating Accounting Reasoning Capabilities of Large Language Models

评估大型语言模型的会计推理能力

Jie Zhou, Xin Chen, Jie Zhang, Hai Li, Jie Wang, Zhe Li

机构 * School of Computer Engineering, Jiangsu Ocean University(计算机工程学院,江苏海洋大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文评估了大型语言模型在会计推理任务中的能力,通过定义垂直领域会计推理标准,分析了GLM和GPT-4等模型的表现,发现提示设计对性能影响显著,但现有模型仍需优化以满足实际需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06234 2026-01-13 cs.AI 79%

PCoKG: Personality-aware Commonsense Reasoning with Debate

PCoKG:具有辩论机制的个性感知常识推理

Weijie Li, Zhongqing Wang, Guodong Zhou

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 PCoKG通过引入辩论机制构建个性感知常识知识图谱,提升对话生成的一致性与个性化水平。

Comments Accept by AAAI-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07280 2026-01-13 cs.CL 70%

ReasonTabQA: A Comprehensive Benchmark for Table Question Answering from Real World Industrial Scenarios

ReasonTabQA: 一个全面的表格问题回答基准,用于现实世界工业场景

Changzai Pan, Jie Zhang, Kaiwen Wei, Chenshuo Pan, Yu Zhao, Jingwang Huang, Jian Yang, Zhenhe Wu, Haoyang Zeng, Xiaoyan Gu, Weichao Sun, Yanbo Zhai, Yujie Mao, Zhuoru Jiang, Jiang Zhong, Shuangyong Song, Yongxiang Li, Zhongjiang He

机构 * Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究所) Chongqing University(重庆大学) Beihang University(北京航空航天大学)

专题命中 推理评测 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL

AI总结 ReasonTabQA是一个针对现实工业场景的表格问题回答基准,通过引入TabCodeRL强化学习方法提升模型推理能力,揭示了工业级表格问答的复杂性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18951 2026-01-13 cs.CL 70%

BnMMLU: Measuring Massive Multitask Language Understanding in Bengali

BnMMLU:测量孟加拉语大规模多任务语言理解

Saman Sarker Joy, Swakkhar Shatabda

机构 * University of Malaya(马来大学) BRAC University(BRAC大学)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 BnMMLU通过大规模多任务评估孟加拉语语言理解,揭示模型推理和应用能力的不足,并推动多语言NLP发展。

Comments 19 Pages, 10 Tables, 12 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06779 2026-01-13 cs.CR 67%

CyberLLM-FINDS 2025: Instruction-Tuned Fine-tuning of Domain-Specific LLMs with Retrieval-Augmented Generation and Graph Integration for MITRE Evaluation

CyberLLM-FINDS 2025:基于检索增强生成和图集成的领域特定LLM指令微调方法用于MITRE评估

Vasanth Iyer, Leonardo Bobadilla, S. S. Iyengar

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract)

AI总结 本文提出了一种基于检索增强生成和图集成的领域特定LLM微调方法,通过STIX威胁情报实现与MITRE ATT&CK技术的对齐,提升网络安全威胁情报分析的准确性。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06193 2026-01-13 cs.LG cs.AI cs.CL 67%

MLB: A Scenario-Driven Benchmark for Evaluating Large Language Models in Clinical Applications

MLB:面向临床应用的大型语言模型评估场景驱动基准

Qing He, Dongsheng Bi, Jianrong Lu, Minghui Yang, Zixiao Chen, Jiacheng Lu, Jing Chen, Nannan Du, Xiao Cu, Sijing Wu, Peng Xiang, Yinyin Hu, Yi Guo, Chunpu Li, Shaoyang Li, Zhuo Dong, Ming Jiang, Shuai Guo, Liyun Feng, Jin Peng, Jian Wang, Jinjie Gu, Junwei Liu

机构 * Ant Group(蚂蚁集团) Zhejiang University(浙江大学) Health Information Center of Zhejiang Province(浙江省健康信息中心) Peking University(北京大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 MLB基准通过场景驱动的评估方法,评估大型语言模型在临床应用中的表现,揭示模型在结构化任务与患者交互场景间的性能差异。

Comments 11 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06106 2026-01-13 cs.LG cs.AI cs.CL cs.CV cs.MA 67%

Judge Model for Large-scale Multimodality Benchmarks

大规模多模态基准的判断模型

Min-Han Shih, Yu-Hsin Wu, Yu-Wei Chen

机构 * Department of Electrical and Computer Engineering, Viterbi School of Engineering, University of Southern California(电气与计算机工程系,维特比工程学院,南加州大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种多模态判断模型,用于评估多种任务,通过聚合多模态判断并生成诊断反馈,展示了其在多模态AI研究中的应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20166 2026-01-13 eess.AS cs.AI cs.CL cs.LG cs.SD 67%

From Alignment to Advancement: Bootstrapping Audio-Language Alignment with Synthetic Data

从对齐到提升:通过合成数据 bootstrap 音频-语言对齐

Chun-Yi Kuan, Hung-yi Lee

机构 * Graduate Institute of Communication Engineering, National Taiwan University(国立台湾大学通信工程研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出BALSa框架,通过合成数据生成提升音频-语言对齐能力,缓解幻觉问题并增强模型理解与推理性能。

Comments Published in IEEE Transactions on Audio, Speech, and Language Processing (TASLP). Project Website: https://kuan2jiu99.github.io/Balsa

Journal ref IEEE Transactions on Audio, Speech and Language Processing, vol. 33, pp. 4604-4619, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07593 2026-01-13 cs.AR cs.CL cs.LG 62%

GRPO with State Mutations: Improving LLM-Based Hardware Test Plan Generation

GRPO与状态突变:改进基于LLM的硬件测试计划生成

Dimple Vijay Kochar, Nathaniel Pinckney, Guan-Ting Liu, Chia-Tung Ho, Chenhui Deng, Haoxing Ren, Brucek Khailany

机构 * Electrical Engineering and Computer Science, Massachusetts Institute of Technology, Cambridge, MA(麻省理工学院电子工程与计算机科学系) NVIDIA Research, Austin, TX(NVIDIA研究部) NVIDIA Research, Taiwan(NVIDIA台湾研究部) NVIDIA Research, Santa Clara, CA(NVIDIA圣克拉拉研究部)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 GRPO-SMu通过改进LLM训练方法,显著提升硬件验证中测试计划生成的准确率和突变检测率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07316 2026-01-13 cs.LG cs.AI 62%

BEAT-Net: Injecting Biomimetic Spatio-Temporal Priors for Interpretable ECG Classification

BEAT-Net:注入生物仿生时空先验以实现可解释的ECG分类

Runze Ma, Caizhi Liao

机构 * School of Information Technology(信息科技学院) Monash University Malaysia(墨尔本大学马来西亚分校) Faculty of Biomedical Engineering(生物医学工程学院) Shenzhen University of Advanced Technology(深圳先进技术大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 BEAT-Net通过生物仿生时空先验实现ECG分类的可解释性与高效性

Comments 8 pages, 4 figures and 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07192 2026-01-13 cs.CL cs.AI 62%

Relink: Constructing Query-Driven Evidence Graph On-the-Fly for GraphRAG

Relink:为GraphRAG构建查询驱动的证据图谱

Manzong Huang, Chenyang Bu, Yi He, Xingrui Zhuo, Xindong Wu

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 Relink通过动态构建查询驱动的证据图谱,解决GraphRAG中知识图谱不完整和干扰事实的问题,提升问答性能。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07153 2026-01-13 cs.CL cs.AI 62%

Can Large Language Models Understand, Reason About, and Generate Code-Switched Text?

大语言模型能否理解、推理并生成混合语言文本?

Genta Indra Winata, David Anugraha, Patrick Amadeus Irawan, Anirban Das, Haneul Yoo, Paresh Dashore, Shreyas Kulkarni, Ruochen Zhang, Haruki Sakajo, Frederikus Hudi, Anaelia Ovalle, Syrielle Montariol, Felix Gaschi, Michael Anugraha, Rutuj Ravindra Puranik, Zawad Hayat Ahmed, Adril Putra Merin, Emmanuele Chersoni

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文通过CodeMixQA基准测试评估大语言模型在理解、推理和生成混合语言文本方面的能力,揭示了模型在混合语言环境中的局限性,并提供了改进多语言LLMs的见解。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06937 2026-01-13 cs.AI cs.LG 62%

mind_call: A Dataset for Mental Health Function Calling with Large Language Models

mind_call: 一个用于大语言模型心理健康新功能调用的数据集

Fozle Rabbi Shafi, M. Anwar Hossain, Salimur Choudhury

机构 * School of Computing, Queen’s University Kingston(计算学院,女王大学金斯顿)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 mind_call数据集通过合成功能调用任务,为大语言模型在心理健康领域的应用提供支持,涵盖多种自然语言查询与标准化API调用的映射,促进意图识别和可靠功能调用的研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06750 2026-01-13 cs.CV cs.AI cs.CL 62%

Benchmarking Egocentric Clinical Intent Understanding Capability for Medical Multimodal Large Language Models

医疗多模态大语言模型的视点临床意图理解能力基准测试

Shaonan Liu, Guo Yu, Xiaoling Luo, Shiyi Zheng, Wenting Chen, Jie Liu, Linlin Shen

机构 * Shenzhen University(深圳大学) Stanford University(斯坦福大学) City University of Hong Kong(香港城市大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MedGaze-Bench,首个评估医疗多模态大语言模型视点临床意图理解能力的基准测试,通过三维意图框架和陷阱QA机制,揭示现有模型在手术、急救和诊断任务中对意图理解的不足。

Comments 16 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06636 2026-01-13 cs.CL cs.AI 62%

MedEinst: Benchmarking the Einstellung Effect in Medical LLMs through Counterfactual Differential Diagnosis

MedEinst:通过反事实差异诊断基准测试医疗大语言模型中的Einstellung效应

Wenting Chen, Zhongrui Zhu, Guolin Huang, Wenxuan Wang

机构 * Stanford University(斯坦福大学) Xi’an Jiaotong University(西安交通大学) Shenzhen University(深圳大学) Renmin University of China(中国人民大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 MedEinst通过反事实差异诊断基准测试,揭示医疗大语言模型中的Einstellung效应,并提出ECR-Agent提升循证医学标准。

Comments 19 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06151 2026-01-13 cs.LG cs.CL 62%

PromptPort: A Reliability Layer for Cross-Model Structured Extraction

PromptPort:跨模型结构提取的可靠性层

Varun Kotte

专题命中 推理评测 :verifier(abstract);分类 cs.CL、cs.LG

AI总结 PromptPort通过结合确定性规范化与轻量级验证器和安全覆盖策略,解决跨模型结构提取中的格式坍塌问题,提升输出可靠性与语义能力。

Comments 12 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07638 2026-01-13 cs.AI 57%

SALT-KG: A Benchmark for Semantics-Aware Learning on Enterprise Tables

SALT-KG:一个面向企业表格的语义感知学习基准

Isaiah Onando Mulang, Felix Sasaki, Tassilo Klein, Jonas Kolk, Nikolay Grechanov, Johannes Hoffart

机构 * SAP SE(SAP股份有限公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 SALT-KG是一个面向企业表格的语义感知学习基准,通过链接元数据知识图与多表事务数据,评估模型在表格证据和上下文语义上推理的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07239 2026-01-13 cs.AI 57%

Stochastic CHAOS: Why Deterministic Inference Kills, and Distributional Variability Is the Heartbeat of Artifical Cognition

随机CHAOS:为何确定性推断会杀死,而分布性变化是人工认知的心跳

Tanmay Joshi, Shourya Aggarwal, Anusa Saha, Aadi Pandey, Shreyash Dhoot, Vighnesh Rai, Raxit Goswami, Aman Chadha, Vinija Jain, Amitava Das

机构 * Raapid Lab, USA(美国Raapid实验室) Apple, USA(美国苹果公司) Google, USA(美国谷歌公司) Pragya Lab, BITS Pilani Goa, India(印度BITS Pilani Goa大学Pragya实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文主张随机CHAOS,认为确定性推断会压制LLM的不确定性建模和安全对齐,强调分布性变化对人工认知的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07185 2026-01-13 cs.CR cs.AI 57%

Defenses Against Prompt Attacks Learn Surface Heuristics

对抗提示攻击的防御学习表面启发式

Shawn Li, Chenxiao Yu, Zhiyu Ni, Hao Li, Charith Peris, Chaowei Xiao, Yue Zhao

机构 * University of Southern California(南加州大学) University of California, Berkeley(加州大学伯克利分校) Washington University in St. Louis(圣路易斯华盛顿大学) Amazon(亚马逊公司) Johns Hopkins University(约翰霍普金斯大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文研究了对抗提示攻击防御中表面启发式的问题,发现现有方法易受表面模式影响,提出受控数据集和系统评估以揭示监督微调的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07019 2026-01-13 cs.CR cs.AI cs.SE 57%

Zer0n: An AI-Assisted Vulnerability Discovery and Blockchain-Backed Integrity Framework

Zer0n:一种结合人工智能的漏洞发现与区块链保障完整性框架

Harshil Parmar, Pushti Vyas, Prayers Khristi, Priyank Panchal

机构 * Parul University(帕鲁大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 Zer0n通过结合AI与区块链技术,实现高效漏洞检测与完整性保障,达到80%的准确率并保持低开销。

Comments 10 pages, 3 figures, 7 tables. Framework for AI-Assisted Vulnerability Discovery

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06944 2026-01-13 cs.CV cs.AI 57%

SketchJudge: A Diagnostic Benchmark for Grading Hand-drawn Diagrams with Multimodal Large Language Models

SketchJudge: 一种用于用多模态大语言模型评分手绘图的诊断基准

Yuhang Su, Mei Wang, Yaoyao Zhong, Guozhang Li, Shixing Li, Yihan Feng, Hua Huang

机构 * School of Artificial Intelligence, Beijing Normal University(人工智能学院,北京师范大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 SketchJudge是一个用于评估多模态大语言模型在评分手绘图任务中诊断能力的基准,通过1015份手绘学生回答验证了当前视觉-语言对齐在符号和嘈杂环境中的脆弱性。

Comments 8 pages for the main text (excluding references and the limitations section); 37 pages in total including appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07403 2026-01-13 cs.CL 57%

LongEmotion: Measuring Emotional Intelligence of Large Language Models in Long-Context Interaction

LongEmotion: 测量大语言模型在长上下文交互中的情感智能

Weichu Liu, Jing Xiong, Yuxuan Hu, Zixuan Li, Minghuan Tan, Ningning Mao, Hui Shen, Wendong Xu, Chaofan Tao, Min Yang, Chengming Li, Lingpeng Kong, Ngai Wong

机构 * Shenzhen MSU-BIT University(深圳MSU-BIT大学) The University of Hong Kong(香港大学) City University of Hong Kong(香港城市大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究所) Beijing Normal University(北京师范大学) University of Michigan, Ann Arbor(密歇根大学安娜堡分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 LongEmotion是一个评估大语言模型在长上下文交互中情感智能的基准,通过多任务和协作框架提升模型在情绪识别与共情生成中的表现。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08997 2026-01-13 cs.AI 57%

Intrinsic Memory Agents: Heterogeneous Multi-Agent LLM Systems through Structured Contextual Memory

内在记忆代理:通过结构化上下文记忆实现异构多代理LLM系统

Sizhe Yuen, Francisco Gomez Medina, Ting Su, Yali Du, Adam J. Sobey

机构 * The Alan Turing Institute(艾伦·图灵研究所) King’s College London(伦敦大学国王学院) University of Southampton(南安普顿大学)

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 本文提出内在记忆代理,通过结构化上下文记忆提升多代理LLM系统在复杂任务中的表现,展现更高的设计质量和一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06640 2026-01-13 cs.AI cs.NI 57%

Agentic AI Empowered Intent-Based Networking for 6G

基于代理AI的意图驱动网络用于6G

Genze Jiang, Kezhi Wang, Xiaomin Chen, Yizhou Huang

机构 * Department of Computer Science, Brunel University London, UK(布伦埃尔大学伦敦计算机科学系) Department of Computer Science, University of Reading, UK(阅读大学计算机科学系)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出基于多代理框架的意图驱动网络方案,通过LLM自主分解意图并生成可行网络配置,提升6G无线网络的自主编排能力。

Comments Submitted for Possible Journal Publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06497 2026-01-13 cs.SE cs.AI 57%

Coding in a Bubble? Evaluating LLMs in Resolving Context Adaptation Bugs During Code Adaptation

在气泡中编码?评估LLMs在代码适应过程中解决上下文适应故障的能力

Tanghaoran Zhang, Xinjun Mao, Shangwen Wang, Yuxin Zhao, Yao Lu, Zezhou Tang, Wenyu Xu, Longfei Sun, Changrong Xie, Kang Yang, Yue Yu

机构 * National University of Defense Technology(国防科技大学) Peng Cheng Laboratory(鹏城实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究提出CtxBugGen框架,评估LLMs在解决代码适应中的上下文适应故障方面的性能,发现LLMs在处理此类问题时存在显著不足。

Comments 24 pages, 11 figures, accepted by FSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06088 2026-01-13 q-fin.ST cs.LG 57%

PriceSeer: Evaluating Large Language Models in Real-Time Stock Prediction

PriceSeer:实时股票预测中大型语言模型的评估

Bohan Liang, Zijian Chen, Qi Jia, Kaiwei Zhang, Kaiyuan Ji, Guangtao Zhai

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) East China Normal University(华东师范大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 PriceSeer通过实时动态数据评估LLMs在股票预测中的性能,提供数据无污染的基准测试及六种先进模型的多时间范围预测分析。

Comments 7 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06039 2026-01-13 cs.CL 57%

Operation Veja: Fixing Fundamental Concepts Missing from Modern Roleplaying Training Paradigms

Operation Veja: 修复现代角色扮演训练范式中缺失的根本概念

Yueze Liu, Ajay Nagi Reddy Kumdam, Ronit Kanjilal, Hao Yang, Yichi Zhang

机构 * Divergence 2% LLC Department of Electrical and Computer Engineering University of Illinois Urbana-Champaign(电气与计算机工程系伊利诺伊大学厄巴纳-香槟分校) Department of Computer Science University of Illinois Urbana-Champaign(计算机科学系伊利诺伊大学厄巴纳-香槟分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 Operation Veja提出VEJA框架,通过整合价值观、经历、判断和能力,改进角色扮演模型的数据整理方法,以提升角色真实性和叙述连续性。

Comments Accepted to NeurIPS 2025 PeronaLLM workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07063 2026-01-13 cs.AI 57%

Towards Safer AI Moderation: Evaluating LLM Moderators Through a Unified Benchmark Dataset and Advocating a Human-First Approach

迈向更安全的AI审核:通过统一基准数据集评估LLM审核员并倡导以人类为中心的方法

Naseem Machlovi, Maryam Saleki, Innocent Ababio, Ruhul Amin

机构 * Fordham University(福特汉姆大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文通过统一基准数据集评估LLM审核性能,提出SafePhi在道德判断上优于现有模型,强调需引入人类反馈提升审核可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12495 2026-01-13 cs.CL 57%

KG-MuLQA: A Framework for KG-based Multi-Level QA Extraction and Long-Context LLM Evaluation

KG-MuLQA:基于知识图谱的多级问答提取与长上下文LLM评估框架

Nikita Tatarinov, Vidhyakshaya Kannan, Haricharana Srinivasa, Arnav Raj, Harpreet Singh Anand, Varun Singh, Aditya Luthra, Ravij Lade, Agam Shah, Sudheer Chava

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 KG-MuLQA通过基于知识图谱的文档表示,实现了多级问答提取与长上下文LLM评估,揭示了模型在集合运算和多跳推理上的系统性失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏