arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32096 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32096 篇

2608.18158 2026-08-20 cs.CL cs.AI 新提交 88%

When Do LLMs Actually Help? Evaluating LLMs as Data Quality Annotators

大语言模型(LLM)何时真正有用?评估LLM作为数据质量标注者的表现

Praphulla Lal Shrestha

专题命中 评测与基准 :LLM(title_cn,summary_cn);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本研究对比测试LLM与基于规则方法在两项电商数据质量任务中的表现,发现LLM在需背景知识的任务中更具优势,且判断高度一致,小型样本提示评估可能存在误导。

Comments 6 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05177 2026-08-18 cs.CL cs.AI eess.AS 版本更新 88%

MCBench: A Multicontext Safety Assessment Benchmark for Omni Large Language Models

MCBench:面向全能大语言模型的多上下文安全评估基准

Manh Luong, Tamas Abraham, Junae Kim, Amar Kaur, Rollin Omari, Gholamreza Haffari, Trang Vu, Lizhen Qu, Dinh Phung

机构 * Monash University(墨尔本大学) Defence Science and Technology Group(国防科学与技术集团)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 针对现有多模态安全基准仅处理视觉输入的局限,提出MCBench基准,包含1196个跨四类安全场景的测试,要求整合多模态信息进行安全评估,揭示当前全能大语言模型在跨模态安全推理上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.00890 2026-08-18 econ.EM cs.CL cs.LG 版本更新 88%

Macroeconomic Forecasting with Large Language Models

基于大型语言模型的宏观经济预测

Andrea Carriero, Davide Pettenuzzo, Shubhranshu Shekhar

机构 * School of Economics and Finance, Queen Mary University of London(伦敦大学女王学院经济与金融学院) School of Business and Economics, Brandeis University(布兰迪大学商学院与经济学学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文以FRED-MD数据库为基础,对比评估大型语言模型与传统宏观时间序列预测方法的准确性,明确了LLMs在宏观经济预测中的优劣势及现实适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14107 2026-08-18 cs.CL cs.AI 版本更新 88%

DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models

DiagnosisArena:面向大型语言模型的诊断推理基准测试

Yakun Zhu, Zhongzhen Huang, Linjie Mu, Yutong Huang, Wei Nie, Jiaji Liu, Shaoting Zhang, Pengfei Liu, Xiaofan Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) SII SPIRAL Lab(SPIRAL实验室) Generative AI Research Lab (GAIR)(生成式AI研究实验室) Shanghai Chest Hospital(上海胸科医院) Beijing Anzhen Hospital, Capital Medical University(北京安贞医院,首都医科大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究提出DiagnosisArena基准,评估大型语言模型的临床诊断推理能力,发现顶尖模型准确率仅最高51.12%,凸显其泛化瓶颈,旨在推动AI诊断推理进步。

Comments Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12342 2026-08-14 cs.CL cs.LG 新提交 88%

Are Large Language Models Reliable Reviewers? A Benchmark for Error Detection in Financial Documents

大语言模型是可靠的评审者吗?面向金融文档错误检测的基准测试

Ying He, Zhouhong Gu, Zhecheng Hu, Yubo Zhou, Hao Shen, Jiaqing Liang, Zhaoqian Dai, Shuguang Ma, Fei Yu, Yanghua Xiao, Zhixu Li

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) School of Data Science, Fudan University(复旦大学数据科学学院) Ant Group(蚂蚁集团) School of Information and School of Smart Governance, Renmin University of China(中国人民大学信息学院与智慧治理学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文构建首个金融错误检测基准FinED-Bench,评估发现当前LLMs难胜任高复杂度金融文档错误检测任务,监督微调可提升弱模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17244 2026-08-13 cs.CL cs.AI 版本更新 88%

DORA Explorer: Improving the Exploration Ability of LLMs Without Training

DORA Explorer: 无需训练提升大语言模型的探索能力

Priya Gurjar, Md Farhan Ishmam, Kenneth Marino

机构 * Kahlert School of Computing, University of Utah(犹他大学计算学院Kahlert学院)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出DORA Explorer框架,通过生成多样化动作候选并利用token log-probabilities评分,提升LLM在序列决策任务中的探索能力,实验显示在MAB和TALES环境中性能显著提升。

Comments 17 pages, 6 Figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06227 2026-08-12 cs.CL cs.LG 版本更新 88%

Automated Data Enrichment using Confidence-Aware Fine-Grained Debate among Open-Source LLMs for Mental Health and Online Safety

基于开源LLM的自信意识细粒度辩论用于心理健康和在线安全的自动化数据增强

Junyu Mao, Anthony Hills, Talia Tseriotou, Maria Liakata, Aya Shamir, Dan Sayda, Dana Atzil-Slonim, Natalie Djohari, Pamela Ugwudike, Mahesan Niranjan, Stuart E. Middleton

机构 * University of Southampton, UK(英国南安普顿大学) Queen Mary University of London, UK(伦敦大学玛丽女王学院) The Alan Turing Institute, UK(阿兰·图灵研究所) Bar Ilan University, Israel(巴伊兰大学)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本研究提出CFD框架,利用开源LLM的细粒度辩论实现心理健康和在线安全领域的自动化数据增强,通过实验验证其在多标签增强任务中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08652 2026-08-11 cs.LG cs.AI 新提交 88%

LegoLM: Structured Weight Sharing for Large Language Models

LegoLM:面向大语言模型的结构化权重共享压缩框架

Joseph Bingham

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 LegoLM针对大语言模型全局权重共享的两种失效模式,提出三种无数据适配策略,在GPT-2 small和Mistral-7B上实现优于PTQ-8bit的压缩效果与精度,证实选择性替换是核心机制。

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07535 2026-08-11 cs.LG cs.AI cs.CY 新提交 88%

Evolving Safety Landscape of Multi-modal Large Language Models: A Survey of Emerging Threats and Safeguards

多模态大语言模型的演进安全态势:新兴威胁与防护措施综述

Xi Li, Shu Zhao, Xiaohan Zou, Fei Zhao, Fuxiao Liu, Yusen Zhang, Cheng Han, Yushun Dong, Jiaqi Wang

机构 * University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) NVIDIA(英伟达公司) Penn State University(宾夕法尼亚州立大学) Columbia University(哥伦比亚大学) University of Missouri-Kansas City(密苏里大学堪萨斯分校) Florida State University(佛罗里达州立大学) Auburn University(奥本大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本综述针对多模态大语言模型(MLLMs)的新型安全威胁,提出多模态安全威胁分类法,梳理安全策略进展,探讨未来安全机制的研究方向。

Comments Accepted at the ICLR 2026 Workshop on Principled Design for Trustworthy AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03750 2026-08-07 cs.CR cs.AI cs.CL 版本更新 88%

CREBench: Evaluating Large Language Models in Cryptographic Binary Reverse Engineering

CREBench:评估大语言模型在密码二进制逆向工程中的能力

Baicheng Chen, Yu Wang, Ziheng Zhou, Xiangru Liu, Juanru Li, Yilei Chen, Tianxing He

机构 * Shanghai Qi Zhi Institute(上海期智研究院) Institute of Interdisciplinary Information Sciences, Tsinghua University(清华大学交叉信息研究院) Xiongan AI Institute(雄安人工智能研究院) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) East China Normal University(华东师范大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出CREBench基准,通过432个基于密码算法的挑战评估大语言模型在密码二进制逆向工程中的性能,发现GPT-5.4在该任务中表现优异,人类专家仍具优势。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20351 2026-08-07 cs.CL cs.AI 版本更新 88%

When Large Language Models Know the Table: A Framework for Assessing Data Contamination in Tabular Datasets

评估大型语言模型中公共表格数据集的潜在知识

Matteo Silvestri, Fabiano Veglianti, Flavio Giorgi, Fabrizio Silvestri, Gabriele Tolomei

机构 * Sapienza University of Rome(罗马大学) tellmewAI

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出评估表格数据集污染的框架,通过生成控制查询和比较评估,发现四个数据集中存在污染,影响下游任务性能可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16217 2026-08-05 cs.CL cs.AI 版本更新 88%

ChiEngMixBench: Evaluating Large Language Models on Expert-Style Chinese-English Terminology Mixing

ChiEngMixBench: 评估大型语言模型在自发和自然的中英混合生成中的能力

Qingyan Yang, Tongxi Wang, Yunsheng Luo

机构 * School of Future Technology(未来技术学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 ChiEngMixBench通过评估中英混合生成的自发性和自然性,揭示多语言模型与人类交流的结构化认知对齐

Comments 15 pages, 2 figures, 8 tables. Substantially revised version

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15412 2026-08-04 cs.CL cs.AI 版本更新 88%

Few-Shot Biomedical Relation Extraction with Large Language Models: A Viable Alternative to Supervised Learning?

基于大语言模型的少样本生物医学关系抽取:监督学习的可行替代方案?

Jakob Mraz, Tomaž Curk, Blaž Zupan

机构 * University of Ljubljana(卢布尔雅那大学) Baylor College of Medicine(贝勒医学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究利用大语言模型进行少样本生物医学关系抽取,比较成对分类与联合生成两种方法,发现联合生成更精确高效,在宏F1上超越监督基线,尤其在稀有关系类型上表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06996 2026-08-04 cs.CL cs.AI 版本更新 88%

Self-Preference Bias in Rubric-Based Evaluation of Large Language Models

基于评分标准的大型语言模型评估中的自我偏好偏差

José Pombal, Ricardo Rei, André F. T. Martins

机构 * Sword Health TransPerfect ELLIS Unit Lisbon(ELLIS 里斯本分部)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 研究探讨了基于评分标准的评估中自我偏好偏差对模型评估的影响,发现即使评分标准客观,自我偏好仍会导致评分偏差,且通过多评委ensemble可部分缓解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05792 2026-07-28 cs.AI cs.LG cs.LO cs.SE 88%

Can LLMs Write Correct TLA+ Specifications? Evaluating Natural-Language-to-TLA+ Generation

LLM 能写出正确的 TLA+ 规范吗?自然语言到 TLA+ 生成的评估

Arslan Bisharat, Brian Ortiz, Eric Spencer, Khushboo Bhadauria, TaiNing Wang, George K. Thiruvathukal, Konstantin Laufer, Mohammed Abuhamad

机构 * Department of Computer Science, Loyola University Chicago(洛约奈大学芝加哥分校计算机科学系)

专题命中 评测与基准 :LLM(title_cn,summary_cn);prompting(abstract);分类 cs.AI、cs.LG

AI总结 本文首次系统评估基于 LLM 从自然语言合成 TLA+ 规范的能力,发现模型在语义正确性上仅达 8.6%,且成功依赖于渐进式提示,揭示了模型大小与质量无关、代码专用模型表现不佳等关键发现。

Comments 12 pages, 11 tables. Accepted at the 21st International Conference on Software Technologies (ICSOFT 2026); Recommended as Best Paper Award Candidate

Journal ref ICSOFT 2026, pp. 39-50, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20476 2026-07-24 cs.AI cs.CL 新提交 88%

Benchmarking Large Language Models on Multi-Sensor Physical Hazard Assessment

在多传感器物理危害评估中对大语言模型进行基准测试

Faizan Iqbal

机构 * Lovely Professional University(可爱专业大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究五个大语言模型对多传感器物理危害数据的评估,通过1800次API调用测试60个场景,发现模型在多传感器场景表现不佳,单传感器场景表现良好,且结构化表格格式优势不明显,为从业者提供了模型应用参考。

Comments 14 pages, 6 figures. Benchmark dataset, evaluation code, and raw results publicly available at: https://github.com/Faizaniqbal52/PhysicalHazardBenchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20454 2026-07-24 cs.CL cs.AI 新提交 88%

Response drift across frontier large language models

前沿大语言模型中的响应漂移

Mohammed Aledhari, Ali Aledhari, Fatimah Aledhari, Gowtham Venkat Eathamokkala, Mohamed Rahouti

机构 * University of North Texas(北德克萨斯大学) Fordham University(福特汉姆大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究前沿大语言模型的响应漂移问题,通过47名参与者对十个模型的62个多领域问题进行盲测评估,发现各模型漂移程度不同,依赖领域和问题,且自动指标解释方差低,揭示需以人类评估了解漂移情况。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18421 2026-07-22 cs.CL cs.AI 版本更新 88%

TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models

TReB:评估大语言模型表格推理能力的综合基准

Ce Li, Xiaofan Liu, Zhiyan Song, Ce Chi, Boshen Shi, Chen Zhao, Guanguang Chang, Zhendong Wang, Kexin Yang, Xing Wang, Chao Deng, Junlan Feng

机构 * JIUTIAN Research(天研机构)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 针对大语言模型处理表格数据推理能力评估基准缺失的问题,提出TReB基准,用分类法涵盖26个子任务,经数据处理构建高质量数据集,设计含三种推理模式的评估框架,揭示现有模型在表格任务上有改进空间,且数据和框架均公开。

Comments published by SIGIR 2026

Journal ref Proceedings of the 49th International ACM SIGIR Conference on Research and Development in Information Retrieval, 2026, 3267-3275

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16777 2026-07-21 cs.CL cs.AI 新提交 88%

JOR-Bench: Japanese Operations Research Benchmarks for Large Language Models

JOR-Bench:用于大语言模型的日语运筹学基准测试

Yuu Jinnai

机构 * CyberAgent

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 JOR-Bench是用于评估大语言模型解决运筹学问题能力的日语基准测试集,涵盖多种规划问题。通过评估七个LLMs的英文和日语版本,发现多语言模型的OR制定能力语言中立,但存在跨语言差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15414 2026-07-20 cs.LG cs.AI q-fin.CP 新提交 88%

AI Trading: Evaluating Large Language Models for Technical Market Analysis

人工智能交易:评估用于技术市场分析的大语言模型

Geofrey Ntale

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文系统比较评估五个大语言模型用于技术市场分析的能力,涵盖四项任务,采用多种定量指标。实验发现GPT-4 Turbo在通用模型中年化回报和夏普比率最高,FinGPT经领域微调表现出色,二者均超标准普尔500指数基准,还识别出模型存在的问题及得出相关结论。

Comments Master's research paper, Georgia Institute of Technology. 31 pages, 4 figures

Journal ref Georgia Institute of Technology, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09653 2026-07-17 cs.CL cs.AI 88%

The Heap: A Contamination-Free Multilingual Code Dataset for Evaluating Large Language Models

The Heap:一个无污染的多语言代码数据集,用于评估大型语言模型

Jonathan Katzy, Razvan Mihai Popescu, Arie van Deursen, Maliheh Izadi

机构 * Delft University of Technology(代尔夫特理工大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 The Heap是一个无污染的多语言代码数据集,用于公平评估大型语言模型,覆盖57种编程语言并去重以减少数据清洗需求。

Comments Camera-ready. Accepted to FORGE 2025 Dataset Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11059 2026-07-14 cs.SE cs.AI cs.CL 版本更新 88%

SWE-MERA: A Dynamic Benchmark for Agenticly Evaluating Large Language Models on Software Engineering Tasks

SWE-MERA:一种用于在软件工程任务中对大型语言模型进行代理评估的动态基准测试

Pavel Adamenko, Mikhail Ivanov, Aidar Valeev, Rodion Levichev, Pavel Zadorozhny, Ivan Lopatin, Dmitry Babaev, Alena Fenogenova, Valentin Malykh

机构 * GigaCode ITMO University(ITMO大学) MWS AI(MWS人工智能) IITU university(IITU大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 针对现有软件工程基准测试局限性,提出SWE-MERA动态基准测试,通过自动收集GitHub问题及严格验证确保质量,最小化污染风险,利用Aider编码代理评估多个大型语言模型,展示了其强大区分能力及模型性能表现。

Comments EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06940 2026-07-09 cs.CL cs.AI 新提交 88%

Comprehensive Evaluation of Large Language Model Responses: A Multi-Factor Scoring System

大语言模型回答的综合评估:一种多因素评分系统

Yiming Gai, Junde Lu, Xuefei Huang

机构 * School of Computer Science and Engineering, Beihang University, Beijing, China(北京航空航天大学计算机科学与工程学院) Data Science and Intelligent Computing Laboratory, Hangzhou International Innovation Institute, Beihang University, Hangzhou, Zhejiang(北京航空航天大学杭州国际创新研究院数据科学与智能计算实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 针对大语言模型回答质量评估,提出多因素评分范式,融合准确性等多方面因素,通过图形用户界面可视化结果,在TruthfulQA数据集上评估揭示模型优缺点,为知识工程和模型优化提供新途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19185 2026-07-07 cs.CL cs.AI 88%

SCURank: Ranking Multiple Candidate Summaries with Summary Content Units for Enhanced Summarization

SCURank: 基于摘要内容单元的多候选摘要排序以提升摘要生成

Bo-Jyun Wang, Ying-Jia Lin, Hung-Yu Kao

机构 * Department of Computer Science and Information Engineering, National Cheng Kung University(国立成功大学计算机科学与资讯工程系) Artificial Intelligence Research Center, Chang Gung University(长庚大学人工智能研究中心) Department of Artificial Intelligence, Chang Gung University(长庚大学人工智能系) Department of Computer Science, National Tsing Hua University(国立清华大学计算机科学系)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);small language model(abstract)

AI总结 SCURank通过摘要内容单元提升摘要生成,优于传统指标和LLM排序方法,验证了信息导向排序在多LLM蒸馏中的优势。

Comments Accepted by ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01548 2026-07-03 cs.LG cs.AI 新提交 88%

Evolutionary Feature Engineering for Structured Data

结构化数据的进化特征工程

Ege Onur Taga, Yilin Zhuang, M. Emrullah Ildiz, Petros Mol, Abhimanyu Das, Karthik Duraisamy, Samet Oymak

机构 * University of Michigan(密歇根大学) Google Research(谷歌研究院)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 提出基于LLM进化的特征工程框架EFE,通过Python程序表示变换,利用数据集上下文和验证集性能反馈优化,在时间序列和表格预测任务中提升准确性和可解释性。

Comments 9 page main content, 41 pages in total

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29228 2026-07-02 cs.CL cs.LG 版本更新 88%

Understanding Evaluation Illusion in Diffusion Large Language Models

理解扩散大语言模型中的评估幻觉

Hengxiang Zhang, Jiaxi Ren, Renchunzi Xie, Hongxin Wei

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 发现扩散大语言模型的解码方法排名对提示模板高度敏感,单模板评估会产生性能无损失的幻觉,实际并行解码方法无法突破速度-质量权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.02471 2026-06-25 cs.CL 88%

Hengqin-RA-v1: Advanced Large Language Model for Diagnosis and Treatment of Rheumatoid Arthritis with Dataset based Traditional Chinese Medicine

Hengqin-RA-v1: 针对类风湿性关节炎诊断与治疗的先进大语言模型基于传统中医数据集

Yishen Liu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出Hengqin-RA-v1,专为中医诊断和治疗类风湿性关节炎设计,结合古籍和现代文献构建的RA数据集,实验显示其性能超越现有模型,甚至在某些情况下超越中医专家。

Comments arXiv admin note: This paper has been withdrawn by arXiv due to unverifiable authorship and affiliation

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10971 2026-06-24 cs.CL cs.AI 版本更新 88%

Rule2Text: A Framework for Generating and Evaluating Natural Language Explanations of Knowledge Graph Rules

Rule2Text:知识图谱规则的自然语言解释生成与评估框架

Nasim Shirvani-Mahdavi, Chengkai Li

机构 * University of Texas at Arlington(德克萨斯理工大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出Rule2Text框架,利用大语言模型将知识图谱挖掘的逻辑规则转化为自然语言解释,通过人类评估和LLM-as-a-judge验证,微调开源模型显著提升解释质量。

Comments arXiv admin note: text overlap with arXiv:2507.23740

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19788 2026-06-19 cs.AI cs.CL 新提交 88%

CombEval: A Framework for Evaluating Combinatorial Counting in Large Language Models

CombEval:评估大语言模型中组合计数的框架

Yuxu Zhou, Ondřej Kuželka, Yuyi Wang, Yuanhong Wang, Yi Chang

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) Czech Technical University in Prague(捷克布拉格理工大学) CRRC Zhuzhou Institute(中车株洲研究所) Tengen Intelligence Institute(天元智能研究院) International Center of Future Science, Jilin University(吉林大学未来科学国际合作中心) Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, MOE(教育部知识驱动人机智能工程研究中心)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 提出CombEval动态基准,通过类型化Cofola规范生成组合计数问题,评估11个大语言模型在直接和代码增强设置下的表现,发现模型在有序对象、不可区分元素、相对位置约束和嵌套对象依赖上存在脆弱性。

Comments under review. Code: https://github.com/YuxuZhou-CN/combination-problem-generation

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04306 2026-06-19 cs.CL cs.AI 版本更新 88%

DeFrame: Debiasing Large Language Models Against Framing Effects

DeFrame: 消除大语言模型中的框架效应偏差

Kahee Lim, Soyeon Kim, Steven Euijong Whang

机构 * KAIST(韩国科学技术院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 针对大语言模型在语义等价但不同表述的提示下产生不一致偏见的问题,提出框架感知的去偏方法,通过量化框架差异并增强跨框架一致性,有效降低整体偏见并提升鲁棒性。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏