arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 1423 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 1423 篇

2601.12164 2026-07-01 cs.CY cs.CL 版本更新 89%

The Language You Ask In: Language-Conditioned Ideological Divergence in LLM Analysis of Contested Political Documents

提问的语言:语言条件对LLM分析争议性政治文件时的意识形态分歧的影响

Oleg Smirnov

机构 * Microsoft(微软)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究通过俄语和乌克兰语语义等价提示,发现ChatGPT和Claude Opus在分析同一乌克兰公民社会文件时,输出出现系统性意识形态分歧,且分歧程度因模型而异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04266 2026-06-19 cs.CL 版本更新 89%

ShoppingBench: A Real-World Intent-Grounded Shopping Benchmark for LLM-based Agents

ShoppingBench:面向LLM智能体的真实世界意图导向购物基准

Jiangyuan Wang, Kejun Xiao, Qi Sun, Huaipeng Zhao, Tao Luo, Jian Dong Zhang, Xiaoyi Zeng

机构 * Alibaba International Digital Commercial Group(阿里巴巴国际数字商业集团)

专题命中 评测与基准 :LLM(title,title_cn);language agent(abstract);分类 cs.CL

AI总结 提出ShoppingBench基准,包含多层级真实购物意图任务,通过模拟环境和250万商品评估LLM智能体,发现GPT-4.1成功率低于50%,并提出轨迹蒸馏策略提升小模型性能。

Comments Accepted for oral presentation at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09979 2026-06-10 cs.CL 版本更新 89%

GhazalBench: Evaluating LLM Understanding and Canonical Surface-Form Access in Persian Ghazals

GhazalBench: 评估大语言模型对波斯抒情诗的理解与规范表层形式访问

Ghazal Kalhor, Yadollah Yaghoobzadeh

机构 * School of Electrical and Computer Engineering, College of Engineering, University of Tehran(德黑兰理工大学电气与计算机工程学院) Tehran Institute for Advanced Studies, Khatam University(德黑兰高级研究院,凯塔姆大学)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出GhazalBench基准,评估LLM在波斯抒情诗中的诗意理解与规范表层形式访问能力,发现模型普遍能理解诗意但难以生成精确诗句,而识别任务缩小差距,英语表现更好,表明训练数据差异是关键。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05177 2026-08-18 cs.CL cs.AI eess.AS 版本更新 88%

MCBench: A Multicontext Safety Assessment Benchmark for Omni Large Language Models

MCBench:面向全能大语言模型的多上下文安全评估基准

Manh Luong, Tamas Abraham, Junae Kim, Amar Kaur, Rollin Omari, Gholamreza Haffari, Trang Vu, Lizhen Qu, Dinh Phung

机构 * Monash University(墨尔本大学) Defence Science and Technology Group(国防科学与技术集团)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 针对现有多模态安全基准仅处理视觉输入的局限,提出MCBench基准,包含1196个跨四类安全场景的测试,要求整合多模态信息进行安全评估,揭示当前全能大语言模型在跨模态安全推理上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.00890 2026-08-18 econ.EM cs.CL cs.LG 版本更新 88%

Macroeconomic Forecasting with Large Language Models

基于大型语言模型的宏观经济预测

Andrea Carriero, Davide Pettenuzzo, Shubhranshu Shekhar

机构 * School of Economics and Finance, Queen Mary University of London(伦敦大学女王学院经济与金融学院) School of Business and Economics, Brandeis University(布兰迪大学商学院与经济学学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文以FRED-MD数据库为基础,对比评估大型语言模型与传统宏观时间序列预测方法的准确性,明确了LLMs在宏观经济预测中的优劣势及现实适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14107 2026-08-18 cs.CL cs.AI 版本更新 88%

DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models

DiagnosisArena:面向大型语言模型的诊断推理基准测试

Yakun Zhu, Zhongzhen Huang, Linjie Mu, Yutong Huang, Wei Nie, Jiaji Liu, Shaoting Zhang, Pengfei Liu, Xiaofan Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) SII SPIRAL Lab(SPIRAL实验室) Generative AI Research Lab (GAIR)(生成式AI研究实验室) Shanghai Chest Hospital(上海胸科医院) Beijing Anzhen Hospital, Capital Medical University(北京安贞医院,首都医科大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究提出DiagnosisArena基准,评估大型语言模型的临床诊断推理能力,发现顶尖模型准确率仅最高51.12%,凸显其泛化瓶颈,旨在推动AI诊断推理进步。

Comments Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17244 2026-08-13 cs.CL cs.AI 版本更新 88%

DORA Explorer: Improving the Exploration Ability of LLMs Without Training

DORA Explorer: 无需训练提升大语言模型的探索能力

Priya Gurjar, Md Farhan Ishmam, Kenneth Marino

机构 * Kahlert School of Computing, University of Utah(犹他大学计算学院Kahlert学院)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出DORA Explorer框架,通过生成多样化动作候选并利用token log-probabilities评分,提升LLM在序列决策任务中的探索能力,实验显示在MAB和TALES环境中性能显著提升。

Comments 17 pages, 6 Figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06227 2026-08-12 cs.CL cs.LG 版本更新 88%

Automated Data Enrichment using Confidence-Aware Fine-Grained Debate among Open-Source LLMs for Mental Health and Online Safety

基于开源LLM的自信意识细粒度辩论用于心理健康和在线安全的自动化数据增强

Junyu Mao, Anthony Hills, Talia Tseriotou, Maria Liakata, Aya Shamir, Dan Sayda, Dana Atzil-Slonim, Natalie Djohari, Pamela Ugwudike, Mahesan Niranjan, Stuart E. Middleton

机构 * University of Southampton, UK(英国南安普顿大学) Queen Mary University of London, UK(伦敦大学玛丽女王学院) The Alan Turing Institute, UK(阿兰·图灵研究所) Bar Ilan University, Israel(巴伊兰大学)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本研究提出CFD框架,利用开源LLM的细粒度辩论实现心理健康和在线安全领域的自动化数据增强,通过实验验证其在多标签增强任务中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03750 2026-08-07 cs.CR cs.AI cs.CL 版本更新 88%

CREBench: Evaluating Large Language Models in Cryptographic Binary Reverse Engineering

CREBench:评估大语言模型在密码二进制逆向工程中的能力

Baicheng Chen, Yu Wang, Ziheng Zhou, Xiangru Liu, Juanru Li, Yilei Chen, Tianxing He

机构 * Shanghai Qi Zhi Institute(上海期智研究院) Institute of Interdisciplinary Information Sciences, Tsinghua University(清华大学交叉信息研究院) Xiongan AI Institute(雄安人工智能研究院) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) East China Normal University(华东师范大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出CREBench基准,通过432个基于密码算法的挑战评估大语言模型在密码二进制逆向工程中的性能,发现GPT-5.4在该任务中表现优异,人类专家仍具优势。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20351 2026-08-07 cs.CL cs.AI 版本更新 88%

When Large Language Models Know the Table: A Framework for Assessing Data Contamination in Tabular Datasets

评估大型语言模型中公共表格数据集的潜在知识

Matteo Silvestri, Fabiano Veglianti, Flavio Giorgi, Fabrizio Silvestri, Gabriele Tolomei

机构 * Sapienza University of Rome(罗马大学) tellmewAI

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出评估表格数据集污染的框架,通过生成控制查询和比较评估,发现四个数据集中存在污染,影响下游任务性能可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16217 2026-08-05 cs.CL cs.AI 版本更新 88%

ChiEngMixBench: Evaluating Large Language Models on Expert-Style Chinese-English Terminology Mixing

ChiEngMixBench: 评估大型语言模型在自发和自然的中英混合生成中的能力

Qingyan Yang, Tongxi Wang, Yunsheng Luo

机构 * School of Future Technology(未来技术学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 ChiEngMixBench通过评估中英混合生成的自发性和自然性,揭示多语言模型与人类交流的结构化认知对齐

Comments 15 pages, 2 figures, 8 tables. Substantially revised version

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15412 2026-08-04 cs.CL cs.AI 版本更新 88%

Few-Shot Biomedical Relation Extraction with Large Language Models: A Viable Alternative to Supervised Learning?

基于大语言模型的少样本生物医学关系抽取:监督学习的可行替代方案?

Jakob Mraz, Tomaž Curk, Blaž Zupan

机构 * University of Ljubljana(卢布尔雅那大学) Baylor College of Medicine(贝勒医学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究利用大语言模型进行少样本生物医学关系抽取,比较成对分类与联合生成两种方法,发现联合生成更精确高效,在宏F1上超越监督基线,尤其在稀有关系类型上表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06996 2026-08-04 cs.CL cs.AI 版本更新 88%

Self-Preference Bias in Rubric-Based Evaluation of Large Language Models

基于评分标准的大型语言模型评估中的自我偏好偏差

José Pombal, Ricardo Rei, André F. T. Martins

机构 * Sword Health TransPerfect ELLIS Unit Lisbon(ELLIS 里斯本分部)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 研究探讨了基于评分标准的评估中自我偏好偏差对模型评估的影响,发现即使评分标准客观,自我偏好仍会导致评分偏差,且通过多评委ensemble可部分缓解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18421 2026-07-22 cs.CL cs.AI 版本更新 88%

TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models

TReB:评估大语言模型表格推理能力的综合基准

Ce Li, Xiaofan Liu, Zhiyan Song, Ce Chi, Boshen Shi, Chen Zhao, Guanguang Chang, Zhendong Wang, Kexin Yang, Xing Wang, Chao Deng, Junlan Feng

机构 * JIUTIAN Research(天研机构)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 针对大语言模型处理表格数据推理能力评估基准缺失的问题,提出TReB基准,用分类法涵盖26个子任务,经数据处理构建高质量数据集,设计含三种推理模式的评估框架,揭示现有模型在表格任务上有改进空间,且数据和框架均公开。

Comments published by SIGIR 2026

Journal ref Proceedings of the 49th International ACM SIGIR Conference on Research and Development in Information Retrieval, 2026, 3267-3275

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11059 2026-07-14 cs.SE cs.AI cs.CL 版本更新 88%

SWE-MERA: A Dynamic Benchmark for Agenticly Evaluating Large Language Models on Software Engineering Tasks

SWE-MERA:一种用于在软件工程任务中对大型语言模型进行代理评估的动态基准测试

Pavel Adamenko, Mikhail Ivanov, Aidar Valeev, Rodion Levichev, Pavel Zadorozhny, Ivan Lopatin, Dmitry Babaev, Alena Fenogenova, Valentin Malykh

机构 * GigaCode ITMO University(ITMO大学) MWS AI(MWS人工智能) IITU university(IITU大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 针对现有软件工程基准测试局限性,提出SWE-MERA动态基准测试,通过自动收集GitHub问题及严格验证确保质量,最小化污染风险,利用Aider编码代理评估多个大型语言模型,展示了其强大区分能力及模型性能表现。

Comments EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29228 2026-07-02 cs.CL cs.LG 版本更新 88%

Understanding Evaluation Illusion in Diffusion Large Language Models

理解扩散大语言模型中的评估幻觉

Hengxiang Zhang, Jiaxi Ren, Renchunzi Xie, Hongxin Wei

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 发现扩散大语言模型的解码方法排名对提示模板高度敏感,单模板评估会产生性能无损失的幻觉,实际并行解码方法无法突破速度-质量权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10971 2026-06-24 cs.CL cs.AI 版本更新 88%

Rule2Text: A Framework for Generating and Evaluating Natural Language Explanations of Knowledge Graph Rules

Rule2Text:知识图谱规则的自然语言解释生成与评估框架

Nasim Shirvani-Mahdavi, Chengkai Li

机构 * University of Texas at Arlington(德克萨斯理工大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出Rule2Text框架,利用大语言模型将知识图谱挖掘的逻辑规则转化为自然语言解释,通过人类评估和LLM-as-a-judge验证,微调开源模型显著提升解释质量。

Comments arXiv admin note: text overlap with arXiv:2507.23740

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04306 2026-06-19 cs.CL cs.AI 版本更新 88%

DeFrame: Debiasing Large Language Models Against Framing Effects

DeFrame: 消除大语言模型中的框架效应偏差

Kahee Lim, Soyeon Kim, Steven Euijong Whang

机构 * KAIST(韩国科学技术院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 针对大语言模型在语义等价但不同表述的提示下产生不一致偏见的问题,提出框架感知的去偏方法,通过量化框架差异并增强跨框架一致性,有效降低整体偏见并提升鲁棒性。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15792 2026-06-17 cs.CY cs.AI cs.CL 版本更新 88%

A Multifaceted Analysis of Social Biases in Large Language Models

大型语言模型中偏见的系统分析

Xulang Zhang, Rui Mao, Erik Cambria

机构 * Nanyang Technological University(南洋理工大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文系统分析了四种广泛使用的大型语言模型在政治、意识形态、联盟、语言和性别等维度上的偏见,通过多项实验揭示了模型在中立性、意识形态倾向、地缘政治倾向、多语言故事完成中的偏见以及性别倾向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19225 2026-06-11 cs.CE cs.AI cs.CL cs.IR q-fin.CP 版本更新 88%

FinTradeBench: A Financial Reasoning Benchmark for LLMs

FinTradeBench: 面向LLM的金融推理基准

Yogesh Agrawal, Aniruddha Dutta, Md Mahadi Hasan, Santu Karmaker, Aritra Dutta

机构 * University of Central Florida(佛罗里达中央大学)

专题命中 评测与基准 :LLM(title_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出FinTradeBench基准,通过结合公司基本面与交易信号,评估大语言模型在金融推理中的表现,发现检索增强对数值和时间序列推理帮助有限。

Comments 9 pages main text, 31 pages total (including references and appendix). 5 figures, 16 tables. Preprint under review. Code and data will be made available upon publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07532 2026-06-10 cs.CL cs.AI 版本更新 88%

Durable Evaluation Framework: Adversarial Arbitration for Sycophancy Reduction in Large Language Models

原则性智能体辩论:针对大型语言模型谄媚减少的对抗性仲裁

Sam Ryan

机构 * Novel Systems Engineering LLC(新型系统工程有限公司)

专题命中 评测与基准 :large language model(title);language model(title);RLHF(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出原则性智能体辩论(PAD)多智能体架构,通过仲裁两个对立倾向的模型并盲评其论点,在SycophancyEval上显著降低谄媚偏差,最佳变体准确率达48.5%。

Comments 25 pages, 3 figures. Code and data available at github.com/NovelSystems/CANDOR

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03160 2026-06-08 cs.AI cs.CL 版本更新 88%

VALUEFLOW: Toward Pluralistic and Steerable Value-based Alignment in Large Language Models

VALUEFLOW:迈向大语言模型中多元化和可引导的基于价值的对齐

Woojin Kim, Sieun Hyeon, Jusang Oh, Jaeyoung Do

机构 * Department of Electrical and Computer Engineering, Seoul National University(首尔国立大学电气与计算机工程系) Interdisciplinary Program in Artificial Intelligence, Seoul National University(首尔国立大学人工智能交叉学科项目)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 提出VALUEFLOW框架,通过分层价值嵌入、强度标注数据库和锚定评估器,实现大语言模型在价值强度上的可控对齐,解决现有方法在提取、评估和引导方面的不足。

Comments Accepted in ICML 2026 (Oral). Code available at https://github.com/AIDASLab/VALUEFLOW

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25681 2026-08-20 cs.CL 版本更新 88%

Self-Improvement of Large Language Models: A Technical Overview and Future Outlook

大语言模型的自我提升:技术概述与未来展望

Haoyan Yang, Mario Xerri, Solha Park, Huajian Zhang, Yiyang Feng, Sai Akhil Kogilathota, Jiawei Zhou

机构 * Zesearch NLP Lab, Stony Brook University(石溪大学 Zesearch NLP 实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL;LLM(comments)

AI总结 本文探讨大语言模型的自我提升技术,提出闭环生命周期框架,分析各组件方法并讨论未来研究方向。

Comments Accepted by TMLR and awarded the Survey Certification; 128 pages, 12 figures, and 14 tables. Github Repo: https://github.com/Zesearch/self-improvement-llm

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06307 2026-08-06 cs.HC 版本更新 88%

LLM-Based Educational Simulation: Evaluating Temporal Student Persona Stability Across ADHD Profiles

基于LLM的教育模拟:评估跨ADHD类型的时间学生人格稳定性

Jana Gonnermann-Müller, Jennifer Haase, Nicolas Leins, Thomas Kosch, Sebastian Pokutta

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本研究通过双重评估框架,测试大型语言模型在长时间交互中维持学生人格稳定性的能力,发现结构化交互设计可消除行为漂移,对教师培训和自适应辅导有重要意义。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.06458 2026-07-31 cs.CL cs.AI cs.LG 版本更新 88%

LLM Self-Correction with DeCRIM: Decompose, Critique, and Refine for Enhanced Following of Instructions with Multiple Constraints

基于DeCRIM的大语言模型自校正:分解、批判与优化,提升多约束指令遵循能力

Thomas Palmeira Ferraz, Kartik Mehta, Yu-Hsiang Lin, Haw-Shiuan Chang, Shereen Oraby, Sijia Liu, Vivek Subramanian, Tagyoung Chung, Mohit Bansal, Nanyun Peng

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 针对LLM处理多约束指令的不足,研究推出RealInstruct基准,提出DeCRIM自校正流程,可提升开源模型性能,结合强反馈时其表现能超越GPT-4。

Comments EMNLP 2024, see https://aclanthology.org/2024.findings-emnlp.458/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29033 2026-07-09 cs.IR 版本更新 88%

Human-in-the-Loop Nugget Annotation for Accountable LLM-as-a-Judge Evaluations

人在环路的金块标注:用于可问责的LLM作为评判者评估

Laura Dietz

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 提出一种原型标注工具,通过人类识别信息金块、LLM进行匹配的分工方式,实现高效且可问责的AI系统评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12415 2026-07-02 cs.SE 版本更新 88%

SWE-Perf: Can Language Models Optimize Code Performance on Real-World Repositories?

SWE-Perf:语言模型能否优化真实仓库中的代码性能?

Xinyi He, Qian Liu, Mingzhe Du, Lin Yan, Zhijie Fan, Yiming Huang, Yin Zheng, Zejian Yuan, Zejun Ma

专题命中 评测与基准 :language model(title,abstract);LLM(summary_cn,abstract_cn);large language model(abstract)

AI总结 提出SWE-Perf基准,用于系统评估LLM在真实仓库中的代码性能优化能力,通过140个实例评估发现现有模型与专家水平存在显著差距。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13072 2026-06-29 cs.CL cs.AI cs.LG 版本更新 88%

LiveClawBench: Benchmarking LLM Agents on Complex, Real-World Assistant Tasks

LiveClawBench: 在复杂真实世界助理任务上评估大语言模型代理的基准测试

Xiang Long, Li Du, Yilong Xu, RongJian Xu, Qiyanhui Lu, Ying Gao, Qinhua Xie, Fangcheng Liu, Ning Ding, Haoqing Wang, Ziheng Li, Changjiang Zhou, Jianyuan Guo, Yehui Tang

机构 * Samsung Research(三星研究院) HKUST (Guangzhou)(香港科技大学(广州)) Peking University(北京大学) City University of Hong Kong(香港城市大学)

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出LiveClawBench基准,通过三轴复杂性框架评估LLM代理在真实世界助理任务中的表现,涵盖环境复杂性、认知需求和运行时适应性,为未来扩展提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20468 2026-08-20 cs.CL 版本更新 88%

ConspirED: A Dataset for Cognitive Traits of Conspiracy Theories and Large Language Model Safety

ConspirED:一个用于研究阴谋论认知特质与大语言模型安全性的数据集

Luke Bates, Max Glockner, Preslav Nakov, Iryna Gurevych

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 该研究推出首个标注阴谋内容通用认知特质的CONSPIRED数据集,利用其开发识别阴谋特质的计算模型,并发现大语言模型易被阴谋框架误导而复制其修辞模式。

Comments Accepted at TACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23694 2026-08-18 cs.CL 版本更新 88%

ChartFI: Benchmarking Faithfulness and Insightfulness of Chart Descriptions from Multimodal Large Language Models

ChartFI: 多模态大语言模型图表描述的忠实性与洞察力基准测试

Fen Wang, Zekai Shao, Qiman Kang, Chunran Hu, Zhixuan Zhang, Lexu Xie, Chao Liu, Siming Chen

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) Zhengzhou Zhongke Institute of Integrated Circuit and System Application(郑州中凯集成电路与系统应用研究院) School of Computer Science, Fudan University(复旦大学计算机科学学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 提出ChartFI-Bench基准,包含896个复杂图表-描述对,并设计四个评估指标(忠实性、覆盖率、信息量、敏锐度),系统评估多模态大语言模型生成图表描述的质量。

Comments Accepted by VIS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏