arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32096 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32096 篇

2603.18472 2026-04-10 cs.AI cs.CV 88%

Cognitive Mismatch in Multimodal Large Language Models for Discrete Symbol Understanding

多模态大语言模型在离散符号理解中的认知不匹配

Yinghui Li, Jiayi Kuang, Peng Xing, Daixian Liu, Yongheng Zhang, Junnan Dong, Shu-Yu Guo, Yangning Li, Qingyu Zhou, Wenhao Jiang, Hai-Tao Zheng, Ying Shen, Liang Lin, Philip S. Yu

机构 * Tsinghua University(清华大学) Sun Yat-sen University(中山大学) Independent Researcher(独立研究员) The Hong Kong Polytechnic University(香港理工大学) Guangdong Laboratory of AI and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳)) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 研究发现多模态大语言模型在离散符号识别上表现欠佳,而在复杂推理任务上表现较好,揭示了当前系统依赖语言先验而非稳健视觉基础的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23435 2026-04-09 cs.SD cs.AI cs.MM eess.AS 88%

AudioRole: An Audio Dataset for Character Role-Playing in Large Language Models

AudioRole: 一个用于大型语言模型角色扮演的音频数据集

Wenyu Li, Xiaoqi Jiao, Yi Chang, Guangyan Zhang, Yiwen Guo

机构 * Westlake University(西湖大学) Tencent LIGHTSPEED STUDIOS(腾讯LIGHTSPEED STUDIOS) Independent Researcher(独立研究员)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出AudioRole数据集,通过13部电视剧1000+小时的100万+角色对话,提供同步音频文本对及角色身份标注,结合ARP-Eval评估框架,验证了GLM-4-Voice在角色扮演中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05774 2026-04-08 q-bio.GN cs.CL 88%

GenomeQA: Benchmarking General Large Language Models for Genome Sequence Understanding

GenomeQA:用于基因组序列理解的通用大型语言模型基准测试

Weicai Long, Yusen Hou, Junning Feng, Houcheng Su, Shuo Yang, Donglin Xie, Yanlin Zhang

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The University of Hong Kong(香港大学) Peking University(北京大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 GenomeQA旨在评估通用大型语言模型在基因组序列推理任务中的表现,包含5200个样本,涵盖六个任务家族,揭示模型在直接接触原始基因组序列时的表现。

Comments 18 pages, 9 figures, coference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05224 2026-04-08 cs.AI 88%

Attribution Bias in Large Language Models

大语言模型中的归因偏差

Eliza Berman, Bella Chang, Daniel B. Neill, Emily Black

机构 * New York University(纽约大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出AttriBench基准数据集,用于研究大语言模型在引用归因中的种族、性别和交集群体偏差问题,并发现即使前沿模型在引用归因任务上也存在显著挑战。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03589 2026-04-07 cs.AI 88%

Entropy and Attention Dynamics in Small Language Models: A Trace-Level Structural Analysis on the TruthfulQA Benchmark

小语言模型中的熵与注意力动态:在TruthfulQA基准上的跟踪级结构分析

Adeyemi Adeseye, Aisvarya Adeseye, Hannu Tenhunen, Jouni Isoaho

机构 * Brilloconnetz Partners avoin yhtiö(Brilloconnetz Partners 公开合伙公司) University of Turku(图尔库大学) Royal Institute of Technology(皇家理工学院)

专题命中 评测与基准 :language model(title,abstract);small language model(title,abstract);分类 cs.AI

AI总结 研究通过跟踪级分析探讨小语言模型中熵和注意力动态对输出稳定性的影响,揭示不同模型在熵变化和注意力分布上的差异,为设计更可靠的边缘部署模型提供指导。

Comments Accepted to Publish it in 12th Intelligent Systems Conference 2026, 3-4 September 2026 in Amsterdam, The Netherlands

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03252 2026-04-07 cs.CY cs.CL 88%

Evaluating Digital Inclusiveness of Digital Agri-Food Tools Using Large Language Models: A Comparative Analysis Between Human and AI-Based Evaluations

利用大语言模型评估数字农业工具的包容性:人类与AI评估的比较分析

Githma Pewinya, Carolina Martins, Garcia Mariangel

机构 * International Water Management Institute(国际水资源管理研究所)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文探讨大语言模型在快速评估数字农业工具包容性方面的潜力,比较四种模型与专家评估的性能,发现其在某些维度上能接近专家判断,但可靠性因模型和情境而异。

Comments 24 pages, 6 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02710 2026-04-06 cs.RO cs.AI cs.CV 88%

V2X-QA: A Comprehensive Reasoning Dataset and Benchmark for Multimodal Large Language Models in Autonomous Driving Across Ego, Infrastructure, and Cooperative Views

V2X-QA:面向自动驾驶多视角的多模态大语言模型综合数据集与基准测试

Junwei You, Pei Li, Zhuoyu Jiang, Weizhe Tang, Zilin Huang, Rui Gan, Jiaxi Liu, Yan Zhao, Sikai Chen, Bin Ran

机构 * Department of Civil and Environmental Engineering, University of Wisconsin–Madison(威斯康星大学麦迪逊分校土木与环境工程系) Department of Civil and Architectural Engineering and Construction Management, University of Wyoming(怀俄明大学土木与建筑工程及施工管理系) School of Transportation, Southeast University(东南大学交通学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出V2X-QA数据集和基准测试,用于评估多模态大语言模型在自动驾驶中的多视角推理能力,揭示视角对性能的影响,并提出V2X-MoE模型以提升多视角推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29497 2026-04-01 cs.CL 88%

Distilling Human-Aligned Privacy Sensitivity Assessment from Large Language Models

从大语言模型中提炼人类对齐的隐私敏感性评估

Gabriel Loiseau, Damien Sileo, Damien Riquet, Maxime Meyer, Marc Tommasi

机构 * Hornetsecurity Univ. Lille, Inria, CNRS, Centrale Lille, UMR 9189 - CRIStAL(里尔大学、法国国家信息与自动化研究所、法国国家科学研究中心、中央理工-里尔高等电力学院,UMR 9189 - CRIStAL)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出通过轻量级编码器模型提炼大语言模型的隐私评估能力,降低计算成本并验证其在去标识化系统中的实用性。

Comments Accepted to the LREC CALD-pseudo 2026 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28698 2026-03-31 cs.CL 88%

EpiScreen: Early Epilepsy Detection from Electronic Health Records with Large Language Models

EpiScreen:利用电子健康记录中的大型语言模型进行早期癫痫检测

Shuang Zhou, Kai Yu, Zaifu Zhan, Huixue Zhou, Min Zeng, Feng Xie, Zhiyi Sha, Rui Zhang

机构 * University of Minnesota(明尼苏达大学) Division of Computational Health Sciences, Department of Surgery, University of Minnesota(明尼苏达大学外科学系计算健康科学部) College of Science and Engineering, University of Minnesota(明尼苏达大学科学与工程学院) Department of Neurology, University of Minnesota(明尼苏达大学神经病学系)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出EpiScreen方法,通过微调大型语言模型实现早期癫痫检测,其在MIMIC-IV数据集和明尼苏达大学私有队列中分别达到0.875和0.980的AUC,临床合作中帮助神经科医生提高诊断准确率。

Comments 24 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27918 2026-03-31 cs.CR cs.AI 88%

Adversarial Attacks on Multimodal Large Language Models: A Comprehensive Survey

对多模态大语言模型的对抗攻击:全面综述

Bhavuk Jain, Sercan Ö. Arık, Hardeo K. Thakur

机构 * Google(谷歌) Bennett University, India(印度贝内特大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文综述了多模态大语言模型面临的对抗威胁,分析了攻击类型及其根源,提出分类框架以提升模型安全性。

Comments Survey paper, 37 pages, 10 figures, accepted at TMLR

Journal ref Transactions on Machine Learning Research, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27806 2026-03-31 cs.CL cs.CY 88%

Understanding Teacher Revisions of Large Language Model-Generated Feedback

理解大型语言模型生成反馈的教师修订

Conrad Borchers, Luiz Rodrigues, Newarney Torrezão da Costa, Cleon Xavier, Rafael Ferreira Mello

机构 * Carnegie Mellon University(卡内基梅隆大学) Federal Technological University of Paraná – UTFPR(巴拉那联邦理工大学) Instituto Federal Goiano – IF Goiano(戈亚斯联邦学院) Federal Rural University of Pernambuco – UFRPE(伯南布哥联邦农村大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 研究探讨教师如何修订AI生成的反馈,发现80%的反馈未修改,编辑反馈通常更长且被缩短,机器学习模型能预测修订决策,修订常简化反馈内容,使其更简洁纠正性。

Comments Accepted as full paper to the 27th International Conference on Artificial Intelligence in Education (AIED 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00841 2026-03-30 cs.CL 88%

Neural Models and Language Model Prompting for the Multidimensional Evaluation of Open-Ended Conversations

神经模型与语言模型提示用于开放式对话的多维评估

Michelle Elizabeth, Alicja Kasicka, Natalia Krawczyk, Magalie Ochs, Gwénolé Lecorvé, Justyna Gromada, Lina M. Rojas-Barahona

机构 * Orange Research(Orange研究院) Aix-Marseille University(艾克斯-马赛大学)

专题命中 评测与基准 :language model(title,abstract);prompting(title,abstract);分类 cs.CL

AI总结 本文提出通过对话系统技术挑战赛(DSTC-12 Track 1)开发模型,用于预测对话层面的维度特定评分。采用语言模型提示和编码器分类回归模型,尽管LM提示与人类判断相关性较低,但仍优于基线,回归模型在验证集上表现优异。

Comments This work was granted access to the HPC resources of IDRIS under the allocations AD011015150R1 made by GENCI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12764 2026-03-26 cs.LG cs.DM 88%

GraphOmni: A Comprehensive and Extensible Benchmark Framework for Large Language Models on Graph-theoretic Tasks

GraphOmni: 一种全面且可扩展的大型语言模型在图论任务上的基准框架

Hao Xu, Xiangru Jian, Xinjian Zhao, Wei Pang, Chao Zhang, Suyuchen Wang, Qixin Zhang, Zhengyuan Dong, Joao Monteiro, Bang Liu, Qiuzhuang Sun, Tianshu Yu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) University of Waterloo(滑铁卢大学) Université de Montréal / Mila - Quebec AI Institute(蒙特利尔大学 / 加拿大魁北克人工智能研究所) City University of Hong Kong(香港城市大学) Autodesk(Autodesk公司) Singapore Management University(新加坡国立大学)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);prompting(abstract)

AI总结 本文提出GraphOmni基准框架,用于评估大型语言模型在图论任务上的推理能力,通过系统评估发现不同维度对模型性能有显著影响,且先进模型仍有提升空间。

Comments Published at ICLR 2026. Project Page: https://gai-community.github.io/Graph-Omni/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20670 2026-03-25 cs.AI cs.MA 88%

Towards Intelligent Geospatial Data Discovery: a knowledge graph-driven multi-agent framework powered by large language models

迈向智能地理空间数据发现:一种由大型语言模型驱动的知识图谱多智能体框架

Ruixiang Liu, Zhenlong Li, Ali Khosravi Kazazi

机构 * Geoinformation and Big Data Research Laboratory, Department of Geography, The Pennsylvania State University(地理信息与大数据研究实验室,地理系,宾夕法尼亚州立大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出基于知识图谱的多智能体框架,利用大型语言模型提升地理空间数据发现的语义性和智能性,通过统一元数据本体和多智能体协作提高检索性能和透明度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22777 2026-03-25 cs.AI 88%

AgriPestDatabase-v1.0: A Structured Insect Dataset for Training Agricultural Large Language Model

AgriPestDatabase-v1.0:用于训练农业大语言模型的结构化昆虫数据集

Yagizhan Bilal Durak, Ahsan Ul Islam, Shahidul Islam, Ashley Morgan-Olvera, Iftekhar Ibne Basith, Syed Hasib Akhter Faruqui

机构 * Sam Houston State University(萨姆豪斯敦州立大学) Kennesaw State University(肯纳威克州立大学)

专题命中 评测与基准 :language model(title,abstract);large language model(title);LLM(abstract);分类 cs.AI

AI总结 本文提出AgriPestDatabase-v1.0,构建了结构化昆虫数据集并采用轻量级LLM进行微调,以提升农业害虫管理的决策支持能力。

Comments Accepted in Artificial Super Intelligence Conference 2026 (Sponsored by KSU PLOT & IEEE CIS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05318 2026-03-25 cs.AI 88%

BIRD-INTERACT: Re-imagining Text-to-SQL Evaluation for Large Language Models via Lens of Dynamic Interactions

BIRD-INTERACT:通过动态交互视角重新审视大型语言模型的文本到SQL评估

Nan Huo, Xiaohan Xu, Jinyang Li, Per Jacobsson, Shipei Lin, Bowen Qin, Binyuan Hui, Xiaolong Li, Ge Qu, Shuzheng Si, Linheng Han, Edward Alexander, Xintong Zhu, Rui Qin, Ruihan Yu, Yiyao Jin, Feige Zhou, Weihao Zhong, Yun Chen, Hongyu Liu, Chenhao Ma, Fatma Ozcan, Yannis Papakonstantinou, Reynold Cheng

机构 * The University of Hong Kong(香港大学) Google Cloud(谷歌云) The BIRD Team(BIRD团队)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出BIRD-INTERACT基准,通过动态交互环境和双重评估设置,解决多轮对话中模糊查询和执行错误等问题,验证有效交互对复杂SQL任务的重要性。

Comments ICLR 2026 Oral. Dataset and code available at https://bird-interact.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14395 2026-03-24 cs.AI 88%

Massive Editing for Large Language Models Based on Dynamic Weight Generation

基于动态权重生成的大型语言模型大规模编辑

Wentao Wan, Qiqing Lao, Zhiwei Xie, Hefeng Wu, Runnan Lin, Liang Lin, Keze Wang

机构 * Sun Yat-sen University(中山大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出基于动态权重生成的大型语言模型大规模编辑方法,通过动态权重神经元提升知识编辑的可靠性、通用性和局部性指标。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16746 2026-03-20 cs.CY cs.AI 88%

Beyond Partisan Leaning: A Comparative Analysis of Political Bias in Large Language Models

超越党派倾向:对大型语言模型中政治偏见的比较分析

Tai-Quan Peng, Kaiqi Yang, Sanguk Lee, Hang Li, Yucheng Chu, Yuping Lin, Hui Liu

机构 * Michigan State University(密歇根州立大学) Texas Christian University(德克萨斯基督教大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文通过无角色扮演的专题特定方法评估LLM的政治行为,发现大多数模型倾向左翼,且模型规模和开放性不是主要预测因素。

Journal ref Journal of Information Technology & Politics, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16934 2026-03-19 cs.CV cs.AI 88%

AgriChat: A Multimodal Large Language Model for Agriculture Image Understanding

AgriChat:一种用于农业图像理解的多模态大语言模型

Abderrahmene Boudiaf, Irfan Hussain, Sajid Javed

机构 * Department of Computer Science, Khalifa University of Science and Technology(卡利法科技大学计算机科学系)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出AgriChat,一种基于多模态大语言模型的农业图像理解系统,通过整合视觉描述与网络增强的科学检索,生成农业基准数据集,提升农业领域的模型鲁棒性和可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05591 2026-03-19 cs.AI 88%

MLlm-DR: Towards Explainable Depression Recognition with MultiModal Large Language Models

MLlm-DR: 向多模态大语言模型的可解释性抑郁识别迈进

Wei Zhang, Juan Chen, En Zhu, Wenhong Cheng, YunPeng Li, Yanbo J. Wang

机构 * National University of Defense Technology(国防科技大学) University of Chinese Academy of Sciences(中国科学院大学) Shanghai Mental Health Center, Shanghai Jiao Tong University School of Medicine(上海精神卫生中心,上海交通大学医学院) Nanjing Industria Tenebris Information Technology Co., Ltd.(南京Industria Tenebris信息技术有限公司) National University of Uzbekistan named after Mirzo Ulugbek(乌兹别克斯坦Mirzo Ulugbek命名的国立大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出MLlm-DR模型,通过多模态大语言模型实现可解释的抑郁识别,结合小型LLM和轻量级查询模块,提升诊断性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20793 2026-03-13 cs.CL 88%

Multi-lingual Functional Evaluation for Large Language Models

多语言功能评估用于大语言模型

Victor Ojewale, Inioluwa Deborah Raji, Suresh Venkatasubramanian

机构 * The Center for Tech Responsibility, Brown University(布朗大学技术责任中心) University of California, Berkeley(加州大学伯克利分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出跨语言小学数学符号基准和跨语言指令跟随评估,通过多语言翻译功能基准模板,评估大语言模型在多语言环境中的性能和鲁棒性,发现CL-GSM Symbolic和CL-IFEval在多语言任务中表现更优。

Comments This is an updated version with details of the CL-GSM Symbolic and CL-IFEval datasets validation

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11414 2026-03-13 cs.CL cond-mat.mtrl-sci 88%

MaterialFigBENCH: benchmark dataset with figures for evaluating college-level materials science problem-solving abilities of multimodal large language models

MaterialFigBENCH:用于评估多模态大语言模型在大学级材料科学问题解决能力的基准数据集

Michiko Yoshitake, Yuta Suzuki, Ryo Igarashi, Yoshitaka Ushiku, Keisuke Nagato

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 MaterialFigBench是一个评估多模态大语言模型在材料科学问题中图表解读能力的基准数据集,通过137个问题测试模型在视觉理解和数值精度上的表现,揭示了当前模型在图表处理方面的不足。

Comments 27 pages, 4 tables, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10541 2026-03-12 cs.CV cs.AI 88%

Prompting with the human-touch: evaluating model-sensitivity of foundation models for musculoskeletal CT segmentation

带有人情味的提示:评估基础模型对肌肉骨骼CT分割的敏感性

Caroline Magg, Maaike A. ter Wee, Johannes G. G. Dobbe, Geert J. Streekstra, Leendert Blankevoort, Clara I. Sánchez, Hoel Kervadec

专题命中 评测与基准 :foundation model(title,abstract);prompting(title,abstract);分类 cs.AI

AI总结 本研究评估了基础模型在肌肉骨骼CT分割中的敏感性,发现不同模型和提示策略性能差异大,且人类提示影响分割结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09452 2026-03-11 cs.CR cs.CL 88%

CyberThreat-Eval: Can Large Language Models Automate Real-World Threat Research?

CyberThreat-Eval: 大型语言模型能否自动化现实中的威胁研究?

Xiangsen Chen, Xuan Feng, Shuo Chen, Matthieu Maitre, Sudipto Rakshit, Diana Duvieilh, Ashley Picone, Nan Tang

机构 * Microsoft Research(微软研究院) Microsoft(微软)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 CyberThreat-Eval通过专家标注的基准测试评估大型语言模型在威胁情报工作流程中的实际表现,揭示其在复杂细节处理和信息区分上的不足。

Comments Accepted at TMLR

Journal ref Transactions on Machine Learning Research (2025), ISSN 2835-8856

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06595 2026-03-10 cs.CL 88%

Rethinking Personalization in Large Language Models at the Token Level

重新思考在词级别上的大语言模型个性化

Chenheng Zhang, Yijun Lu, Lizhe Fang, Chunyuan Zheng, Jiajun Chai, Xiaohan Wang, Guojun Yin, Wei Lin, Yisen Wang, Zhouchen Lin

机构 * Institute for Artificial Intelligence, Peking University(人工智能研究院,北京大学) State Key Lab of General Artificial Intelligence, School of Intelligence Science and Technology, Peking University(通用人工智能国家重点实验室,北京大学智能科学与技术学院) School of Mathematical Sciences, Peking University(数学科学学院,北京大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 PerContrast通过自对比方法和PerCE损失提升大语言模型在词级别上的个性化性能,实现平均收益超10%并具有良好的迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06197 2026-03-09 cs.CL 88%

Wisdom of the AI Crowd (AI-CROWD) for Ground Truth Approximation in Content Analysis: A Research Protocol & Validation Using Eleven Large Language Models

AI群体智慧(AI-CROWD)在内容分析中的地面真实值近似:基于十一种大型语言模型的研究协议与验证

Luis de-Marcos, Manuel Goyanes, Adrián Domínguez-Díaz

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 AI-CROWD协议利用多个大型语言模型的集体输出,通过多数投票和诊断度量来近似地面真实值,以解决大规模内容分析中缺乏真实标签的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05283 2026-03-09 cs.SE cs.AI 88%

Software Development Life Cycle Perspective: A Survey of Benchmarks for Code Large Language Models and Agents

软件开发生命周期视角:代码大语言模型和代理的基准测试调查

Kaixin Wang, Tianlin Li, Xiaoyu Zhang, Chong Wang, Weisong Sun, Yang Liu, Aishan Liu, Xianglong Liu, Chao Shen, Bin Shi

机构 * Xi’an Jiaotong University(西安交通大学) Beihang University(北京航空航天大学) Nanyang Technological University(南洋理工大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文从软件开发生命周期视角调查代码大语言模型和代理的基准测试,揭示当前基准测试在覆盖方面的不平衡,并提出未来研究方向以缩小理论能力与实际应用之间的差距。

Comments Significantly enhanced the tiered analysis framework for a more comprehensive evaluation of CodeLLMs and Agents throughout the SDLC

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01853 2026-03-06 cs.CL 88%

Eka-Eval: An Evaluation Framework for Low-Resource Multilingual Large Language Models

Eka-Eval:一种低资源多语言大语言模型的评估框架

Samridhi Raj Sinha, Rajvee Sheth, Abhishek Upperwal, Mayank Singh

机构 * NMIMS Soket AI Indian Institute of Technology Gandhinagar(印度理工学院加尔各答分校) LINGO Research Group(LINGO研究组)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 EKA-EVAL是一种开源框架,通过零代码界面和模块化架构,为低资源多语言大语言模型提供全面的评估支持,提升了易用性和可重复性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00999 2026-03-06 cs.CL 88%

La Leaderboard: A Large Language Model Leaderboard for Spanish Varieties and Languages of Spain and Latin America

La Leaderboard:一种用于西班牙及拉丁美洲各种语言和方言的大型语言模型排行榜

María Grandury, Javier Aula-Blasco, Júlia Falcão, Clémentine Fourrier, Miguel González, Gonzalo Martínez, Gonzalo Santamaría, Rodrigo Agerri, Nuria Aldama, Luis Chiruzzo, Javier Conde, Helena Gómez, Marta Guerrero, Guido Ivetta, Natalia López, Flor Miriam Plaza-del-Arco, María Teresa Martín-Valdivia, Helena Montoro, Carmen Muñoz, Pedro Reviriego, Leire Rosado, Alejandro Vaca, María Estrella Vallecillo-Rodríguez, Jorge Vallego, Irune Zubiaga

机构 * SomosNLP ETSIT, Universidad Politécnica de Madrid(ETSIT,西班牙马德里理工大学) Barcelona Supercomputing Center(巴塞罗那超级计算中心) Hugging Face Universidad Carlos III de Madrid(马德里卡洛斯三世大学) Instituto de Ingeniería del Conocimiento(知识工程研究所) Centro HiTZ - Ixa, Universidad del País Vasco UPV/EHU(HiTZ-Ixa中心,巴斯克大学) LIACS, Leiden University(LIACS,莱顿大学) Universidad de Jaén(杰嫩大学) Universidad Nacional de Córdoba(科尔多瓦国立大学) Universidad Nacional Autónoma de México(墨西哥国立自治大学) Universidad de la República, Uruguay(乌拉圭共和国大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 La Leaderboard是一个开源项目,旨在评估西班牙及拉丁美洲各种语言和方言的生成式大型语言模型,通过社区驱动的方式促进多样化语言模型的发展。

Comments Accepted at ACL 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03002 2026-03-04 cs.AI 88%

SpatialText: A Pure-Text Cognitive Benchmark for Spatial Understanding in Large Language Models

SpatialText: 一种纯文本的认知基准,用于大型语言模型中的空间理解

Peiyao Jiang, Zequn Qin, Xi Li

机构 * Zhejiang University(浙江大学) School of Software Technology, Zhejiang University(软件技术学院,浙江大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 SpatialText通过双源方法为大型语言模型提供纯文本空间认知基准,揭示其在空间推理中的系统性缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏