arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-24 至 2026-02-24 共收录 347 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 82 篇

2602.19690 2026-02-24 cs.HC 85%

"The explanation makes sense": An Empirical Study on LLM Performance in News Classification and its Influence on Judgment in Human-AI Collaborative Annotation

『解释有道理』:一项关于LLM在新闻分类中的表现及其在人机协作标注中影响的实证研究

Qile Wang, Prerana Khatiwada, Avinash Chouhan, Ashrey Mahesh, Joy Mwaria, Duy Duc Tran, Kenneth E. Barner, Matthew Louis Mauriello

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文研究了LLM在新闻分类中的表现及其对人机协作标注的影响,发现详细解释能显著提高用户信心并影响决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01356 2026-02-24 cs.SE 85%

LAURA: Enhancing Code Review Generation with Context-Enriched Retrieval-Augmented LLM

LAURA: 通过上下文增强的检索增强大语言模型提升代码审查生成

Yuxin Zhang, Yuxia Zhang, Zeyu Sun, Yanjie Jiang, Hui Liu

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 LAURA通过整合审查范例检索、上下文增强和系统引导,提升代码审查生成的准确性和质量。

Comments This arXiv submission is the author's accepted manuscript

Journal ref 2025 40th IEEE/ACM International Conference on Automated Software Engineering (ASE), IEEE, 2025, pp. 2983-2995

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04891 2026-02-24 cs.CL cs.AI cs.LG 85%

SocialHarmBench: Revealing LLM Vulnerabilities to Socially Harmful Requests

SocialHarmBench: 揭示 LLM 对有害社会请求的脆弱性

Punya Syon Pandey, Hai Son Le, Devansh Bhardwaj, Rada Mihalcea, Zhijing Jin

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SocialHarmBench 通过 585 个提示揭示 LLM 在政治敏感场景中的脆弱性,揭示了模型在有害请求中的高风险表现。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21990 2026-02-24 cs.CV cs.SD 85%

WAVE: Learning Unified & Versatile Audio-Visual Embeddings with Multimodal LLM

WAVE: 基于多模态大语言模型的学习统一且多功能的音频-视觉嵌入

Changli Tang, Qinfan Xiao, Ke Mei, Tianyi Wang, Fengyun Rao, Chao Zhang

机构 * Tsinghua University(清华大学) WeChat Vision, Tencent Inc.(腾讯公司)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 WAVE通过联合多模态多任务训练方法,实现了统一且多功能的音频-视觉嵌入,显著提升了跨模态检索和问答性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13862 2026-02-24 physics.soc-ph 85%

Measuring Self-Rating Bias in LLM-Generated Survey Data: A Semantic Similarity Framework for Independent Scale Mapping

测量大语言模型生成调查数据中的自我评分偏差:一种基于语义相似性的独立量表映射框架

Eduardo Vera Pichardo

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出基于语义相似性的框架,用于测量LLM生成调查数据中的自我评分偏差,通过解耦生成与量表映射提升数据准确性。

Comments 36 pages, 8 figures, 1 longtable appendix. Code/data: https://github.com/Lalitronico/ssr-replication

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18230 2026-02-24 cs.LG cs.AI 84%

[Re] Benchmarking LLM Capabilities in Negotiation through Scoreable Games

通过可评分游戏评估大语言模型在谈判中的能力基准测试

Jorge Carrasco Pollo, Ioannis Kapetangeorgis, Joshua Rosenthal, John Hua Yao

机构 * Informatics Institute University of Amsterdam(信息学院阿姆斯特丹大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文通过可评分游戏评估大语言模型在谈判中的能力,发现基准复杂但模型比较存在歧义,强调上下文在评估中的重要性。

Comments Accepted for publication at Transactions on Machine Learning Research (TMLR) and MLRC Journal Track, 2025. Code available at: https://github.com/joshrosie/FACT29

Journal ref Transactions on Machine Learning Research (TMLR), June 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19843 2026-02-24 cs.SE cs.AI 83%

MAS-FIRE: Fault Injection and Reliability Evaluation for LLM-Based Multi-Agent Systems

MAS-FIRE:基于大语言模型的多智能体系统故障注入与可靠性评估

Jin Jia, Zhiling Deng, Zhuangbin Chen, Yingqi Wang, Zibin Zheng

机构 * Sun Yat-sen University(中山大学)

专题命中 评测与基准 :LLM(title,abstract);foundation model(abstract);分类 cs.AI

AI总结 MAS-FIRE通过故障注入和分层分析,揭示多智能体系统在容错和鲁棒性方面的关键因素,为提升系统可靠性提供系统性方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03867 2026-02-24 cs.CL 83%

EuroGEST: Investigating gender stereotypes in multilingual language models

EuroGEST:研究多语言语言模型中的性别刻板印象

Jacqueline Rowe, Mateusz Klimaszewski, Liane Guillou, Shannon Vallor, Alexandra Birch

机构 * University of Edinburgh(爱丁堡大学) Warsaw University of Technology(华沙技术大学) Aveni

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 EuroGEST研究多语言语言模型中的性别刻板印象,通过跨29种欧洲语言的数据集揭示了性别刻板印象的普遍性及模型对刻板印象的编码强度。

Comments In Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing, pages 32074-32096, Suzhou, China. Association for Computational Linguistics. 9 pages, 5 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18693 2026-02-24 cs.CL 83%

Contradiction to Consensus: Dual Perspective, Multi Source Retrieval Based Claim Verification with Source Level Disagreement using LLM

与共识相悖:基于双视角、多源检索的声明验证系统,利用源级别分歧

Md Badsha Biswas, Ozlem Uzuner

机构 * George Mason University(乔治·梅奥大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究提出基于双视角多源检索和跨源分歧分析的声明验证系统,利用LLM提升验证准确性并揭示来源差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19177 2026-02-24 cs.CL cs.AI 82%

Next Reply Prediction X Dataset: Linguistic Discrepancies in Naively Generated Content

下一步回复预测X数据集:在粗心生成内容中的语言差异

Simon Münker, Nils Schwager, Kai Kugler, Michael Heseltine, Achim Rettinger

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出通过X数据集评估LLM生成内容与人类生成内容的语言差异,旨在提升计算社会科学研究的准确性。

Comments 8 pages (12 including references), 2 figures and 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16449 2026-02-24 cs.CV cs.AI 81%

Emotion-LLaMAv2 and MMEVerse: A New Framework and Benchmark for Multimodal Emotion Understanding

Emotion-LLaMAv2 和 MMEVerse:多模态情感理解的新框架和基准

Xiaojiang Peng, Jingyi Chen, Zebang Cheng, Bao Peng, Fengyi Wu, Yifei Dong, Shuyuan Tu, Qiyu Hu, Huiting Huang, Yuxiang Lin, Jun-Yan He, Kai Wang, Zheng Lian, Zhi-Qi Cheng

机构 * Shenzhen Technology University(深圳技术大学) Shenzhen University of Information Technology(深圳信息科技学院) University of Washington(华盛顿大学) Foundation Model Team, Meituan(美团基础模型团队) National University of Singapore(新加坡国立大学) Tongji University(同济大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);instruction tuning(abstract)

AI总结 Emotion-LLaMAv2和MMEVerse通过端到端多视图编码器、Conv Attention预融合模块和课程指令调制方案,提升了多模态情绪理解和推理能力,并构建了统一的多模态情绪基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18998 2026-02-24 cs.AI cs.CL 81%

Benchmark Test-Time Scaling of General LLM Agents

通用大语言模型代理的基准测试时间扩展

Xiaochuan Li, Ryan Ming, Pranav Setlur, Abhijay Paladugu, Andy Tang, Hao Kang, Shuai Shao, Rong Jin, Chenyan Xiong

机构 * Language Technologies Institute, School of Computer Science, Carnegie Mellon University(卡内基梅隆大学语言技术研究所) Meta

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.AI

AI总结 研究提出General AgentBench基准测试,用于评估通用大语言模型代理在多个技能和工具上的表现,发现顺序和并行扩展方法在实际应用中均存在性能限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18613 2026-02-24 cs.LG cs.CL cs.IR 81%

Diagnosing LLM Reranker Behavior Under Fixed Evidence Pools

在固定证据池下诊断LLM重排序器行为

Baris Arat, Emre Sefer

机构 * Ozyegin University(奥济根大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.LG

AI总结 本文通过固定证据池诊断LLM重排序行为,发现不同模型在冗余和多样性上有显著差异,且LLM在小预算下表现欠佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24943 2026-02-24 cs.IR cs.AI cs.CL cs.LG 80%

RAIR: A Rule-Aware Benchmark Uniting Challenging Long-Tail and Visual Salience Subset for E-commerce Relevance Assessment

RAIR:一种融合长尾和视觉显著子集的规则感知基准,用于电商相关性评估

Chenji Lu, Zhuo Chen, Hui Zhao, Zhenyi Wang, Pengjie Wang, Chuan Yu, Jian Xu

机构 * Taobao \& Tmall Group of Alibaba Beijing China Taobao \& Tmall Group of Alibaba

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 RAIR提出了一种融合长尾和视觉显著子集的规则感知基准,用于评估电商相关性,通过标准化框架和多子集数据提升模型评估的全面性与挑战性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20059 2026-02-24 cs.AI 79%

Interaction Theater: A case of LLM Agents Interacting at Scale

交互戏剧:大规模LLM代理互动的案例

Sarath Shekkizhar, Adam Earle

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 研究发现大规模LLM智能体互动表面活跃但实质空洞,需设计协调机制以促进有效交流。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18439 2026-02-24 cs.CV cs.LG 79%

Replication Study: Federated Text-Driven Prompt Generation for Vision-Language Models

复制研究:用于视觉-语言模型的联邦文本驱动提示生成

Suraj Prasad, Anubha Pant

专题命中 评测与基准 :language model(title,abstract);分类 cs.LG

AI总结 本研究通过复制FedTPG方法,验证了文本驱动提示生成在联邦学习中提升泛化能力的效果,并展示了在不同视觉领域中的高性能表现。

Comments 6 pages, 2 figues

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19411 2026-02-24 physics.chem-ph cs.LG 79%

MACE-POLAR-1: A Polarisable Electrostatic Foundation Model for Molecular Chemistry

MACE-POLAR-1:一种可极化的静电基础模型用于分子化学

Ilyes Batatia, William J. Baldwin, Domantas Kuryla, Joseph Hart, Elliott Kasoar, Alin M. Elena, Harry Moore, Mikołaj J. Gawkowski, Benjamin X. Shi, Venkat Kapil, Panagiotis Kourtis, Ioan-Bogdan Magdău, Gábor Csányi

机构 * Engineering Laboratory, University of Cambridge, Trumpington St, Cambridge, UK Yusuf Hamied Department of Chemistry, University of Cambridge, Lensfield Road, Cambridge, UK Cavendish Laboratory, University of Cambridge, J. J. Thomson Avenue, Cambridge, UK Scientific Computing Department, Science Technology Facilities Council, Daresbury Laboratory, Keckwick Lane, Daresbury WA4 4AD, UK Department of Physics Astronomy, University College London, 7-19 Gordon St, London WC1H 0AH, United Kingdom Initiative for Computational Catalysis, Flatiron Institute, 160 5th Avenue, New York, NY 10010 School of Natural Environmental Sciences, Newcastle University, Newcastle upon Tyne, UK Max Planck Institute for Polymer Research, Ackermannweg 10, Mainz, Germany

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 MACE-POLAR-1通过引入长程静电学和极化迭代,提升了分子化学中非共价相互作用和超分子复合物的描述精度,适用于从小分子到蛋白质-配体复合物的多种计算场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18497 2026-02-24 cs.DB cs.AI 79%

PIPE-RDF: An LLM-Assisted Pipeline for Enterprise RDF Benchmarking

PIPE-RDF: 一个基于LLM的企业RDF基准测试流水线

Suraj Ranganath

机构 * UC San Deigo(加州大学圣地亚哥分校)

专题命中 评测与基准 :LLM(title);prompting(abstract);分类 cs.AI

AI总结 PIPE-RDF通过反向查询和检索增强提示构建企业RDF基准测试,生成450个问题-SPARQL对,实现100%有效性验证。

Comments Conference submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20174 2026-02-24 cs.CV cs.AI 79%

LRR-Bench: Left, Right or Rotate? Vision-Language models Still Struggle With Spatial Understanding Tasks

LRR-Bench:左、右还是旋转?视觉-语言模型在空间理解任务上仍面临挑战

Fei Kong, Jinhao Duan, Kaidi Xu, Zhenhua Guo, Xiaofeng Zhu, Xiaoshuang Shi

机构 * University of Electronic Science and Technology of China(电子科技大学) Drexel University(德雷塞尔大学) Tianyijiaotong Technology Ltd.(天奕交通技术有限公司)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 LRR-Bench通过合成数据评估视觉-语言模型在空间理解任务上的性能,发现其在复杂任务上的表现远低于人类水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20040 2026-02-24 cs.CL cs.AI 79%

AgenticSum: An Agentic Inference-Time Framework for Faithful Clinical Text Summarization

AgenticSum: 一种用于临床文本忠实总结的代理推理框架

Fahmida Liza Piya, Rahmatollah Beheshti

机构 * Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家) School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家) University of Delaware, Newark, DE, USA(特拉华大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 AgenticSum通过代理推理框架提升临床文本摘要的准确性与一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14488 2026-02-24 cs.CL cs.AI 79%

BETA-Labeling for Multilingual Dataset Construction in Low-Resource IR

BETA-标注用于低资源信息检索中多语言数据集构建

Md. Najib Hasan, Mst. Jannatun Ferdous Rain, Fyad Mohammed, Nazmul Siddique

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出BETA-标注框架构建低资源语言信息检索数据集,探讨跨语言数据集重用的可行性和风险,揭示语言依赖性偏差对数据集可靠性的影响。

Comments This work was submitted without the consent of my current adviser. Additionally, it overlaps with my unpublished research work. In order to avoid potential academic and authorship conflicts, I am requesting withdrawal of the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18765 2026-02-24 cs.CV 78%

A high-resolution nationwide urban village mapping product for 342 Chinese cities based on foundation models

基于基础模型的中国342个城市高分辨率全国性城乡村制图产品

Lubin Bai, Sheng Xiao, Ziyu Yin, Haoyu Wang, Siyang Wu, Xiuyuan Zhang, Shihong Du

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 本文提出基于基础模型的GeoLink-UV数据集,用于中国342个城市高分辨率城乡村制图,揭示区域差异及空间分布特征,支持可持续城市发展。

Comments Submitted to Earth System Science Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18747 2026-02-24 cs.CV 78%

Benchmarking Computational Pathology Foundation Models For Semantic Segmentation

对用于语义分割的计算病理学基础模型进行基准测试

Lavish Ramchandani, Aashay Tinaikar, Dev Kumar Das, Rohit Garg, Tijo Thomas

机构 * Aira Matrix Private Limited(Aira矩阵私人有限公司)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 本研究提出了一种评估方法,发现CONCH在病理学语义分割中表现最佳,通过拼接多个基础模型特征可提升分割性能。

Comments 5 pages, submitted to IEEE ISBI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18967 2026-02-24 cs.RO 75%

TactEx: An Explainable Multimodal Robotic Interaction Framework for Human-Like Touch and Hardness Estimation

TactEx:一种可解释的多模态机器人交互框架,用于类人触觉和硬度估计

Felix Verstraete, Lan Wei, Wen Fan, Dandan Zhang

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 TactEx通过融合视觉、触觉和语言模态,实现类人触觉和硬度估计,展示了在水果成熟度评估中的高任务成功率和可解释性。

Comments Accepted by 2026 ICRA

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18537 2026-02-24 cs.SE 75%

Runtime-Augmented LLMs for Crash Detection and Diagnosis in ML Notebooks

运行时增强的LLM用于ML笔记本的崩溃检测与诊断

Yiran Wang, José Antonio Hernández López, Ulf Nilsson, Dániel Varró

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 CRANE-LLM通过整合运行时信息提升ML笔记本崩溃检测与诊断的准确性与F1分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19914 2026-02-24 cs.AI 74%

Watson & Holmes: A Naturalistic Benchmark for Comparing Human and LLM Reasoning

沃森与霍尔姆斯:一种自然情境下比较人类和大语言模型推理能力的基准

Thatchawin Leelawat, Lewis D Griffin

专题命中 评测与基准 :LLM(title);分类 cs.AI

AI总结 本文提出沃森与霍尔姆斯桌游作为自然情境下比较人类与大语言模型推理能力的基准,展示AI模型性能随时间显著提升,特别是在解决复杂案件时的推理能力进步。

Comments 51 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18971 2026-02-24 cs.AI 74%

When Do LLM Preferences Predict Downstream Behavior?

当LLM偏好预测下游行为时是什么情况?

Katarina Slama, Alexandra Souly, Dishank Bansal, Henry Davidson, Christopher Summerfield, Lennart Luettgau

机构 * UK AI Security Institute(英国人工智能安全研究所)

专题命中 评测与基准 :LLM(title);分类 cs.AI

AI总结 研究发现LLM的偏好能预测捐赠建议,但对任务表现的影响不一致。

Comments 31 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19008 2026-02-24 cs.CL cs.LG 73%

Capable but Unreliable: Canonical Path Deviation as a Causal Mechanism of Agent Failure in Long-Horizon Tasks

有能力但不可靠:作为长周期任务中智能体失败的因果机制的规范路径偏移

Wilson Y. Lee

机构 * Independent Researcher(独立研究者)

专题命中 评测与基准 :LLM(abstract);language agent(abstract);分类 cs.CL、cs.LG

AI总结 该研究发现智能体在长周期任务中失败的原因是规范路径偏移的可靠性问题,提出通过监控重启运行提高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18800 2026-02-24 cs.SE cs.AI cs.LG 73%

Operational Robustness of LLMs on Code Generation

在代码生成上的大语言模型操作鲁棒性

Debalina Ghosh Paul, Hong Zhu, Ian Bayley

机构 * School of Engineering, Computing and Mathematics, Oxford Brookes University(工程、计算与数学学院,奥克斯伯里大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种评估大语言模型在代码生成任务中鲁棒性的方法,通过分析自然语言描述的最小变化来评估模型性能,并对四种先进模型进行了实验验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18483 2026-02-24 cs.CY cs.AI cs.CL cs.HC 73%

Red Teaming LLMs as Socio-Technical Practice: From Exploration and Data Creation to Evaluation

对LLM进行红队行动作为社会技术实践:从探索和数据创建到评估

Adriana Alvarado Garcia, Ruyuan Wan, Ozioma C. Oguine, Karla Badillo-Urquiola

机构 * Responsible Tech Research IBM Research Yorktown Heights New York USA(负责技术研究 IBM 研究 Yorktown Heights 新 York 美国) IBM Research(IBM 研究) The Pennsylvania State University(宾夕法尼亚州立大学) University of Notre Dame(诺特达美大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过访谈从业者,探讨了红队行动数据集定义、创建和评估的社会技术实践,揭示了从业者在风险概念化中的不足,并提出HCI研究者扩展红队行动概念化和数据实践的三个机会。

详情

展开后加载摘要…

URL PDF HTML 收藏