arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-26 至 2026-02-26 共收录 39 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 39 篇

2602.21833 2026-02-26 cs.SE 90%

From Restructuring to Stabilization: A Large-Scale Experiment on Iterative Code Readability Refactoring with Large Language Models

从重构到稳定:基于大语言模型的迭代代码可读性重构大规模实验

Norman Peitek, Julia Hess, Sven Apel

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本文通过大规模实验研究大语言模型在迭代代码重构中的能力,揭示了重构过程的收敛趋势及可读性提升的机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13654 2026-02-26 cs.LG cs.AI 88%

Rethinking Evaluation in the Era of Time Series Foundation Models: (Un)known Information Leakage Challenges

重新思考时间序列基础模型时代的评估:(未知)信息泄漏挑战

Marcel Meyer, Sascha Kaltenpoth, Kevin Zalipski, Oliver Müller

机构 * Paderborn University, Data Analytics Group(帕德博恩大学数据分析组)

专题命中 评测与基准 :foundation model(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文探讨了时间序列基础模型评估中信息泄漏问题,提出需开发新型评估方法以避免现有方法的缺陷,确保评估结果的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21512 2026-02-26 cs.NE 88%

Assessing an evolutionary search engine for small language models, prompts, and evaluation metrics

评估一种用于小型语言模型、提示和评估指标的进化搜索引擎

Cláudio Lúcio do Val Lopes, Lucca Machado

专题命中 评测与基准 :language model(title,abstract);small language model(title,abstract)

AI总结 本文提出一种双目标进化搜索引擎,用于优化小型语言模型、提示和评估指标之间的性能与效率平衡。

Comments 14 pages, 1 figure, 1 table

Journal ref Intelligent Systems. BRACIS 2025. Lecture Notes in Computer Science

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21320 2026-02-26 cs.LG 85%

Tool-R0: Self-Evolving LLM Agents for Tool-Learning from Zero Data

Tool-R0:从零数据自我进化的大语言模型代理用于工具学习

Emre Can Acikgoz, Cheng Qian, Jonas Hübotter, Heng Ji, Dilek Hakkani-Tür, Gokhan Tur

机构 * UIUC(伊利诺伊大学香槟分校) ETH Zurich(苏黎世联邦理工学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 Tool-R0通过自我对抗强化学习从零数据训练通用工具调用代理,实现92.5%的性能提升并超越完全监督基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00024 2026-02-26 cs.SI cs.AI 85%

EpidemIQs: Prompt-to-Paper LLM Agents for Epidemic Modeling and Analysis

EpidemIQs: 用于流行病建模与分析的提示到论文LLM代理

Mohammad Hossein Samaei, Faryad Darabi Sahneh, Lee W. Cohnstaedt, Caterina Scoglio

机构 * Department of Electrical and Computer Engineering, Kansas State University(电气与计算机工程系,堪萨斯州立大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 EpidemIQs是一种多代理LLM框架,通过五个阶段实现流行病建模与分析的自动化,利用科学家代理和任务专家代理提高效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21236 2026-02-26 cs.SI cs.CY 85%

@GrokSet: multi-party Human-LLM Interactions in Social Media

@GrokSet:社交媒体中多方人与LLM互动

Matteo Migliarini, Berat Ercevik, Oluwagbemike Olowe, Saira Fatima, Sarah Zhao, Minh Anh Le, Vasu Sharma, Ashwinee Panda

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 @GrokSet 是一个大规模社交媒体数据集,揭示了LLM在高风险政治辩论中作为权威裁决者的功能转变及其在社交验证中的低地位

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22070 2026-02-26 cs.AI 83%

Language Models Exhibit Inconsistent Biases Towards Algorithmic Agents and Human Experts

语言模型表现出对算法代理和人类专家的不一致偏见

Jessica Y. Bo, Lillio Mok, Ashton Anderson

机构 * Computer Science University of Toronto(计算机科学大学 Toronto)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.AI

AI总结 研究发现语言模型对人类专家和算法存在不一致偏见,需在高风险应用中谨慎对待。

Comments Second Conference of the International Association for Safe and Ethical Artificial Intelligence (IASEAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21978 2026-02-26 cs.CL 83%

CxMP: A Linguistic Minimal-Pair Benchmark for Evaluating Constructional Understanding in Language Models

CxMP:一种语言最小对基准,用于评估语言模型的构式理解

Miyu Oba, Saku Sugawara

机构 * Nara Institute of Science and Technology(奈良科学技術研究院) National Institute of Informatics(国家信息研究院) The University of Tokyo(东京大学)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 CxMP基准通过最小对设计评估语言模型对构式语义关系的理解能力,揭示了大型语言模型在整合形式与意义方面的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07984 2026-02-26 cs.CL 83%

Cross-Cultural Expert-Level Art Critique Evaluation with Vision-Language Models

跨文化专家级艺术批评评估与视觉-语言模型

Haorui Yu, Xuehang Wen, Fengrui Zhang, Qiufeng Yi

机构 * DJCAD, University of Dundee, United Kingdom(邓迪大学DJCAD研究中心,英国) Hebei Academy of Fine Art, China(河北美术院,中国) Computer Science, Nanjing University, China(南京大学计算机科学系,中国) Department of Mechanical Engineering, School of Engineering, University of Birmingham(伯明翰大学工程学院机械工程系)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文提出了一种跨文化评估框架,用于评估视觉-语言模型在艺术批评中的文化理解能力,揭示了自动化指标与专家评分的差异及文化敏感性问题。

Comments 16 pages, 7 figures, submitted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22207 2026-02-26 cs.CL cs.AI cs.LG 80%

Recovered in Translation: Efficient Pipeline for Automated Translation of Benchmarks and Datasets

译回翻译:高效管道用于自动翻译基准和数据集

Hanna Yukhymenko, Anton Alexandrov, Martin Vechev

机构 * INSAIT, Sofia University "St. Kliment Ohridski"(INSAIT,索菲亚大学"圣克莱门特·奥赫里迪斯基") ETH Zurich(苏黎世联邦理工学院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种高效自动化框架,用于高质量翻译多语言基准和数据集,以提升多语言AI评估的准确性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22026 2026-02-26 cs.CV cs.AI 79%

RGB-Event HyperGraph Prompt for Kilometer Marker Recognition based on Pre-trained Foundation Models

基于预训练基础模型的RGB-Event超图提示用于基于预训练基础模型的公里标识别

Xiaoyu Xian, Shiao Wang, Xiao Wang, Daxin Tian, Yan Tian

机构 * School of Transportation Science and Engineering, Beihang University(北京航空航天大学交通科学与工程学院) CRRC Academy Co., Ltd(CRRC研究院)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI

AI总结 本文提出基于预训练基础模型的RGB-Event超图提示方法,构建首个大规模RGB-Event数据集EvMetro5K,用于提升地铁公里标识别性能。

Comments Accepted by IEEE Transactions on Cognitive and Developmental Systems (IEEE TCDS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21779 2026-02-26 cs.CV cs.AI 79%

Beyond Static Artifacts: A Forensic Benchmark for Video Deepfake Reasoning in Vision Language Models

超越静态伪影:一种用于视觉语言模型中视频深度伪造推理的取证基准

Zheyuan Gu, Qingsong Zhao, Yusong Wang, Zhaohong Huang, Xinqi Li, Cheng Yuan, Jiaowei Shao, Chi Zhang, Xuelong Li

机构 * Institute of Artificial Intelligence, China Telecom (TeleAI)(人工智能研究院,中国电信(TeleAI)) Peking University(北京大学) Fudan University(复旦大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 本文提出FAQ基准,通过多选任务提升视觉语言模型对视频深度伪造的时间推理能力,并通过实验验证其有效性。

Comments 16 pages, 9 figures. Submitted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10359 2026-02-26 eess.IV cs.AI cs.CV 79%

Beyond Calibration: Confounding Pathology Limits Foundation Model Specificity in Abdominal Trauma CT

超越校准:混淆病理限制了腹部创伤CT基础模型的特异性

Jineel H Raythatha, Shuchang Ye, Jeremy Hsu, Jinman Kim

机构 * School of Computer Science, Faculty of Engineering, The University of Sydney(悉尼大学计算机科学学院,工程学院) Department of Surgery, Faculty of Medicine and Health, The University of Sydney(悉尼大学医学与健康学院外科部门) Westmead Trauma Service, Westmead Hospital, Western Sydney Local Health District(西墨尔本创伤服务,西墨尔本医院,西悉尼地方卫生区)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI

AI总结 该研究发现基础模型在腹部创伤CT诊断中特异性不足主要由负类异质性导致,而非患病率本身,提示需通过训练提升其适应性。

Comments 26 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.17115 2026-02-26 cs.CV cs.AI 79%

Measuring the Measurers: Quality Evaluation of Hallucination Benchmarks for Large Vision-Language Models

测量测量者:大型视觉-语言模型幻觉基准的品质评估

Bei Yan, Jie Zhang, Zheng Yuan, Shiguang Shan, Xilin Chen

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences, and also with University of Chinese Academy of Sciences(人工智能安全国家重点实验室,计算技术研究所,中国科学院,以及中国科学院大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 本文提出HQM框架评估幻觉基准质量,发现现有基准存在可靠性与有效性不足问题,并提出HQQ基准以提升评估效果,揭示LVLMs在幻觉问题上的严重缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21854 2026-02-26 cs.CL 77%

FewMMBench: A Benchmark for Multimodal Few-Shot Learning

FewMMBench: 一种多模态少样本学习的基准测试

Mustafa Dogan, Ilker Kesen, Iacer Calixto, Aykut Erdem, Erkut Erdem

机构 * Aselsan Research(阿塞利桑研究)

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 FewMMBench是一个用于评估多模态少样本学习能力的基准测试,通过系统分析不同任务类型、模型家族和提示策略,揭示指令调优模型在零样本性能上的优势及CoT推理的局限性。

Comments Preprint. 49 pages, 38 Figures, 5 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17203 2026-02-26 cs.DB cs.LG 77%

High-Fidelity And Complex Test Data Generation For Google SQL Code Generation Services

高保真与复杂测试数据生成用于谷歌SQL代码生成服务

Shivasankari Kannan, Yeounoh Chung, Amita Gondi, Tristan Swadell, Fatma Ozcan

机构 * Google(谷歌)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出利用LLM生成高保真测试数据,以提高复杂SQL代码生成服务的测试覆盖率和语义准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21251 2026-02-26 cs.SE cs.AI cs.MA cs.PL 77%

AgenticTyper: Automated Typing of Legacy Software Projects Using Agentic AI

AgenticTyper: 使用代理AI自动类型化遗留软件项目

Clemens Pohle

机构 * Darmstadt University of Applied Sciences(达姆斯塔德应用技术大学) MaibornWolff GmbH(马本沃尔夫公司)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 AgenticTyper利用代理AI自动类型化遗留软件项目,通过迭代错误纠正和行为保留技术,高效解决类型错误问题。

Comments Accepted at ICSE 2026 Student Research Competition (SRC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21553 2026-02-26 cs.IR cs.AI cs.LG 73%

Revisiting RAG Retrievers: An Information Theoretic Benchmark

重新审视RAG检索器:一个信息论基准

Wenqing Zheng, Dmitri Kalaev, Noah Fatsi, Daniel Barcklow, Owen Reinert, Igor Melnyk, Senthil Kumar, C. Bayan Bruss

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出MIGRASCOPE基准,通过信息论方法分析RAG检索器的性能、冗余和协同效应,揭示最佳检索器组合策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19922 2026-02-26 cs.CL cs.AI 73%

HEART: A Unified Benchmark for Assessing Humans and LLMs in Emotional Support Dialogue

HEART:一个评估人类和大语言模型在情感支持对话中能力的统一基准

Laya Iyer, Kriti Aggarwal, Sanmi Koyejo, Gail Heyman, Desmond C. Ong, Subhabrata Mukherjee

机构 * Stanford University(斯坦福大学) University of California, San Diego(加州大学圣地亚哥分校) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 评测与基准 :LLM(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 HEART通过多轮情感支持对话评估人类与大语言模型的能力差异,揭示两者在共情、一致性等维度上的表现及趋同趋势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22186 2026-02-26 cs.HC 71%

Codesigning Ripplet: an LLM-Assisted Assessment Authoring System Grounded in a Conceptual Model of Teachers' Workflows

协同设计Ripplet:一种基于教师工作流程概念模型的LLM辅助评估作者系统

Yuan Cui, Annabel Goldman, Jovy Zhou, Xiaolin Liu, Clarissa Shieh, Joshua Yao, Mia Cheng, Matthew Kay, Fumeng Yang

专题命中 评测与基准 :LLM(title)

AI总结 Ripplet通过协同设计帮助教师创建更多形成性评估,提升评估质量与实践效率

Comments Proceedings of the 2026 CHI Conference on Human Factors in Computing Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21941 2026-02-26 cs.CL 70%

MERRY: Semantically Decoupled Evaluation of Multimodal Emotional and Role Consistencies of Role-Playing Agents

MERRY: 多模态情感与角色一致性评估的语义解耦框架

Zhenyu Wang, Xiaofen Xing, Yirong Chen, Xiangmin Xu

专题命中 评测与基准 :LLM(abstract);prompting(abstract);分类 cs.CL

AI总结 MERRY提出一种语义解耦的评估框架,用于评估多模态角色扮演代理的情感与角色一致性,通过改进的指标和双向证据寻找任务提升评估效果。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00288 2026-02-26 cs.CV cs.AI 70%

TimeBlind: A Spatio-Temporal Compositionality Benchmark for Video LLMs

TimeBlind: 一种用于视频大语言模型的时空组合性基准

Baiqi Li, Kangyi Zhao, Ce Zhang, Chancharik Mitra, Jean de Dieu Nyandwi, Gedas Bertasius

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) University of Pittsburgh(匹兹堡大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 TimeBlind通过细粒度时空理解基准揭示视频大语言模型对时间动态理解的不足,展示其在实例准确率上的显著劣势,强调对静态视觉捷径的依赖。

Comments For code and data, see https://baiqi-li.github.io/timeblind_project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22033 2026-02-26 cs.CV 67%

RT-RMOT: A Dataset and Framework for RGB-Thermal Referring Multi-Object Tracking

RT-RMOT:一种用于RGB-热成像参照多目标跟踪的数据集和框架

Yanqiu Yu, Zhifan Jin, Sijia Chen, Tongfei Chu, En Yu, Liman Liu, Wenbing Tao

机构 * Huazhong University of Science and Technology(华中科技大学) South-Central Minzu University(西南民族大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 RT-RMOT提出一种融合RGB和热成像特征的多目标跟踪框架,通过改进的RL策略优化提升全天候跟踪性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21892 2026-02-26 cs.CR 67%

APFuzz: Towards Automatic Greybox Protocol Fuzzing

APFuzz:朝着自动灰盒协议模糊测试的方向

Yu Wang, Yang Xiang, Chandra Thapa, Hajime Suzuki

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 APFuzz通过状态模型和消息模型的创新设计,提升灰盒协议模糊测试的智能性,通过静态动态分析和字段级变异操作实现更高效的模糊测试。

Comments 12 pages, 4 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.00386 2026-02-26 cs.AR 67%

AssertLLM: Generating and Evaluating Hardware Verification Assertions from Design Specifications via Multi-LLMs

AssertLLM: 通过多语言模型生成和评估硬件验证断言

Wenji Fang, Mengming Li, Min Li, Zhiyuan Yan, Shang Liu, Hongce Zhang, Zhiyao Xie

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 AssertLLM通过多语言模型自动从设计规范生成准确的硬件验证断言,有效提升验证效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21595 2026-02-26 cs.RO 67%

SPOC: Safety-Aware Planning Under Partial Observability And Physical Constraints

SPOC:在部分可观测性和物理约束下安全意识的规划

Hyungmin Kim, Hobeom Jeon, Dohyung Kim, Minsu Jang, Jeahong Kim

机构 * 1 ETRI School, University of Science Technology, South Korean 2 Social Robotics Laboratory, Electronics

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 SPOC是一个用于评估安全意识具身任务规划的基准测试,通过整合部分可观测性、物理约束和逐步规划,解决现实环境中安全与可行性评估的问题。

Comments Accepted to IEEE ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02452 2026-02-26 cs.CL cs.AI cs.LG 67%

Do LLMs Adhere to Label Definitions? Examining Their Receptivity to External Label Definitions

大型语言模型是否遵循标签定义?检验其对外部标签定义的接受性

Seyedali Mohammadi, Bhaskara Hanuma Vedula, Hemank Lamba, Edward Raff, Ponnurangam Kumaraguru, Francis Ferraro, Manas Gaur

机构 * UMBC(美国马里兰大学伯克利分校) IIIT Hyderabad(印度海得拉巴理工学院) Dataminr, Inc.(数据矿研公司) CrowdStrike(CrowdStrike公司)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究发现大型语言模型在处理外部标签定义时,通常依赖内部表示而非显式定义,尤其在通用任务中表现更弱,而在领域特定任务中显式定义更有效。

Comments EMNLP 2025 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21327 2026-02-26 cs.LG cs.AI cs.CY 62%

Equitable Evaluation via Elicitation

通过 elicitation 实现公平评估

Elbert Du, Cynthia Dwork, Lunjia Hu, Reid McIlroy-Young, Han Shao, Linjun Zhang

机构 * Harvard University(哈佛大学) Northeastern University(东北大学) University of Maryland(马里兰大学) Rutgers University(罗格斯大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种交互式AI系统,通过elicitation准确评估技能并减少自我报告偏见,提升公平性。

Comments 27 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06899 2026-02-26 cs.CL cs.AI 62%

RPTS: Tree-Structured Reasoning Process Scoring for Faithful Multimodal Evaluation

RPTS: 基于树结构的推理过程评分用于忠实多模态评估

Haofeng Wang, Yu Zhang

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

AI总结 RPTS提出了一种基于树结构的评分方法,用于评估多模态推理过程的忠实度,通过构建推理树和动态权重调整,揭示模型推理中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22200 2026-02-26 cs.CL 57%

SumTablets: A Transliteration Dataset of Sumerian Tablets

SumTablets: 一则苏美尔泥板的转写数据集

Cole Simmons, Richard Diehl Martinez, Dan Jurafsky

机构 * Stanford University(斯坦福大学) University of Cambridge(剑桥大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 SumTablets数据集通过将苏美尔楔形文字泥板的Unicode表示与转写配对,为NLP方法应用于苏美尔转写提供了支持,展示了基于转换器的模型在快速验证转写方面的潜力。

Comments 11 pages with 3 figures

Journal ref Proceedings of the 1st Workshop on Machine Learning for Ancient Languages (ML4AL 2024), pages 192-202, Hybrid in Bangkok, Thailand and online. Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏