arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-24 至 2026-02-24 共收录 347 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 82 篇

2503.19356 2026-02-24 cs.CV 71%

Can Vision-Language Models Answer Face to Face Questions in the Real-World?

视觉-语言模型能否在现实世界中回答面对面问题?

Reza Pourreza, Rishit Dagli, Apratim Bhattacharyya, Sunny Panchal, Guillaume Berger, Roland Memisevic

机构 * Qualcomm AI Research(高通人工智能研究)

专题命中 评测与基准 :language model(title)

AI总结 本文提出了一种新的数据集IVD,用于评估视觉-语言模型在现实世界中回答面对面问题的能力,并通过微调减少与人类表现的差距。

Comments ICLR 2026 paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19133 2026-02-24 cs.CL 70%

A Dataset for Named Entity Recognition and Relation Extraction from Art-historical Image Descriptions

一个用于艺术史图像描述中命名实体识别和关系提取的数据集

Stefanie Schneider, Miriam Göldl, Julian Stalter, Ricarda Vollmer

机构 * Marburg University(马尔堡大学) Ruhr University Bochum(波鸿鲁尔大学) University of Munich(慕尼黑大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出FRAME数据集,用于艺术史图像描述中的命名实体识别和关系提取,支持实体链接和知识图谱构建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23828 2026-02-24 cs.CL 70%

Beyond Understanding: Evaluating the Pragmatic Gap in LLMs' Cultural Processing of Figurative Language

超越理解:评估LLMs在处理隐喻语言中的文化差距

Mena Attia, Aashiq Muhamed, Mai Alkhamissi, Thamar Solorio, Mona Diab

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文评估了LLMs在处理隐喻语言中的文化理解差距,发现其在语用使用方面存在显著挑战,并发布了首个埃及阿拉伯语习语数据集用于进一步研究。

Comments EACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18540 2026-02-24 cs.CV cs.AI 70%

Rodent-Bench

Rodent-Bench:用于评估多模态大语言模型在啮齿动物行为标注中的性能

Thomas Heap, Laurence Aitchison, Emma Cahill, Adriana Casado Rodriguez

机构 * University of Bristol(布里斯托大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Rodent-Bench评估了多模态大语言模型在啮齿动物行为标注中的性能,发现现有模型存在时间分段、长视频处理和细微行为区分方面的挑战,为未来模型发展提供参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18520 2026-02-24 cs.CV cs.AI 70%

Sketch2Feedback: Grammar-in-the-Loop Framework for Rubric-Aligned Feedback on Student STEM Diagrams

Sketch2Feedback: 用于学生STEM图表的基于语法规则的反馈框架

Aayam Bansal

机构 * IEEE

专题命中 评测与基准 :LLM(abstract);language model(abstract);分类 cs.AI

AI总结 Sketch2Feedback通过结合语法规则和视觉语言模型,提高了学生STEM图表反馈的准确性与可靠性,展示了语法规则与端到端方法的互补性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18462 2026-02-24 cs.CY cs.AI 70%

Assessing the Reliability of Persona-Conditioned LLMs as Synthetic Survey Respondents

评估基于人设的大型语言模型作为合成调查受访者可靠性

Erika Elizabeth Taday Morocho, Lorenzo Cima, Tiziano Fagni, Marco Avvenuti, Stefano Cresci

机构 * IIT-CNR, University of Pisa(IIT-CNR与比萨大学) University of Florence(佛罗伦萨大学) University of Pisa(比萨大学)

专题命中 评测与基准 :LLM(abstract);prompting(abstract);分类 cs.AI

AI总结 本文评估了基于人设的LLM作为合成调查受访者可靠性,发现多属性提示可能引入偏差,影响子群体的忠实性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13870 2026-02-24 cs.CL 70%

ADAB: Arabic Dataset for Automated Politeness Benchmarking -- A Large-Scale Resource for Computational Sociopragmatics

ADAB: 阿拉伯语自动礼貌性评估数据集 -- 一个大规模资源用于计算社会语言学

Hend Al-Khalifa, Nadia Ghezaiel, Maria Bounnit, Hend Hamed Alhazmi, Noof Abdullah Alfear, Reem Fahad Alqifari, Ameera Masoud Almasoud, Sharefah Al-Ghamdi

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 ADAB数据集通过标注阿拉伯语中的礼貌、不礼貌和中性文本,为计算社会语言学提供大规模资源,支持礼貌感知的阿拉伯语NLP研究。

Comments Paper accepted @ The Fifteenth biennial Language Resources and Evaluation Conference (LREC2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10471 2026-02-24 cs.SE cs.CL 70%

TestExplora: Benchmarking LLMs for Proactive Bug Discovery via Repository-Level Test Generation

TestExplora: 通过仓库级测试生成对LLMs进行主动bug发现的基准测试

Steven Liu, Jane Luo, Xin Zhang, Aofan Liu, Hao Liu, Jie Wu, Ziyang Huang, Yangyu Huang, Yu Kang, Scarlett Li

机构 * Microsoft(微软公司) School of ECE, Peking University(北京大学电子工程学院) Tsinghua University(清华大学) Chinese Academy of Sciences(中国科学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 TestExplora通过仓库级测试生成评估LLMs在主动bug发现中的能力,揭示了当前模型在复杂交互和代理探索方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11867 2026-02-24 cs.SE cs.AI 70%

AI-Augmented CI/CD Pipelines: From Code Commit to Production with Autonomous Decisions

AI增强的CI/CD流水线:从代码提交到生产中的自主决策

Mohammad Baqar, Saba Naqvi, Rajat Khanda

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出AI增强的CI/CD流水线,利用大语言模型和自主代理提升软件交付效率,通过参考架构、决策分类法和信任层级框架实现自动化决策,减少人工干预和延迟。

Comments 13 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05690 2026-02-24 cs.CL 70%

When to use Graphs in RAG: A Comprehensive Analysis for Graph Retrieval-Augmented Generation

在何时使用图在RAG中:图检索增强生成的全面分析

Zhishang Xiang, Chuanjie Wu, Qinggang Zhang, Shengyuan Chen, Zijin Hong, Xiao Huang, Jinsong Su

机构 * Xiamen University(厦门大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出GraphRAG-Bench基准,系统分析GraphRAG在不同任务中的表现,揭示其在特定场景下的优势与适用条件。

Comments All resources and analyses are collected at https://github.com/GraphRAG-Bench/GraphRAG-Benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19560 2026-02-24 cs.HC 67%

Identifying, Explaining, and Correcting Ableist Language with AI

通过人工智能识别、解释和纠正歧视性语言

Kynnedy Simone Smith, Lydia B. Chilton, Danielle Bragg

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本研究探讨了大型语言模型在纠正歧视性语言和促进包容性沟通中的潜力,并通过实验评估了AI与人类注释在效果和用户偏好上的差异。

Comments 17 pages, 6 figures, Accepted for publication in CHI'26, Barcelona, Spain, April 13 - 17, 2026; CHI '26: ACM CHI Conference on Human Factors in Computing Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19547 2026-02-24 cs.CR 67%

CIBER: A Comprehensive Benchmark for Security Evaluation of Code Interpreter Agents

CIBER:代码解释器代理安全评估的综合基准

Lei Ba, Qinbin Li, Songze Li

专题命中 评测与基准 :LLM(abstract);foundation model(abstract)

AI总结 CIBER提出了一种综合基准,评估代码解释器代理对四种主要对抗性攻击的鲁棒性,揭示了模型架构、对齐和智能水平对安全的影响,以及自然语言伪装和安全极化现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19276 2026-02-24 cs.SE 67%

ComUICoder: Component-based Reusable UI Code Generation for Complex Websites via Semantic Segmentation and Element-wise Feedback

ComUICoder:基于语义分割和元素反馈的组件式可重用UI代码生成用于复杂网站

Jingyu Xiao, Jiantong Qin, Shuoqi Li, Man Ho Lam, Yuxuan Wan, Jen-tse Huang, Yintong Huo, Michael R. Lyu

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 ComUICoder通过语义分割和元素反馈技术,提升复杂网站中可重用UI代码的生成质量与重用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18444 2026-02-24 cs.HC cs.CY 67%

LunaAI: A Polite and Fair Healthcare Guidance Chatbot

LunaAI:一种礼貌且公平的医疗指导聊天机器人

Yuvarani Ganesan, Salsabila Harlen, Azfar Rahman Bin Fazul Rahman, Akashdeep Singh, Zahra Fathanah, Raja Jamilah Raja Yusof

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 LunaAI通过整合伦理沟通原则,提升了医疗聊天机器人在礼貌性和公平性方面的表现,为敏感医疗场景的人机交互提供了新的解决方案。

Comments 26 pages, 10 figures. User-centered evaluation of a polite and fair healthcare chatbot

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19237 2026-02-24 cs.LG cs.AI 62%

Evaluating SAP RPT-1 for Enterprise Business Process Prediction: In-Context Learning vs. Traditional Machine Learning on Structured SAP Data

评估SAP RPT-1对企业业务流程预测的性能:基于上下文学习与传统机器学习在结构化SAP数据上的对比

Amit Lal

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本文评估了SAP RPT-1在企业业务流程预测中的性能,发现其在有限数据下表现优于传统机器学习模型,提出混合工作流程提升实用性。

Comments 12 pages, 5 figures, 32 references. Reproducible experiments available at Hugging Face Spaces

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18495 2026-02-24 cs.DB cs.AI cs.LG 62%

RDBLearn: Simple In-Context Prediction Over Relational Databases

RDBLearn: 关系数据库中的简单上下文预测

Yanlin Zhang, Linjie Xu, Quan Gan, David Wipf, Minjie Wang

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 RDBLearn通过关系数据库中的上下文学习方法,实现了对多表关联数据的高效预测,优于传统监督基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07135 2026-02-24 cs.LG cs.AI 62%

Landscaper: Understanding Loss Landscapes Through Multi-Dimensional Topological Analysis

Landscaper:通过多维拓扑分析理解损失景观

Jiaqing Chen, Nicholas Hadler, Tiankai Xie, Rostyslav Hnatyshyn, Caleb Geniesse, Yaoqing Yang, Michael W. Mahoney, Talita Perciano, John F. Hartwig, Ross Maciejewski, Gunther H. Weber

机构 * Arizona State University(亚利桑那州立大学) University of California Berkeley(加州大学伯克利分校) Lawrence Berkeley National Laboratory(伯克利国家实验室) Dartmouth College(达特茅斯学院) International Computer Science Institute(国际计算机科学研究所)

专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG

AI总结 Landscaper通过多维拓扑分析揭示损失景观的几何结构,利用SMAD度量景观平滑度,提升模型诊断与架构设计能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05761 2026-02-24 cs.AI cs.CL 62%

Early Multimodal Prediction of Cross-Lingual Meme Virality on Reddit: A Time-Window Analysis

早期多模态预测跨语言Reddit迷因病毒性:时间窗口分析

Sedat Dogan, Nina Dethlefs, Debarati Chakraborty

机构 * School of Computer Science, University of Hull(赫尔大学计算机科学学院) Loughborough University(洛桑大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种基于多模态特征的迷因病毒性预测方法,通过时间窗口分析展示早期预测的可行性,并揭示了网络和时间特征对突破内容限制的重要性。

Comments Accepted to ACM WebSci 2026. 10 pages, 9 fiures and 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07087 2026-02-24 cs.DB cs.AI cs.CL 62%

SQL-Exchange: Transforming SQL Queries Across Domains

SQL-Exchange: 跨领域转换SQL查询

Mohammadreza Daviran, Brian Lin, Davood Rafiei

机构 * University of Alberta(阿尔伯塔大学)

专题命中 评测与基准 :prompting(abstract);分类 cs.CL、cs.AI

AI总结 SQL-Exchange通过跨领域转换SQL查询提升文本到SQL系统的上下文学习性能。

Comments Accepted to PVLDB 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20144 2026-02-24 eess.SY cs.AI cs.NI cs.SY 57%

Agentic AI for Scalable and Robust Optical Systems Control

面向可扩展和鲁棒光学系统控制的代理AI

Zehao Wang, Mingzhe Han, Wei Cheng, Yue-Kai Huang, Philip Ji, Denton Wu, Mahdi Safari, Flemming Holtorf, Kenaish AlQubaisi, Norbert M. Linke, Danyang Zhuo, Yiran Chen, Ting Wang, Dirk Englund, Tingjun Chen

机构 * Department of Electrical and Computer Engineering, Duke University(电气与计算机工程系,杜克大学) Duke Quantum Center and Department of Physics, Duke University(杜克量子中心和物理系,杜克大学) Department of Computer Science, Duke University(计算机科学系,杜克大学) NEC Laboratories America(NEC美国实验室) Axiomatic AI(公理AI) Joint Quantum Institute, Department of Physics, and the National Quantum Laboratory (QLab), University of Maryland(联合量子研究所、物理系以及国家量子实验室(QLab),马里兰大学) Research Laboratory of Electronics, Massachusetts Institute of Technology(电子研究实验室,麻省理工学院)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 AgentOptics通过代理AI框架实现异构光学系统的可扩展和鲁棒自主控制,展示了高保真任务成功率和多任务协调能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19539 2026-02-24 cs.CV cs.CR cs.LG 57%

Can a Teenager Fool an AI? Evaluating Low-Cost Cosmetic Attacks on Age Estimation Systems

青少年能否欺骗AI?评估低成本的外貌攻击对年龄估计系统的影响

Xingyu Shen, Tommy Duong, Xiaodong An, Zengqi Zhao, Zebang Hu, Haoyu Hu, Ziyou Wang, Finn Guo, Simiao Ren

机构 * Reality Inc UC Berkeley(伯克利大学) Duke University(杜克大学) Georgia Tech(佐治亚理工学院) UNC Chapel Hill(北卡罗来纳大学教堂山分校) UC San Diego(南加州大学)

专题命中 评测与基准 :language model(abstract);分类 cs.LG

AI总结 研究评估了低成本外貌攻击对年龄估计系统的影响,发现合成胡须等修改可使AI将未成年人误判为成年人,视觉-语言模型的鲁棒性略低于专门模型。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00523 2026-02-24 cs.AI cs.CV 57%

VIRTUE: Visual-Interactive Text-Image Universal Embedder

VIRTUE: 视觉-交互文本-图像通用嵌入器

Wei-Yao Wang, Kazuya Tateishi, Qiyu Wu, Shusuke Takahashi, Yuki Mitsufuji

机构 * Sony Group Corporation(索尼集团有限公司) Sony AI(索尼人工智能)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 VIRTUE通过引入视觉交互能力,提升图像和文本的联合表示学习,实现更精确的实体级信息处理和应用拓展。

Comments ICLR 2026. 25 pages. Project page: https://sony.github.io/virtue/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18729 2026-02-24 cs.CV cs.AI 57%

MiSCHiEF: A Benchmark in Minimal-Pairs of Safety and Culture for Holistic Evaluation of Fine-Grained Image-Caption Alignment

MiSCHiEF:安全与文化最小对基准用于细粒度图像-描述对齐的全面评估

Sagarika Banerjee, Tangatar Madi, Advait Swaminathan, Nguyen Dao Minh Anh, Shivank Garg, Kevin Zhu, Vasu Sharma

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 MiSCHiEF通过安全与文化最小对基准,评估细粒度图像-描述对齐的挑战,揭示当前VLMs在模态对齐上的持续问题。

Comments EACL 2026, Main, Short Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01678 2026-02-24 cs.LG 57%

HeurekaBench: A Benchmarking Framework for AI Co-scientist

HeurekaBench: 一个用于AI合作者的基准评估框架

Siba Smarak Panigrahi, Jovana Videnović, Maria Brbić

机构 * École Polytechnique Fédérale de Lausanne (EPFL)(瑞士联邦理工学院(EPFL))

专题命中 评测与基准 :LLM(abstract);分类 cs.LG

AI总结 HeurekaBench通过创建基于真实科学流程的基准,为评估AI合作者提供了一种方法,通过半自动流程生成探索性问题,并展示了批评模块对提升代理性能的效果。

Comments 33 pages, 5 figures, 7 tables. Code available at https://github.com/mlbio-epfl/HeurekaBench. Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07390 2026-02-24 cs.LG 57%

Learning Collective Variables from BioEmu with Time-Lagged Generation

从BioEmu中学习集体变量

Seonghyun Park, Kiyoung Seong, Soojung Yang, Rafael Gómez-Bombarelli, Sungsoo Ahn

机构 * KAIST(韩国科学技术院) MIT(麻省理工学院)

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 本文提出BioEmu-CV框架,通过从BioEmu中自动学习集体变量,用于快速折叠蛋白质的自由能估计和过渡路径采样。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13069 2026-02-24 cs.AI 57%

Ambig-SWE: Interactive Agents to Overcome Underspecificity in Software Engineering

Ambig-SWE: 交互式代理以克服软件工程中的不充分性

Sanidhya Vijayvargiya, Xuhui Zhou, Akhila Yerukola, Maarten Sap, Graham Neubig

机构 * Language Technologies Institute, Carnegie Mellon University(语言技术研究所,卡内基梅隆大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 Ambig-SWE研究LLM代理在交互式代码生成中处理不充分指令的能力,通过检测不充分性、提问澄清和利用交互提升性能,发现交互能显著提高74%的性能。

Comments 22 pages, 7 figures, Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17258 2026-02-24 cs.CV 50%

FineVAU: A Novel Human-Aligned Benchmark for Fine-Grained Video Anomaly Understanding

FineVAU: 一种新的细粒度视频异常理解对齐基准

João Pereira, Vasco Lopes, João Neves, David Semedo

专题命中 评测与基准 :LLM(abstract)

AI总结 FineVAU提出了一种新的视频异常理解基准,通过引入FVScore和FineW3数据集,提升对异常事件的细粒度和领域特定理解,解决现有评估方法与人类感知不一致的问题。

Comments Accepted at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19694 2026-02-24 cs.ET 50%

All Cities are Equal: A Unified Human Mobility Generation Model Enabled by LLMs

所有城市都平等:由大语言模型赋能的统一人类移动生成模型

Bo Liu, Tong Li, Zhu Xiao, Ruihui Li, Geyong Min, Zhuo Tang, Kenli Li

专题命中 评测与基准 :LLM(abstract)

AI总结 UniMob通过大语言模型驱动的旅行规划器、统一空间嵌入模块和扩散生成器,实现跨城市的人类移动生成,显著提升模型性能和鲁棒性。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19507 2026-02-24 cs.HC 50%

Conversational AI for Automated Patient Questionnaire Completion: Development Insights and Design Principles

用于自动患者问卷完成的对话式AI:开发见解与设计原则

David Fraile Navarro, Mor Peleg

专题命中 评测与基准 :LLM(abstract)

AI总结 本文提出了一种基于生成式AI的对话代理,用于自动完成患者问卷,通过主题对话提高数据收集效率,并总结了设计原则和开发经验。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19178 2026-02-24 cs.CV 50%

EMAD: Evidence-Centric Grounded Multimodal Diagnosis for Alzheimer's Disease

EMAD: 基于证据的多模态诊断框架用于阿尔茨海默病

Qiuhui Chen, Xuancheng Yao, Zhenglei Zhou, Xinyue Hu, Yi Hong

机构 * East China University of Science and Technology(东华大学) Shanghai Jiao Tong University(上海交通大学) Tencent(腾讯)

专题命中 评测与基准 :language model(abstract)

AI总结 EMAD通过多模态证据接地机制,生成结构化诊断报告,提升阿尔茨海默病诊断的透明度和临床一致性。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏