arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-18 至 2026-02-18 共收录 32 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32 篇

2601.15812 2026-02-18 cs.AI cs.CL 90%

ErrorMap and ErrorAtlas: Charting the Failure Landscape of Large Language Models

误差图与误差图谱:大型语言模型失败景观的绘制

Shir Ashury-Tahan, Yifan Mai, Elron Bandel, Michal Shmueli-Scheuer, Leshem Choshen

机构 * IBM Research(IBM研究院) Stanford University(斯坦福大学) MIT(麻省理工学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 ErrorMap和ErrorAtlas通过分析LLM失败原因,揭示模型弱点,为模型改进和评估提供更深入的洞察。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.06428 2026-02-18 cs.SE cs.CR 89%

Large Language Models for Secure Code Assessment: A Multi-Language Empirical Study

用于安全代码评估的大型语言模型:多语言实证研究

Kohei Dozono, Tiago Espinha Gasiba, Andrea Stocco

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文研究了多语言环境下大型语言模型在安全代码评估中的有效性,通过实验发现GPT-4o在漏洞检测和CWE分类中表现最佳,并开发了CODEGUARDIAN工具提升开发人员的漏洞检测效率。

Comments Accepted for publication at the 7th International Workshop on Deep Learning for Testing and Testing for Deep Learning (DeepTest 2026), co-located with ICSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15063 2026-02-18 cs.RO cs.HC 89%

How Do We Research Human-Robot Interaction in the Age of Large Language Models? A Systematic Review

在大语言模型时代如何研究人机交互?一项系统综述

Yufeng Wang, Yuan Xu, Anastasia Nikolova, Yuxuan Wang, Jianyu Wang, Chongyang Wang, Xin Tong

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Zhejiang University(浙江大学) Savannah College of Art and Design(萨凡纳艺术设计学院) West China Hospital, Sichuan University(四川大学华西医院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文系统综述了大语言模型时代人机交互的研究现状,揭示了LLMs对HRI基本原理的影响及当前研究的探索性特征,提出了未来研究的设计考虑与挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15312 2026-02-18 cs.CL econ.EM 88%

Extracting Consumer Insight from Text: A Large Language Model Approach to Emotion and Evaluation Measurement

从文本中提取消费者洞察:一种大型语言模型方法用于情绪和评价测量

Stephan Ludwig, Peter J. Danaher, Xiaohao Yang, Yu-Ting Lin, Ehsan Abedin, Dhruv Grewal, Lan Du

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本研究提出Linguistic eXtractor模型,通过大型语言模型有效测量消费者情绪和评价,验证情绪对购买行为的影响,并提供免费网页应用支持大规模分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21654 2026-02-18 cs.AI 88%

ScholarGym: Benchmarking Large Language Model Capabilities in the Information-Gathering Stage of Deep Research

ScholarGym:在深度研究的信息收集阶段评估大语言模型能力

Hao Shen, Hang Yang, Zhouhong Gu, Weili Han

机构 * Fudan University(复旦大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 ScholarGym通过分解深度研究信息收集阶段,评估大语言模型在查询规划、工具调用和相关性评估中的能力差异,揭示开源与专有模型性能差距的关键因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22211 2026-02-18 cs.CL cs.AI 87%

LogiPart: Local Large Language Models for Data Exploration at Scale with Logical Partitioning

LogiPart: 用于大规模数据探索的本地大语言模型与逻辑分区

Tiago Fernandes Tavares

机构 * Tiago Fernandes Tavares(独立研究者)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.AI

AI总结 LogiPart通过本地大语言模型与逻辑分区技术,在大规模数据探索中实现高效、可解释的税目发现,克服传统方法的效率与成本限制。

Comments This version introduces a major architectural shift to Local LLMs and NLI-based assignment, scaling the framework to O(1) generative complexity. Formerly titled 'Question-Driven Analysis and Synthesis'

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15532 2026-02-18 cs.AI cs.LG 87%

Quantifying construct validity in large language model evaluations

在大型语言模型评估中量化构念效度

Ryan Othniel Kearns

机构 * University of Oxford(牛津大学) St Catherine’s College(圣凯瑟琳学院) Oxford Internet Institute(牛津互联网研究所)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出结构能力模型,通过结合缩放定律和潜在因子模型,提升LLM评估中构念效度的量化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15758 2026-02-18 cs.CL cs.AI 86%

ChartEditBench: Evaluating Grounded Multi-Turn Chart Editing in Multimodal Language Models

ChartEditBench: 评估多轮视觉引导图表编辑在多模态语言模型中的表现

Manav Nitin Kapadnis, Lawanya Baghel, Atharva Naik, Carolyn Rosé

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 ChartEditBench通过代码进行多轮视觉引导图表编辑,评估多模态语言模型在持续、上下文感知编辑中的表现,揭示了多轮交互中错误累积和共享上下文失效的问题。

Comments 16 pages, 13 figures including Supplementary Material

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15761 2026-02-18 cs.SE 85%

A Differential Fuzzing-Based Evaluation of Functional Equivalence in LLM-Generated Code Refactorings

基于微分模糊测试的LLM生成代码重构功能等价性评估

Simantika Bhattacharjee Dristi, Matthew B. Dwyer

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出基于微分模糊测试的方法,评估LLM生成代码重构的功能等价性,发现LLM生成的重构存在显著语义偏差,现有测试套件难以检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15645 2026-02-18 cs.AI cs.CV 83%

CARE Drive A Framework for Evaluating Reason-Responsiveness of Vision Language Models in Automated Driving

CARE Drive:一种用于评估视觉语言模型在自动驾驶中推理响应性的框架

Lucas Elbert Suryana, Farah Bierenga, Sanne van Buuren, Pepijn Kooij, Elsefien Tulleners, Federico Scari, Simeon Calvert, Bart van Arem, Arkady Zgonnikov

机构 * organization= Department of Transport \& Planning, Faculty of Civil Engineering Geosciences, Delft University of Technology organization= Department of Cognitive Robotics, Faculty of Mechanical Engineering, Delft University of Technology organization= Centre for Meaningful Human Control, Delft University of Technology organization= Faculty of Mechanical Engineering, Delft University of Technology , city= Delft , country= The Netherlands

专题命中 评测与基准 :language model(title,abstract);foundation model(abstract);分类 cs.AI

AI总结 CARE Drive提出了一种评估视觉语言模型在自动驾驶中推理响应性的框架,通过受控上下文变化比较基线和增强模型决策,验证人类原因对决策的影响。

Comments 21 pages, on submission to Transportation Research Part C

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15681 2026-02-18 cs.DB 82%

A universal LLM Framework for General Query Refinements

通用大语言模型框架用于通用查询细化

Eldar Hacohen, Yuval Moskovitch, Amit Somech

专题命中 评测与基准 :LLM(title,abstract);prompting(abstract)

AI总结 OmniTune通过基于LLM的优化提示框架实现通用SQL查询细化,有效处理复杂查询约束和扩展应用场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15336 2026-02-18 cs.AR 82%

Human-AI Interaction: Evaluating LLM Reasoning on Digital Logic Circuit included Graph Problems, in terms of creativity in design and analysis

人类-人工智能交互:评估LLM在包含图问题的数字逻辑电路中的推理能力,就设计和分析的创造性而言

Yogeswar Reddy Thota, Setareh Rafatirad, Homayoun Houman, Tooraj Nikoubin

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract)

AI总结 评估LLM在数字逻辑电路问题中的推理能力,发现其在复杂问题上与官方答案存在差距,且易陷入教科书模板。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15323 2026-02-18 cs.CR cs.AI cs.LG 81%

Unforgeable Watermarks for Language Models via Robust Signatures

通过鲁棒签名实现语言模型的不可伪造水印

Huijia Lin, Kameron Shahabi, Min Jae Song

机构 * Paul G. Allen School of Computer Science & Engineering, University of Washington(保罗·G·艾伦计算机科学与工程学院,华盛顿大学) Data Science Institute, University of Chicago(数据科学研究所,芝加哥大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种通过鲁棒签名实现语言模型不可伪造水印的方法,增强了内容归属的安全性和可追溯性。

Comments 60 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09049 2026-02-18 cs.CL cs.LG 81%

Dial-In LLM: Human-Aligned LLM-in-the-loop Intent Clustering for Customer Service Dialogues

Dial-In LLM: 人类对齐的LLM-in-the-loop意图聚类用于客户服务对话

Mengze Hong, Wailing Ng, Chen Jason Zhang, Yuanfeng Song, Di Jiang

机构 * Hong Kong Polytechnic University(香港理工大学) AI Group, WeBank Co., Ltd(WeBank人工智能部门)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出LLM-in-the-loop意图聚类框架,通过整合LLM能力提升客户服务对话意图聚类的准确性和效率。

Comments Accepted by EMNLP 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15197 2026-02-18 cs.CL cs.AI 79%

OpaqueToolsBench: Learning Nuances of Tool Behavior Through Interaction

OpaqueToolsBench: 通过交互学习工具行为的细微差别

Skyler Hallinan, Thejas Venkatesh, Xiang Ren, Sai Praneeth Karimireddy, Ashwin Paranjape, Yuhao Zhang, Jack Hessel

机构 * University of Southern California(南加州大学) Samaya AI

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 OpaqueToolsBench通过交互学习工具行为的细微差别,提出ToolObserver框架有效改进不透明工具的文档化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15809 2026-02-18 stat.AP cs.AI 77%

Decision Quality Evaluation Framework at Pinterest

Pinpoint 决策质量评估框架

Yuqi Tian, Robert Paine, Attila Dobi, Kevin O'Sullivan, Aravindh Manickavasagam, Faisal Farooq

机构 * Pinterest

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Pinpoint 提出了一种决策质量评估框架,通过高可信度黄金集和智能采样管道,提升内容安全系统的数据驱动管理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15436 2026-02-18 cs.CL 77%

Measuring Social Integration Through Participation: Categorizing Organizations and Leisure Activities in the Displaced Karelians Interview Archive using LLMs

通过参与度测量社会整合:利用LLMs对 displaced Karelians 采访档案中的组织和休闲活动进行分类

Joonatan Laato, Veera Schroderus, Jenna Kanerva, Jenni Kauppi, Virpi Lummaa, Filip Ginter

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 利用LLMs对卡累利亚疏散家庭采访中的组织和休闲活动进行分类,以测量社会整合并生成结构化资源。

Comments Presented at: The 10th Joint SIGHUM Workshop on Computational Linguistics for Cultural Heritage, Social Sciences, Humanities and Literature; EACL 2026 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15508 2026-02-18 cs.IR 75%

Eco-Amazon: Enriching E-commerce Datasets with Product Carbon Footprint for Sustainable Recommendations

Eco-Amazon: 通过产品碳足迹增强电商数据集以实现可持续推荐

Giuseppe Spillo, Allegra De Filippo, Cataldo Musto, Michela Milano, Giovanni Semeraro

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 Eco-Amazon通过引入产品碳足迹数据,增强电商数据集以促进可持续推荐系统的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10807 2026-02-18 cs.CV 75%

Prompts to Summaries: Zero-Shot Language-Guided Video Summarization with Large Language and Video Models

提示到摘要:基于大语言和视频模型的零样本语言引导视频摘要

Mario Barbara, Alaa Maalouf

机构 * Department of Computer Science, the University of Haifa(哈ifa大学计算机科学系)

专题命中 评测与基准 :LLM(abstract);language model(abstract);prompting(abstract)

AI总结 提出一种基于大语言和视频模型的零样本视频摘要方法,通过提示生成用户引导的摘要,无需训练数据,优于现有无监督和监督方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18545 2026-02-18 cs.CR cs.AI cs.CL cs.IR 73%

PII-Bench: Evaluating Query-Aware Privacy Protection Systems

PII-Bench:评估查询感知隐私保护系统

Hao Shen, Zhouhong Gu, Haokai Hong, Weili Han

机构 * Institute of Fintech, Fudan University(复旦大学金融科技学院) Shanghai Key Laboratory of Data Science, School of Computer Science, Fudan University(复旦大学数据科学上海重点实验室) Laboratory of Data Analytics and Security, Fudan University(复旦大学数据安全分析实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 PII-Bench通过评估查询感知隐私保护系统,揭示当前模型在识别PII相关性方面的不足,提出改进方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15384 2026-02-18 cs.AI cs.CL 73%

World-Model-Augmented Web Agents with Action Correction

具有动作修正的世界模型增强型网络代理

Zhouzhou Shen, Xueyu Hu, Xiyun Li, Tianqing Fang, Juncheng Li, Shengyu Zhang

机构 * Zhejiang University(浙江大学) Tencent AI Lab(腾讯AI实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 WAC通过多代理协作和风险感知机制,提升网络代理在复杂任务中的鲁棒性和执行效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15034 2026-02-18 cs.CL cs.AI 73%

EduResearchBench: A Hierarchical Atomic Task Decomposition Benchmark for Full-Lifecycle Educational Research

EduResearchBench: 一个用于全生命周期教育研究的分层原子任务分解基准

Houping Yue, Zixiang Di, Mei Jiang, Bingdong Li, Hao Hao, Yu Song, Bo Jiang, Aimin Zhou

机构 * Shanghai Institute of AI for Education, East China Normal University(上海人工智能教育研究院,东华大学) Shanghai Innovation Institute(上海创新研究院) School of Computer Science and Technology, East China Normal University(东华大学计算机科学与技术学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 EduResearchBench通过分层原子任务分解框架,构建了首个教育学术写作评估平台,展示了在垂直领域中数据质量和分层训练的重要性。

Comments 13 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08535 2026-02-18 hep-ph cs.AI cs.LG hep-ex physics.data-an 73%

Agents of Discovery

发现的代理

Sascha Diefenbacher, Anna Hallin, Gregor Kasieczka, Michael Krämer, Anne Lauscher, Tim Lukas

机构 * Physics Division, Lawrence Berkeley National Laboratory(劳伦斯伯克利国家实验室物理部) Institut für Experimentalphysik, Universität Hamburg(汉堡大学实验物理研究所) Institute for Theoretical Particle Physics and Cosmology, RWTH Aachen University(亚琛工业大学理论粒子物理与宇宙学研究所) Data Science Group, Universität Hamburg(汉堡大学数据科学组)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 利用大型语言模型创建代理团队,通过代码生成和迭代优化实现数据分析问题的自动化解决。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02766 2026-02-18 cs.CY cs.AI 70%

The Generative Reasonable Person

生成合理之人

Yonathan A. Arbel

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出生成合理之人工具,通过模拟大量决策数据,揭示模型在判断合理性时与人类相似的模式,挑战传统教科书观点,并为司法和监管提供新的实证依据。

Comments 51 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08550 2026-02-18 cs.CL 70%

Transferring Extreme Subword Style Using Ngram Model-Based Logit Scaling

使用基于ngram模型的logit缩放进行极端子词风格转移

Craig Messner, Tom Lippincott

机构 * Center for Digital Humanities(数字人文中心) Johns Hopkins University(约翰霍普金斯大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出基于ngram模型的logit缩放技术,用于在推理阶段将极端子词风格转移到大型语言模型中,通过调整困惑度实现风格迁移与流畅性的平衡。

Comments Accepted for publication at NLP4DH 2025 @ NAACL

Journal ref Proceedings of the 5th International Conference on Natural Language Processing for Digital Humanities (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15591 2026-02-18 cs.SE 67%

Req2Road: A GenAI Pipeline for SDV Test Artifact Generation and On-Vehicle Execution

Req2Road: 一个用于SDV测试资产生成和车载执行的生成式AI管道

Denesa Zyberaj, Lukasz Mazur, Pascal Hirmer, Nenad Petrovic, Marco Aiello, Alois Knoll

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出了一种生成式AI管道,用于SDV子系统的测试资产生成和车载执行,通过自动化生成Gherkin场景并验证其可执行性。

Comments accepted at CAiSE 2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15660 2026-02-18 cs.CV cs.AI 57%

Bayesian Optimization for Design Parameters of 3D Image Data Analysis

基于贝叶斯优化的3D图像数据分析设计参数优化

David Exler, Joaquin Eduardo Urrutia Gómez, Martin Krüger, Maike Schliephake, John Jbeily, Mario Vitacolonna, Rüdiger Rudolf, Markus Reischl

机构 * Institute for Automation and Applied Informatics, Karlsruhe Institute of Technology(自动化与应用信息学院,卡尔斯鲁厄技术大学) CeMOS Research and Transfer Center, Technische Hochschule Mannheim(CeMOS研究与转移中心,技术大学曼海姆) Institute of Biological and Chemical Systems, Karlsruhe Institute of Technology(生物与化学系统研究所,卡尔斯鲁厄技术大学)

专题命中 评测与基准 :pretraining(abstract);分类 cs.AI

AI总结 本文提出基于贝叶斯优化的3D图像数据分析优化流水线,通过两个阶段自动选择分割模型和分类器设计,提升大规模生物医学成像的分析效率。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15273 2026-02-18 cs.CY cs.CL 57%

FrameRef: A Framing Dataset and Simulation Testbed for Modeling Bounded Rational Information Health

FrameRef: 一个用于建模有限理性信息健康的框架数据集和仿真测试平台

Victor De Lima, Jiqun Liu, Grace Hui Yang

机构 * University of Oklahoma(俄克拉荷马大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 FrameRef通过仿真框架研究有限理性信息健康的动态,提供系统性数据集和方法论,影响人类判断和信息健康轨迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06134 2026-02-18 cs.AI 57%

OpenAgentSafety: A Comprehensive Framework for Evaluating Real-World AI Agent Safety

OpenAgentSafety: 一个全面评估现实世界AI代理安全性的框架

Sanidhya Vijayvargiya, Aditya Bharat Soni, Xuhui Zhou, Zora Zhiruo Wang, Nouha Dziri, Graham Neubig, Maarten Sap

机构 * Language Technologies Institute, Carnegie Mellon University(语言技术研究所,卡内基梅隆大学) Allen Institute for Artificial Intelligence(人工智能研究院)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 OpenAgentSafety提出一个全面评估AI代理安全性的框架,通过真实工具和多任务测试揭示代理在现实世界中的安全漏洞,强调需要加强安全防护。

Comments 26 pages, 10 figures, Accepted at ICLR 2026 and IASEAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04826 2026-02-18 astro-ph.GA 50%

Subaru High-z Exploration of Low-Luminosity Quasars (SHELLQs) XXII. Chandra observations of narrow-line quasar candidates at z>6

Subaru高红移低亮度类星体探索(SHELLQs)XXII. Chandra观测窄线类星体候选体在z>6

K. Iwasawa, R. Gilli, F. Vito, Y. Matsuoka, M. Onoue, M. A. Strauss, N. Kashikawa, Y. Toba, K. Shimasaku, K. Inayoshi, T. Nagao, N. Kawanaka, J. D. Silverman, T. Izumi, K. Kohno, Y. Ueda

专题命中 评测与基准 :prompting(abstract)

AI总结 SHELLQs项目利用Chandra观测z~6的窄线类星体候选体,发现其X射线安静,可能由遮挡物质导致,推测为再电离时期被遮挡的明亮AGN。

Comments A&A in press, 9 pages, 7 figures, plus one-page appendix. Updated reference list

Journal ref A&A 706, A305 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏