arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-18 至 2026-02-18 共收录 145 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32 篇

2602.15312 2026-02-18 cs.CL econ.EM 88%

Extracting Consumer Insight from Text: A Large Language Model Approach to Emotion and Evaluation Measurement

从文本中提取消费者洞察:一种大型语言模型方法用于情绪和评价测量

Stephan Ludwig, Peter J. Danaher, Xiaohao Yang, Yu-Ting Lin, Ehsan Abedin, Dhruv Grewal, Lan Du

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本研究提出Linguistic eXtractor模型,通过大型语言模型有效测量消费者情绪和评价,验证情绪对购买行为的影响,并提供免费网页应用支持大规模分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21654 2026-02-18 cs.AI 88%

ScholarGym: Benchmarking Large Language Model Capabilities in the Information-Gathering Stage of Deep Research

ScholarGym:在深度研究的信息收集阶段评估大语言模型能力

Hao Shen, Hang Yang, Zhouhong Gu, Weili Han

机构 * Fudan University(复旦大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 ScholarGym通过分解深度研究信息收集阶段,评估大语言模型在查询规划、工具调用和相关性评估中的能力差异,揭示开源与专有模型性能差距的关键因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22211 2026-02-18 cs.CL cs.AI 87%

LogiPart: Local Large Language Models for Data Exploration at Scale with Logical Partitioning

LogiPart: 用于大规模数据探索的本地大语言模型与逻辑分区

Tiago Fernandes Tavares

机构 * Tiago Fernandes Tavares(独立研究者)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.AI

AI总结 LogiPart通过本地大语言模型与逻辑分区技术,在大规模数据探索中实现高效、可解释的税目发现,克服传统方法的效率与成本限制。

Comments This version introduces a major architectural shift to Local LLMs and NLI-based assignment, scaling the framework to O(1) generative complexity. Formerly titled 'Question-Driven Analysis and Synthesis'

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15532 2026-02-18 cs.AI cs.LG 87%

Quantifying construct validity in large language model evaluations

在大型语言模型评估中量化构念效度

Ryan Othniel Kearns

机构 * University of Oxford(牛津大学) St Catherine’s College(圣凯瑟琳学院) Oxford Internet Institute(牛津互联网研究所)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出结构能力模型,通过结合缩放定律和潜在因子模型,提升LLM评估中构念效度的量化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15758 2026-02-18 cs.CL cs.AI 86%

ChartEditBench: Evaluating Grounded Multi-Turn Chart Editing in Multimodal Language Models

ChartEditBench: 评估多轮视觉引导图表编辑在多模态语言模型中的表现

Manav Nitin Kapadnis, Lawanya Baghel, Atharva Naik, Carolyn Rosé

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 ChartEditBench通过代码进行多轮视觉引导图表编辑,评估多模态语言模型在持续、上下文感知编辑中的表现,揭示了多轮交互中错误累积和共享上下文失效的问题。

Comments 16 pages, 13 figures including Supplementary Material

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15761 2026-02-18 cs.SE 85%

A Differential Fuzzing-Based Evaluation of Functional Equivalence in LLM-Generated Code Refactorings

基于微分模糊测试的LLM生成代码重构功能等价性评估

Simantika Bhattacharjee Dristi, Matthew B. Dwyer

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出基于微分模糊测试的方法,评估LLM生成代码重构的功能等价性,发现LLM生成的重构存在显著语义偏差,现有测试套件难以检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15645 2026-02-18 cs.AI cs.CV 83%

CARE Drive A Framework for Evaluating Reason-Responsiveness of Vision Language Models in Automated Driving

CARE Drive:一种用于评估视觉语言模型在自动驾驶中推理响应性的框架

Lucas Elbert Suryana, Farah Bierenga, Sanne van Buuren, Pepijn Kooij, Elsefien Tulleners, Federico Scari, Simeon Calvert, Bart van Arem, Arkady Zgonnikov

机构 * organization= Department of Transport \& Planning, Faculty of Civil Engineering Geosciences, Delft University of Technology organization= Department of Cognitive Robotics, Faculty of Mechanical Engineering, Delft University of Technology organization= Centre for Meaningful Human Control, Delft University of Technology organization= Faculty of Mechanical Engineering, Delft University of Technology , city= Delft , country= The Netherlands

专题命中 评测与基准 :language model(title,abstract);foundation model(abstract);分类 cs.AI

AI总结 CARE Drive提出了一种评估视觉语言模型在自动驾驶中推理响应性的框架,通过受控上下文变化比较基线和增强模型决策,验证人类原因对决策的影响。

Comments 21 pages, on submission to Transportation Research Part C

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15681 2026-02-18 cs.DB 82%

A universal LLM Framework for General Query Refinements

通用大语言模型框架用于通用查询细化

Eldar Hacohen, Yuval Moskovitch, Amit Somech

专题命中 评测与基准 :LLM(title,abstract);prompting(abstract)

AI总结 OmniTune通过基于LLM的优化提示框架实现通用SQL查询细化,有效处理复杂查询约束和扩展应用场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15336 2026-02-18 cs.AR 82%

Human-AI Interaction: Evaluating LLM Reasoning on Digital Logic Circuit included Graph Problems, in terms of creativity in design and analysis

人类-人工智能交互:评估LLM在包含图问题的数字逻辑电路中的推理能力,就设计和分析的创造性而言

Yogeswar Reddy Thota, Setareh Rafatirad, Homayoun Houman, Tooraj Nikoubin

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract)

AI总结 评估LLM在数字逻辑电路问题中的推理能力,发现其在复杂问题上与官方答案存在差距,且易陷入教科书模板。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15323 2026-02-18 cs.CR cs.AI cs.LG 81%

Unforgeable Watermarks for Language Models via Robust Signatures

通过鲁棒签名实现语言模型的不可伪造水印

Huijia Lin, Kameron Shahabi, Min Jae Song

机构 * Paul G. Allen School of Computer Science & Engineering, University of Washington(保罗·G·艾伦计算机科学与工程学院,华盛顿大学) Data Science Institute, University of Chicago(数据科学研究所,芝加哥大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种通过鲁棒签名实现语言模型不可伪造水印的方法,增强了内容归属的安全性和可追溯性。

Comments 60 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09049 2026-02-18 cs.CL cs.LG 81%

Dial-In LLM: Human-Aligned LLM-in-the-loop Intent Clustering for Customer Service Dialogues

Dial-In LLM: 人类对齐的LLM-in-the-loop意图聚类用于客户服务对话

Mengze Hong, Wailing Ng, Chen Jason Zhang, Yuanfeng Song, Di Jiang

机构 * Hong Kong Polytechnic University(香港理工大学) AI Group, WeBank Co., Ltd(WeBank人工智能部门)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出LLM-in-the-loop意图聚类框架,通过整合LLM能力提升客户服务对话意图聚类的准确性和效率。

Comments Accepted by EMNLP 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15197 2026-02-18 cs.CL cs.AI 79%

OpaqueToolsBench: Learning Nuances of Tool Behavior Through Interaction

OpaqueToolsBench: 通过交互学习工具行为的细微差别

Skyler Hallinan, Thejas Venkatesh, Xiang Ren, Sai Praneeth Karimireddy, Ashwin Paranjape, Yuhao Zhang, Jack Hessel

机构 * University of Southern California(南加州大学) Samaya AI

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 OpaqueToolsBench通过交互学习工具行为的细微差别,提出ToolObserver框架有效改进不透明工具的文档化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15809 2026-02-18 stat.AP cs.AI 77%

Decision Quality Evaluation Framework at Pinterest

Pinpoint 决策质量评估框架

Yuqi Tian, Robert Paine, Attila Dobi, Kevin O'Sullivan, Aravindh Manickavasagam, Faisal Farooq

机构 * Pinterest

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Pinpoint 提出了一种决策质量评估框架,通过高可信度黄金集和智能采样管道,提升内容安全系统的数据驱动管理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15436 2026-02-18 cs.CL 77%

Measuring Social Integration Through Participation: Categorizing Organizations and Leisure Activities in the Displaced Karelians Interview Archive using LLMs

通过参与度测量社会整合:利用LLMs对 displaced Karelians 采访档案中的组织和休闲活动进行分类

Joonatan Laato, Veera Schroderus, Jenna Kanerva, Jenni Kauppi, Virpi Lummaa, Filip Ginter

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 利用LLMs对卡累利亚疏散家庭采访中的组织和休闲活动进行分类,以测量社会整合并生成结构化资源。

Comments Presented at: The 10th Joint SIGHUM Workshop on Computational Linguistics for Cultural Heritage, Social Sciences, Humanities and Literature; EACL 2026 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15508 2026-02-18 cs.IR 75%

Eco-Amazon: Enriching E-commerce Datasets with Product Carbon Footprint for Sustainable Recommendations

Eco-Amazon: 通过产品碳足迹增强电商数据集以实现可持续推荐

Giuseppe Spillo, Allegra De Filippo, Cataldo Musto, Michela Milano, Giovanni Semeraro

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 Eco-Amazon通过引入产品碳足迹数据,增强电商数据集以促进可持续推荐系统的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10807 2026-02-18 cs.CV 75%

Prompts to Summaries: Zero-Shot Language-Guided Video Summarization with Large Language and Video Models

提示到摘要:基于大语言和视频模型的零样本语言引导视频摘要

Mario Barbara, Alaa Maalouf

机构 * Department of Computer Science, the University of Haifa(哈ifa大学计算机科学系)

专题命中 评测与基准 :LLM(abstract);language model(abstract);prompting(abstract)

AI总结 提出一种基于大语言和视频模型的零样本视频摘要方法,通过提示生成用户引导的摘要,无需训练数据,优于现有无监督和监督方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18545 2026-02-18 cs.CR cs.AI cs.CL cs.IR 73%

PII-Bench: Evaluating Query-Aware Privacy Protection Systems

PII-Bench:评估查询感知隐私保护系统

Hao Shen, Zhouhong Gu, Haokai Hong, Weili Han

机构 * Institute of Fintech, Fudan University(复旦大学金融科技学院) Shanghai Key Laboratory of Data Science, School of Computer Science, Fudan University(复旦大学数据科学上海重点实验室) Laboratory of Data Analytics and Security, Fudan University(复旦大学数据安全分析实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 PII-Bench通过评估查询感知隐私保护系统,揭示当前模型在识别PII相关性方面的不足,提出改进方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15384 2026-02-18 cs.AI cs.CL 73%

World-Model-Augmented Web Agents with Action Correction

具有动作修正的世界模型增强型网络代理

Zhouzhou Shen, Xueyu Hu, Xiyun Li, Tianqing Fang, Juncheng Li, Shengyu Zhang

机构 * Zhejiang University(浙江大学) Tencent AI Lab(腾讯AI实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 WAC通过多代理协作和风险感知机制,提升网络代理在复杂任务中的鲁棒性和执行效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15034 2026-02-18 cs.CL cs.AI 73%

EduResearchBench: A Hierarchical Atomic Task Decomposition Benchmark for Full-Lifecycle Educational Research

EduResearchBench: 一个用于全生命周期教育研究的分层原子任务分解基准

Houping Yue, Zixiang Di, Mei Jiang, Bingdong Li, Hao Hao, Yu Song, Bo Jiang, Aimin Zhou

机构 * Shanghai Institute of AI for Education, East China Normal University(上海人工智能教育研究院,东华大学) Shanghai Innovation Institute(上海创新研究院) School of Computer Science and Technology, East China Normal University(东华大学计算机科学与技术学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 EduResearchBench通过分层原子任务分解框架,构建了首个教育学术写作评估平台,展示了在垂直领域中数据质量和分层训练的重要性。

Comments 13 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08535 2026-02-18 hep-ph cs.AI cs.LG hep-ex physics.data-an 73%

Agents of Discovery

发现的代理

Sascha Diefenbacher, Anna Hallin, Gregor Kasieczka, Michael Krämer, Anne Lauscher, Tim Lukas

机构 * Physics Division, Lawrence Berkeley National Laboratory(劳伦斯伯克利国家实验室物理部) Institut für Experimentalphysik, Universität Hamburg(汉堡大学实验物理研究所) Institute for Theoretical Particle Physics and Cosmology, RWTH Aachen University(亚琛工业大学理论粒子物理与宇宙学研究所) Data Science Group, Universität Hamburg(汉堡大学数据科学组)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 利用大型语言模型创建代理团队,通过代码生成和迭代优化实现数据分析问题的自动化解决。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02766 2026-02-18 cs.CY cs.AI 70%

The Generative Reasonable Person

生成合理之人

Yonathan A. Arbel

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出生成合理之人工具,通过模拟大量决策数据,揭示模型在判断合理性时与人类相似的模式,挑战传统教科书观点,并为司法和监管提供新的实证依据。

Comments 51 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08550 2026-02-18 cs.CL 70%

Transferring Extreme Subword Style Using Ngram Model-Based Logit Scaling

使用基于ngram模型的logit缩放进行极端子词风格转移

Craig Messner, Tom Lippincott

机构 * Center for Digital Humanities(数字人文中心) Johns Hopkins University(约翰霍普金斯大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出基于ngram模型的logit缩放技术,用于在推理阶段将极端子词风格转移到大型语言模型中,通过调整困惑度实现风格迁移与流畅性的平衡。

Comments Accepted for publication at NLP4DH 2025 @ NAACL

Journal ref Proceedings of the 5th International Conference on Natural Language Processing for Digital Humanities (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15591 2026-02-18 cs.SE 67%

Req2Road: A GenAI Pipeline for SDV Test Artifact Generation and On-Vehicle Execution

Req2Road: 一个用于SDV测试资产生成和车载执行的生成式AI管道

Denesa Zyberaj, Lukasz Mazur, Pascal Hirmer, Nenad Petrovic, Marco Aiello, Alois Knoll

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出了一种生成式AI管道,用于SDV子系统的测试资产生成和车载执行,通过自动化生成Gherkin场景并验证其可执行性。

Comments accepted at CAiSE 2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15660 2026-02-18 cs.CV cs.AI 57%

Bayesian Optimization for Design Parameters of 3D Image Data Analysis

基于贝叶斯优化的3D图像数据分析设计参数优化

David Exler, Joaquin Eduardo Urrutia Gómez, Martin Krüger, Maike Schliephake, John Jbeily, Mario Vitacolonna, Rüdiger Rudolf, Markus Reischl

机构 * Institute for Automation and Applied Informatics, Karlsruhe Institute of Technology(自动化与应用信息学院,卡尔斯鲁厄技术大学) CeMOS Research and Transfer Center, Technische Hochschule Mannheim(CeMOS研究与转移中心,技术大学曼海姆) Institute of Biological and Chemical Systems, Karlsruhe Institute of Technology(生物与化学系统研究所,卡尔斯鲁厄技术大学)

专题命中 评测与基准 :pretraining(abstract);分类 cs.AI

AI总结 本文提出基于贝叶斯优化的3D图像数据分析优化流水线,通过两个阶段自动选择分割模型和分类器设计,提升大规模生物医学成像的分析效率。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15273 2026-02-18 cs.CY cs.CL 57%

FrameRef: A Framing Dataset and Simulation Testbed for Modeling Bounded Rational Information Health

FrameRef: 一个用于建模有限理性信息健康的框架数据集和仿真测试平台

Victor De Lima, Jiqun Liu, Grace Hui Yang

机构 * University of Oklahoma(俄克拉荷马大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 FrameRef通过仿真框架研究有限理性信息健康的动态,提供系统性数据集和方法论,影响人类判断和信息健康轨迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06134 2026-02-18 cs.AI 57%

OpenAgentSafety: A Comprehensive Framework for Evaluating Real-World AI Agent Safety

OpenAgentSafety: 一个全面评估现实世界AI代理安全性的框架

Sanidhya Vijayvargiya, Aditya Bharat Soni, Xuhui Zhou, Zora Zhiruo Wang, Nouha Dziri, Graham Neubig, Maarten Sap

机构 * Language Technologies Institute, Carnegie Mellon University(语言技术研究所,卡内基梅隆大学) Allen Institute for Artificial Intelligence(人工智能研究院)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 OpenAgentSafety提出一个全面评估AI代理安全性的框架,通过真实工具和多任务测试揭示代理在现实世界中的安全漏洞,强调需要加强安全防护。

Comments 26 pages, 10 figures, Accepted at ICLR 2026 and IASEAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04826 2026-02-18 astro-ph.GA 50%

Subaru High-z Exploration of Low-Luminosity Quasars (SHELLQs) XXII. Chandra observations of narrow-line quasar candidates at z>6

Subaru高红移低亮度类星体探索(SHELLQs)XXII. Chandra观测窄线类星体候选体在z>6

K. Iwasawa, R. Gilli, F. Vito, Y. Matsuoka, M. Onoue, M. A. Strauss, N. Kashikawa, Y. Toba, K. Shimasaku, K. Inayoshi, T. Nagao, N. Kawanaka, J. D. Silverman, T. Izumi, K. Kohno, Y. Ueda

专题命中 评测与基准 :prompting(abstract)

AI总结 SHELLQs项目利用Chandra观测z~6的窄线类星体候选体,发现其X射线安静,可能由遮挡物质导致,推测为再电离时期被遮挡的明亮AGN。

Comments A&A in press, 9 pages, 7 figures, plus one-page appendix. Updated reference list

Journal ref A&A 706, A305 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07860 2026-02-18 cs.CV 50%

THUNDER: Tile-level Histopathology image UNDERstanding benchmark

THUNDER:切片级病理图像理解基准

Pierre Marza, Leo Fillioux, Sofiène Boutaj, Kunal Mahatha, Christian Desrosiers, Pablo Piantanida, Jose Dolz, Stergios Christodoulidis, Maria Vakalopoulou

专题命中 评测与基准 :foundation model(abstract)

AI总结 THUNDER是一个用于数字病理学基础模型的切片级基准测试,通过多种数据集和下游任务评估模型的性能、特征空间及鲁棒性。

Comments Accepted at NeurIPS 2025 Datasets and Benchmarks Track (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13159 2026-02-18 cs.CV 50%

Digital Twin Generation from Visual Data: A Survey

从视觉数据生成数字孪生:一项调查

Andrew Melnik, Benjamin Alt, Giang Nguyen, Artur Wilkowski, Maciej Stefańczyk, Qirui Wu, Sinan Harms, Helge Rhodin, Manolis Savva, Michael Beetz

机构 * University of Bremen(不莱梅大学) Warsaw University of Technology(华沙技术大学) Bielefeld University(比勒菲尔德大学) Simon Fraser University(西蒙弗雷泽大学)

专题命中 评测与基准 :foundation model(abstract)

AI总结 本文综述了从视觉数据生成数字孪生的最新方法,探讨了多种技术及其挑战,为实际应用提供了全面的视角。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 效率与部署 26 篇

2506.02649 2026-02-18 cs.AI 89%

From Prompts to Protection: Large Language Model-Enabled In-Context Learning for Smart Public Safety UAV

从提示到保护:基于大语言模型的上下文学习用于智能公共安全无人机

Yousef Emami, Hao Zhou, Miguel Gutierrez Gaitan, Kai Li, Luis Almeida, Zhu Han

机构 * Real-Time and Embedded Computing Systems Research Centre (CISTER)(实时嵌入式计算系统研究中心) Carnegie Mellon University(卡内基梅隆大学) Pontificia Universidad Católica de Chile(天主教大学) School of Computer Science, McGill University(麦吉尔大学计算机科学学院) Instituto de Telecomunicações, Faculdade de Engenharia, Universidade do Porto(电信研究所,工程学院,葡萄牙里斯本大学) University of Houston(休斯顿大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出利用大语言模型的上下文学习提升公共安全无人机的自主决策能力,通过自然语言提示和示例指导实现路径规划和速度控制,减少数据丢失并缓解安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏