arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-13 至 2026-02-13 共收录 225 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 43 篇

2411.13779 2026-02-13 cs.CL cs.AI cs.LG 75%

NewsInterview: a Dataset and a Playground to Evaluate LLMs' Ground Gap via Informational Interviews

NewsInterview: 一个用于通过信息性访谈评估LLM地面间隙的数据集和游乐场

Alexander Spangher, Michael Lu, Sriya Jeslyn Kalyan, Hyundong Justin Cho, Weiyan Shi, Jonathan May

机构 * University of California, Berkeley(加州大学伯克利分校) University of Southern California(南加州大学) Information Sciences Institute(信息科学研究所) Northeastern University(东北大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 NewsInterview通过信息性访谈数据集和模拟环境,揭示LLMs在战略对话和多轮规划方面的能力不足,强调需提升其对话策略与说服力。

Comments Accepted at ACL 2025: https://aclanthology.org/2025.acl-long.1580/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12196 2026-02-13 cs.CL cs.AI 73%

Visual Reasoning Benchmark: Evaluating Multimodal LLMs on Classroom-Authentic Visual Problems from Primary Education

视觉推理基准:评估多模态大语言模型在小学课堂真实视觉问题上的能力

Mohamed Huti, Alasdair Mackintosh, Amy Waldock, Dominic Andrews, Maxime Lelièvre, Moritz Boos, Tobias Murray, Paul Atherton, Robin A. A. Ince, Oliver G. B. Garrod

机构 * Fab AI

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出视觉推理基准,用于评估多模态大语言模型在小学课堂真实视觉问题上的能力,揭示模型在静态与动态任务上的能力差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12092 2026-02-13 cs.CL cs.AI cs.CR cs.CV 73%

DeepSight: An All-in-One LM Safety Toolkit

DeepSight: 一个全方位的大型模型安全工具包

Bo Zhang, Jiaxuan Guo, Lijun Li, Dongrui Liu, Sujin Chen, Guanxu Chen, Zhijie Zheng, Qihao Lin, Lewen Yan, Chen Qian, Yijin Zhou, Yuyao Wu, Shaoxiong Guo, Tianyi Du, Jingyi Yang, Xuhao Hu, Ziqi Miao, Xiaoya Lu, Jing Shao, Xia Hu

机构 * Shanghai AI Laboratory(上海人工智能实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 DeepSight是一个开源工具包,旨在通过整合安全评估与诊断,提升大型模型的安全性与可解释性。

Comments Technical report, 29 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11684 2026-02-13 cs.CL cs.AI cs.HC 73%

PatientHub: A Unified Framework for Patient Simulation

PatientHub: 一个统一的患者模拟框架

Sahand Sabour, TszYam NG, Minlie Huang

机构 * The CoAI Group, DCST Institute for Artificial Intelligence Tsinghua University(CoAI集团、DCST人工智能研究所清华大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 PatientHub提供了一个统一的患者模拟框架,通过标准化定义、组成和部署,促进跨方法和跨模型的基准测试,并降低新方法开发的门槛。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11364 2026-02-13 cs.CL cs.AI 73%

The Energy of Falsehood: Detecting Hallucinations via Diffusion Model Likelihoods

虚假信息的能量:通过扩散模型似然检测幻觉

Arpit Singh Gautam, Kailash Talreja, Saurabh Jha

机构 * Dell Technologies, CSG CTO Team(戴尔技术,CSG CTO团队)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 DiffuTruth通过扩散模型似然检测幻觉,利用非平衡热力学原理,提出语义能量度量和混合校准方法,在FEVER和HOVER数据集上取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11678 2026-02-13 cs.AI cs.CV 70%

Beyond Pixels: Vector-to-Graph Transformation for Reliable Schematic Auditing

超越像素:用于可靠图示审计的向量到图转换

Chengwei Ma, Zhen Tian, Zhou Zhou, Zhixian Xu, Xiaowei Zhu, Xia Hua, Si Shi, F. Richard Yu

机构 * Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(人工智能与数字经济广东实验室) Guangdong Power Grid Co., Ltd.(广东电网公司) Shanghai University(上海大学) Carleton University(卡尔顿大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出向量到图转换方法,通过将CAD图转换为属性图,提升工程图示审计的准确性,克服基于像素方法的局限性。

Comments 4 pages, 3 figures. Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11674 2026-02-13 cs.AI 70%

Benchmark Health Index: A Systematic Framework for Benchmarking the Benchmarks of LLMs

基准健康指数:一个系统框架,用于评估大型语言模型的基准测试

Longyuan Zhu, Hairan Hua, Linlin Miao, Bing Zhao

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出Benchmark Health Index,通过三个维度评估LLM基准测试的健康状况,为评估选择和动态管理提供系统框架。

Comments 42 pages, 8 figures, 7 tables. Code and website available at https://github.com/SKYLENAGE-AI/benchmark-health-index

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11477 2026-02-13 eess.AS cs.CE 67%

SLD-L2S: Hierarchical Subspace Latent Diffusion for High-Fidelity Lip to Speech Synthesis

SLD-L2S: 基于分层子空间潜在扩散的高质量唇部到语音合成

Yifan Liang, Andong Li, Kang Yang, Guochen Yu, Fangkun Liu, Lingling Dai, Xiaodong Li, Chengshi Zheng

专题命中 评测与基准 :language model(abstract);SLM(abstract)

AI总结 SLD-L2S通过分层子空间潜在扩散模型直接将唇部运动映射到语音编解码器的潜在空间,提升语音合成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09523 2026-02-13 cs.CV 67%

Singpath-VL Technical Report

Singpath-VL 技术报告

Zhen Qiu, Kaiwen Xiao, Zhengwei Lu, Xiangyu Liu, Lei Zhao, Hao Zhang

机构 * LBP Singpath AI Lab(LBP Singpath人工智能实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 Singpath-VL通过合成数据集和多阶段微调,提升宫颈细胞学中的细粒度形态感知与诊断分类能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19054 2026-02-13 cs.CR 67%

Poly-Guard: Massive Multi-Domain Safety Policy-Grounded Guardrail Dataset

Poly-Guard: 大规模多领域安全政策导向的防护数据集

Mintong Kang, Zhaorun Chen, Chejian Xu, Jiawei Zhang, Chengquan Guo, Minzhou Pan, Ivan Revilla, Yu Sun, Bo Li

专题命中 评测与基准 :LLM(abstract);prompting(abstract)

AI总结 Poly-Guard是一个大规模多领域安全政策导向的防护数据集,旨在提升防护系统的安全性和领域适应性。

Comments NeurIPS 2025 Dataset & Benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12203 2026-02-13 cs.CL 57%

ExStrucTiny: A Benchmark for Schema-Variable Structured Information Extraction from Document Images

ExStrucTiny:一种用于从文档图像中进行模式变量结构信息提取的基准

Mathieu Sibue, Andres Muñoz Garza, Samuel Mensah, Pranav Shetty, Zhiqiang Ma, Xiaomo Liu, Manuela Veloso

机构 * J.P. Morgan AI Research(摩根大通人工智能研究)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 ExStrucTiny是一个新的文档图像结构信息提取基准,通过结合手动和合成样本,涵盖更多多样化的文档类型和提取场景,旨在提升通用模型在结构化信息提取中的性能。

Comments EACL 2026, main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11924 2026-02-13 cs.HC cs.AI 57%

Who Does What? Archetypes of Roles Assigned to LLMs During Human-AI Decision-Making

谁承担什么角色?人类与大语言模型在人机决策中的角色范式

Shreya Chappidi, Jatinder Singh, Andra V. Krauze

机构 * University of Cambridge(剑桥大学) National Cancer Institute, National Institutes of Health(国家癌症研究所,国立卫生研究院) Research Centre Trust, UA Ruhr, University Duisburg-Essen(研究信托中心,UA Ruhr,杜伊斯堡-埃森大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 本文提出人类-LLM范式概念,通过分析113篇论文得出17种角色模式,并探讨其对决策结果的影响及设计权衡。

Comments Accepted to ACM CHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11136 2026-02-13 cs.AI 57%

FormalJudge: A Neuro-Symbolic Paradigm for Agentic Oversight

FormalJudge: 一种用于代理监管的神经符号范式

Jiayi Zhou, Yang Sheng, Hantao Lou, Yaodong Yang, Jie Fu

机构 * Institute for Artificial Intelligence, Peking University(人工智能研究院,北京大学) State Key Laboratory of General Artificial Intelligence, Peking University(通用人工智能国家重点实验室,北京大学) Fudan University(复旦大学) Shanghai AI Lab(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 FormalJudge通过神经符号框架结合形式验证,提升代理行为安全性和欺骗检测能力,实现数学保证而非概率评分。

Comments 27 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21205 2026-02-13 cs.CV cs.CL 57%

TABLET: A Large-Scale Dataset for Robust Visual Table Understanding

TABLET:一个大规模数据集,用于鲁棒的视觉表格理解

Iñigo Alonso, Imanol Miranda, Eneko Agirre, Mirella Lapata

机构 * School of Informatics, University of Edinburgh(爱丁堡大学信息学院) HiTZ Center - Ixa, University of the Basque Country UPV/EHU(巴斯克国家大学HiTZ中心)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 TABLET是一个大规模视觉表格理解数据集,包含400万个示例和21项任务,旨在提升模型对真实世界表格可视化的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11689 2026-02-13 physics.flu-dyn 50%

A Preliminary Assessment of Coding Agents for CFD Workflows

对CFD工作流程中编码代理的初步评估

Ke Xiao, Haoze Zhang, Yangchen Xu, Runze Mao, Han Li, Zhi X. Chen

专题命中 评测与基准 :language model(abstract)

AI总结 本文评估了编码代理在自动化CFD工作流程中的应用,展示了其在提高执行效率和网格生成方面的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11311 2026-02-13 cs.HC 50%

Same Feedback, Different Source: How AI vs. Human Feedback Shapes Learner Engagement

相同反馈,不同来源:AI与人类反馈如何影响学习者参与

Caitlin Morris, Pattie Maes

专题命中 评测与基准 :LLM(abstract)

AI总结 研究探讨AI与人类反馈来源对学习者参与度的影响,发现反馈来源影响学习者投入和评估,对混合教育系统设计有启示。

Comments 7 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 效率与部署 39 篇

2602.11513 2026-02-13 cs.CR cs.AI 89%

Differentially Private and Communication Efficient Large Language Model Split Inference via Stochastic Quantization and Soft Prompt

通过随机量化和软提示实现差分隐私和通信高效的大型语言模型分拆推理

Yujie Gu, Richeng Jin, Xiaoyu Ji, Yier Jin, Wenyuan Xu

机构 * Zhejiang University, Hangzhou, China(浙江大学) University of Science and Technology of China, Anhui, China(中国科学技术大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出DEL框架,通过随机量化和软提示实现差分隐私和通信高效的LLM分拆推理,有效平衡隐私与效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11470 2026-02-13 cs.CR 89%

Cachemir: Fully Homomorphic Encrypted Inference of Generative Large Language Model with KV Cache

Cachemir: 生成式大语言模型的全同态加密推理与KV缓存

Ye Yu, Yifan Zhou, Yi Chen, Pedro Soto, Wenjie Xiong, Meng Li

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 Cachemir通过整合KV缓存优化同态加密推理,实现高效生成式大语言模型推理。

Comments 16 pages, 10 figures, 6 tables. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12172 2026-02-13 cs.AI cs.CL 86%

Pedagogically-Inspired Data Synthesis for Language Model Knowledge Distillation

教学启发式数据合成用于语言模型知识蒸馏

Bowei He, Yankai Chen, Xiaokun Zhang, Linghe Kong, Philip S. Yu, Xue Liu, Chen Ma

机构 * MBZUAI McGill(麦吉尔大学) CityUHK(城市大学香港分校) SJTU(上海交通大学) UIC(美国国际大学)

专题命中 效率与部署 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于教学原理的知识蒸馏框架,通过三阶段流程提升学生模型性能,在复杂推理任务中取得显著改进。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11156 2026-02-13 cs.CL cs.AI cs.IR 86%

HybridRAG: A Practical LLM-based ChatBot Framework based on Pre-Generated Q&A over Raw Unstructured Documents

HybridRAG: 一种基于预生成问答的LLM聊天机器人框架

Sungmoon Kim, Hyuna Jeon, Dahye Kim, Mingyu Kim, Dong-Kyu Chae, Jiwoong Kim

机构 * Hanyang University(翰阳大学) Makebot Inc.(Makebot公司)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 HybridRAG通过预生成问答库和实时生成相结合,提升聊天机器人在处理无结构文档时的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12183 2026-02-13 cs.CR cs.SE 86%

Unknown Attack Detection in IoT Networks using Large Language Models: A Robust, Data-efficient Approach

利用大语言模型在物联网网络中检测未知攻击:一种稳健且数据高效的方案

Shan Ali, Feifei Niu, Paria Shirani, Lionel C. Briand

专题命中 效率与部署 :language model(title,abstract);large language model(title)

AI总结 本文提出SiamXBERT,一种基于Transformer语言模型的元学习框架,用于在物联网网络中高效检测未知攻击,通过双模态特征表示和元学习技术,在数据稀缺情况下实现显著的性能提升。

Comments 13 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01244 2026-02-13 cs.CL 85%

Racka: Efficient Hungarian LLM Adaptation on Academic Infrastructure

Racka:在学术基础设施上高效地进行匈牙利语LLM适应

Zsolt Csibi, Bence György Gortka, Natabara Gyöngyössy, Kornél Nagy, Dávid Márk Nemeskey, Martin Sallai, András Simonyi, András Márk Szekeres, Gábor Palkó

机构 * ELTE Faculty of Humanities(ELTE人文学院) ELTE Faculty of Informatics(ELTE信息学院)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 Racka通过LoRA技术在学术基础设施上高效适应匈牙利语,平衡资源差距并提升多语言性能。

Comments 22 pages, 1 figures. Appeared, and received best paper award, at the XXII. Magyar Számítógépes Nyelvészeti Konferencia (MSZNY 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00031 2026-02-13 cs.SE cs.AI cs.DC 85%

VibeCodeHPC: An Agent-Based Iterative Prompting Auto-Tuner for HPC Code Generation Using LLMs

VibeCodeHPC: 基于大语言模型的多智能体迭代提示自动调优系统用于HPC代码生成

Shun-ichiro Hayashi, Koki Morita, Daichi Mukunoki, Tetsuya Hoshino, Takahiro Katagiri

机构 * Graduate School of Informatics(信息学院研究生院) Nagoya University(名古屋大学) Information Technology Center(信息技术中心)

专题命中 效率与部署 :prompting(title);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 VibeCodeHPC通过多智能体系统实现HPC代码的自动调优,利用大语言模型进行自然语言交互,提升代码性能与开发效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09316 2026-02-13 cs.LG 85%

Effective MoE-based LLM Compression by Exploiting Heterogeneous Inter-Group Experts Routing Frequency and Information Density

通过利用异构组间专家路由频率和信息密度实现有效的MoE大语言模型压缩

Zhendong Mi, Yixiao Chen, Pu Zhao, Xiaodong Yu, Hao Wang, Yanzhi Wang, Shaoyi Huang

机构 * Department of Computer Science, Stevens Institute of Technology, Hoboken, NJ, USA(计算机科学系,史蒂文斯理工学院,新泽西州霍博肯) Northeastern University, Boston, MA, USA(东北大学,波士顿,马萨诸塞州)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 RFID-MoE通过异构组间专家路由频率和信息密度实现MoE大语言模型压缩,提升压缩效果和性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12151 2026-02-13 cs.DC 85%

OServe: Accelerating LLM Serving via Spatial-Temporal Workload Orchestration

OServe: 通过空间-时间工作负载编排加速大语言模型服务

Youhe Jiang, Fangcheng Fu, Taiyi Wang, Guoliang He, Eiko Yoneki

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 OServe通过空间-时间工作负载编排优化大语言模型服务,提升性能2倍

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11521 2026-02-13 cs.AR cs.DC 85%

PAM: Processing Across Memory Hierarchy for Efficient KV-centric LLM Serving System

PAM:跨内存层次处理的高效键值中心LLM服务系统

Lian Liu, Shixin Zhao, Yutian Zhou, Yintao He, Mengdi Wang, Yinhe Han, Ying Wang

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 PAM通过跨内存层次处理,优化键值中心LLM服务系统的带宽与容量,提升效率和可扩展性。

Comments 15 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11174 2026-02-13 cs.CL cs.AI 84%

The Script Tax: Measuring Tokenization-Driven Efficiency and Latency Disparities in Multilingual Language Models

脚本税:衡量基于分词驱动的效率和延迟差异在多语言语言模型中的表现

Aradhya Dixit, Shreem Dixit

机构 * Wake Technical Community College(韦克技术社区学院) University of North Carolina Charlotte(北卡罗来纳大学夏洛特分校)

专题命中 效率与部署 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 本研究发现多语言语言模型中基于分词的效率和延迟差异显著,通过比较不同正字法变体,揭示了分词对不同书写系统的影响,并提出脚本意识的分词和预训练方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12029 2026-02-13 cs.LG cs.DC 83%

PrefillShare: A Shared Prefill Module for KV Reuse in Multi-LLM Disaggregated Serving

PrefillShare: 一种用于多语言模型解耦服务中KV重用的共享预填模块

Sunghyeon Woo, Hoseung Kim, Sunghwan Shim, Minjung Jo, Hyunjoon Jeong, Jeongtae Lee, Joonghoon Kim, Sungjae Lee, Baeseong Park, Se Jung Kwon, Dongsoo Lee

专题命中 效率与部署 :LLM(title,abstract);language model(abstract);分类 cs.LG

AI总结 PrefillShare通过共享预填模块和KV缓存,减少多语言模型解耦服务中的冗余计算和延迟,提升吞吐量和准确性。

Comments Preprint. 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09829 2026-02-13 cs.IR 82%

Internalizing Multi-Agent Reasoning for Accurate and Efficient LLM-based Recommendation

内部化多智能体推理以实现准确且高效的基于LLM的推荐

Yang Wu, Haoze Wang, Qian Li, Jun Zhang, Huan Yu, Jie Jiang

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract)

AI总结 本文提出STAR模型,通过轨迹驱动的内部化方法,将多智能体推理能力高效整合到单模型中,实现准确且高效的推荐系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13811 2026-02-13 cs.CR cs.LG 81%

Can LLMs Handle WebShell Detection? Overcoming Detection Challenges with Behavioral Function-Aware Framework

LLMs能否处理WebShell检测?通过行为功能感知框架克服检测挑战

Feijiang Han, Jiaming Zhang, Chuyi Deng, Jianheng Tang, Yunhuai Liu

机构 * University of Pennsylvania(宾夕法尼亚大学) Central South University(中南大学) Peking University(北京大学)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 基于行为功能感知框架,研究评估了七种LLM在WebShell检测中的表现,发现大模型精度高但召回率低,提出BFAD框架提升检测性能,F1值平均提升13.82%。

Comments Published as a conference paper at COLM 2025 (The new version has been polished and expanded with more detailed future work ideas)

详情

展开后加载摘要…

URL PDF HTML 收藏