arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-28 至 2026-01-28 共收录 227 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 54 篇

2601.19345 2026-01-28 cs.CR 67%

AI-driven Intrusion Detection for UAV in Smart Urban Ecosystems: A Comprehensive Survey

基于人工智能的无人机智能城市生态系统入侵检测:综述

Abdullah Khanfor, Raby Hamadi, Noureddine Lasla, Hakim Ghazzai

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文综述了无人机在智能城市中的应用及安全挑战,探讨了人工智能技术在入侵检测中的作用,并提出了十个关键研究方向。

Comments 68 pages, 13 figures, 6 tables, journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17912 2026-01-28 cs.LG cs.AI 62%

Causal Pre-training Under the Fairness Lens: An Empirical Study of TabPFN

从公平性视角看因果预训练:对TabPFN的实证研究

Qinyi Liu, Mohammad Khalil, Naman Goel

机构 * University of Bergen Centre for the Science of Learning \& Technology (SLATE) Bergen Norway Department of Computer Science University of Oxford Alan Turing Institute Oxford United Kingdom University of Bergen University of Oxford Alan Turing Institute

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本研究从公平性角度评估了TabPFN的因果预训练效果,发现其在预测准确性上表现优异,但在公平性改进方面存在局限,特别是在面对缺失-不在随机协变量偏移时。

Journal ref Proceedings of the ACM Web Conference 2026 (WWW '26), April 13--17, 2026, Dubai, United Arab Emirates

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09342 2026-01-28 cs.CL cs.AI 62%

Improving Implicit Hate Speech Detection via a Community-Driven Multi-Agent Framework

通过社区驱动的多智能体框架改进隐式仇恨言论检测

Ewelina Gajewska, Katarzyna Budzynska, Jarosław A Chudziak

机构 * Warsaw University of Technology(华沙技术大学)

专题命中 评测与基准 :prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种社区驱动的多智能体框架,通过整合社会文化背景提升隐式仇恨言论检测的准确性和公平性。

Comments This paper has been accepted for the upcoming 18th International Conference on Agents and Artificial Intelligence (ICAART-2026), Marbella, Spain. The final published version will appear in the official conference proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03871 2026-01-28 cs.LG cs.AI stat.ML 62%

Optimal Scaling Needs Optimal Norm

最优缩放需要最优范数

Oleg Filatov, Jiangtao Wang, Jan Ebert, Stefan Kesselheim

机构 * Jülich Supercomputing Centre(尤利奇超算中心) Forschungszentrum Jülich(尤利奇研究中心)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 本研究发现输出层算子范数是优化缩放的关键,提出基于范数的最优缩放方法,并通过Scion优化器验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03785 2026-01-28 cs.LG cs.AI 62%

SoilNet: A Multimodal Multitask Model for Hierarchical Classification of Soil Horizons

SoilNet:一种用于土壤剖面层次分类的多模态多任务模型

Vipin Singh, Teodor Chiaburu, Einar Eberhardt, Stefan Broda, Joey Prüssing, Frank Haußer, Felix Bießmann

机构 * Einstein Center Digital Future(数字未来爱因斯坦中心)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 SoilNet通过多模态多任务模型解决土壤层次分类问题,结合图像数据和地理时间元数据,利用图结构表示实现复杂层次结构的准确分类。

Comments 29 pages, 9 figures, 7 tables

Journal ref Geoderma, Volume 466, 2026, 117684

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14780 2026-01-28 cs.CL cs.AI cs.CV 62%

ReVision: A Dataset and Baseline VLM for Privacy-Preserving Task-Oriented Visual Instruction Rewriting

ReVision:一个用于隐私保护任务导向视觉指令重写的数据集和基线VLM

Abhijit Mishra, Mingda Li, Hsiang Fu, Richard Noh, Minji Kim

机构 * School of Information(信息学院) The University of Texas at Austin(德克萨斯大学奥斯汀分校) Department of Statistics and Data Science(统计与数据科学系) Yale University(耶鲁大学) School of Computing and Augmented Intelligence(计算与增强智能学院)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

AI总结 ReVision提出一个数据集和基线VLM,通过将多模态指令转换为纯文本命令,实现轻量级设备端指令重写,提升隐私保护的多模态AI应用能力。

Comments In Proceedings of the IJCNLP-AACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19668 2026-01-28 cs.LG 57%

Grasynda: Graph-based Synthetic Time Series Generation

Grasynda:基于图的合成时间序列生成

Luis Amorim, Moises Santos, Paulo J. Azevedo, Carlos Soares, Vitor Cerqueira

机构 * Department of Informatics, University of Minho, Braga, Portugal(明德大学信息学院) Faculdade de Engenharia da Universidade do Porto, Porto, Portugal(波尔图大学工程学院) Laboratory for Artificial Intelligence and Computer Science (LIACC), Portugal(人工智能与计算机科学实验室) Fraunhofer Portugal AICOS, Portugal(弗劳恩霍夫葡萄牙人工智能与计算科学中心) HASLab - INESCTEC(HAS实验室 - INESCTEC)

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 Grasynda通过将单变量时间序列转化为图结构并编码时间动态,提升时间序列预测的数据增强效果。

Comments Accepted in IDA'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19637 2026-01-28 cs.CL 57%

RATE: Reviewer Profiling and Annotation-free Training for Expertise Ranking in Peer Review Systems

RATE:同行评审系统中基于专家排名的评审员建模与无标注训练

Weicong Liu, Zixuan Yang, Yibo Zhao, Xiang Li

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

AI总结 RATE通过构建基于关键词的评审员资料和弱偏好监督,实现同行评审系统中专家排名的高精度匹配与训练。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19507 2026-01-28 cs.CL 57%

Automated Safety Benchmarking: A Multi-agent Pipeline for LVLMs

自动化安全基准测试:一种用于大型视觉语言模型的多代理流程

Xiangyang Zhu, Yuan Tian, Zicheng Zhang, Qi Jia, Chunyi Li, Renrui Zhang, Heng Li, Zongrui Wang, Wei Sun

机构 * Shanghai AI Lab(上海人工智能实验室) PolyU HK(PolyU香港分校) East China Normal University(东华大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 VLSafetyBencher通过多代理流程自动化构建高质量安全基准,有效区分不同模型的安全性,提升LVLMs的安全评估效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19258 2026-01-28 cs.HC cs.AI 57%

GhostUI: Unveiling Hidden Interactions in Mobile UI

GhostUI: 解蔽移动UI中的隐藏交互

Minkyu Kweon, Seokhyeon Park, Soohyun Lee, You Been Lee, Jeongmin Rhee, Jinwook Seo

机构 * Seoul National University(首尔国立大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 GhostUI通过提供隐藏交互数据集,提升移动应用中VLMs对隐含手势的识别和任务自动化能力。

Comments Accepted at ACM CHI Conference on Human Factors in Computing Systems (CHI '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19202 2026-01-28 cs.CL 57%

Do Images Speak Louder than Words? Investigating the Effect of Textual Misinformation in VLMs

图像胜过言语吗?探讨文本误导在VLMs中的影响

Chi Zhang, Wenxuan Ding, Jiale Liu, Mingrui Wu, Qingyun Wu, Ray Mooney

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Pennsylvania State University(宾夕法尼亚州立大学) New York University(纽约大学) University of Chinese Academy of Sciences(中国科学院大学) AG2ai, Inc.(AG2ai公司)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 研究探讨了文本误导对视觉-语言模型(VLMs)的影响,发现模型易受误导性文本提示影响,导致性能显著下降。

Comments 24 pages, 10 figures. Accepted at EACL 2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17644 2026-01-28 cs.CR cs.AI 57%

A Systemic Evaluation of Multimodal RAG Privacy

多模态RAG隐私的系统评估

Ali Al-Lawati, Suhang Wang

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 评测与基准 :prompting(abstract);分类 cs.AI

AI总结 本文系统评估了多模态RAG隐私风险,揭示了推理过程中可能泄露私有信息的问题,并呼吁开发隐私保护机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13687 2026-01-28 cs.AI 57%

Understanding Mental States to Guide Social Influence in Multi-Person Group Dialogue

理解心理状态以引导多人物群体对话中的社会影响

Zhichao Liang, Satoshi Nakamura

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 SocialMindChange基准通过引导多人物群体对话中的心理状态变化,评估语言模型在复杂社交互动中的表现与能力。

Comments Minor update

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09851 2026-01-28 cs.CV cs.AI cs.HC 57%

ViSIL: Unified Evaluation of Information Loss in Multimodal Video Captioning

ViSIL:多模态视频描述信息损失的统一评估

Po-han Li, Shenghui Chen, Ufuk Topcu, Sandeep Chinchali

机构 * The University of Texas at Austin, Texas, USA(德克萨斯大学奥斯汀分校)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 ViSIL通过信息论框架量化多模态视频摘要的信息损失,实现跨格式的统一评估,并在VQA任务中提升准确率7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19693 2026-01-28 cs.SE 50%

Using LLMs to Evaluate Architecture Documents: Results from a Digital Marketplace Environment

利用LLMs评估架构文档:数字市场环境中的研究结果

Frank Elberzhager, Matthias Gerbershagen, Joshua Ginkel

专题命中 评测与基准 :LLM(abstract)

AI总结 本研究探讨了在数字市场环境中利用LLMs评估架构文档的效果,发现文档质量对评估一致性有显著影响,但结果仍需进一步分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19461 2026-01-28 cs.CV cs.RO eess.IV 50%

Towards Gold-Standard Depth Estimation for Tree Branches in UAV Forestry: Benchmarking Deep Stereo Matching Methods

面向无人机林业作业的树枝深度估计金标准:深度立体匹配方法的基准测试

Yida Lin, Bing Xue, Mengjie Zhang, Sam Schofield, Richard Green

机构 * Centre for Data Science and Artificial Intelligence(数据科学与人工智能中心) Victoria University of Wellington(惠灵顿维多利亚大学) Department of Computer Science and Software Engineering(计算机科学与软件工程系) University of Canterbury(坎特伯雷大学)

专题命中 评测与基准 :foundation model(abstract)

AI总结 本文首次系统评估了八种深度立体匹配方法在无人机林业中对树枝深度估计的性能,发现DEFOM在植被密集环境下表现最佳,成为新的金标准基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18923 2026-01-28 cs.RO cs.CV 50%

DeFM: Learning Foundation Representations from Depth for Robotics

DeFM:从深度学习基础表示以供机器人应用

Manthan Patel, Jonas Frey, Mayank Mittal, Fan Yang, Alexander Hansson, Amir Bar, Cesar Cadena, Marco Hutter

机构 * Robotic Systems Lab (RSL), ETH Zurich, Switzerland(苏黎世联邦理工学院机器人系统实验室) Stanford University(斯坦福大学) UC Berkeley(加州大学伯克利分校) NVIDIA(NVIDIA公司)

专题命中 评测与基准 :foundation model(abstract)

AI总结 DeFM通过自监督学习从深度图像中学习基础表示,为机器人应用提供强大的泛化能力和仿真到现实的迁移性能。

Comments Under review, 19 pages, 15 Figures, 9 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 效率与部署 49 篇

2503.07103 2026-01-28 cs.SE 91%

Evaluating the Impact of Post-Training Quantization on Large Language Models for Code Generation

评估后训练量化对代码生成大语言模型的影响

Alessandro Giagnorio, Antonio Mastropaolo, Saima Afrin, Massimiliano Di Penta, Gabriele Bavota

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);post-training(title);LLM(abstract)

AI总结 本文研究了大语言模型在代码生成中的量化影响,通过更大型的模型和最新量化技术,发现4位精度可显著降低内存占用而不影响性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19611 2026-01-28 cs.LG cs.AI cs.CL 90%

Explicit Multi-head Attention for Inter-head Interaction in Large Language Models

显式多头注意力机制用于大语言模型中头间的交互

Runyu Peng, Yunhua Zhou, Demin Song, Kai Lv, Bo Wang, Qipeng Guo, Xipeng Qiu

机构 * Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出显式多头注意力机制,通过显式建模头间交互提升注意力性能,实现更高效的参数利用和内存压缩,同时保持模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07253 2026-01-28 eess.AS cs.CV cs.SD 89%

Omni-AVSR: Towards Unified Multimodal Speech Recognition with Large Language Models

Omni-AVSR:迈向基于大语言模型的统一多模态语音识别

Umberto Cappellazzo, Xubo Liu, Pingchuan Ma, Stavros Petridis, Maja Pantic

机构 * Imperial College London, UK(伦敦帝国理工学院) University of Surrey, UK(萨里大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 Omni-AVSR通过统一多模态语音识别框架,结合高效多粒度训练与参数高效适应,实现跨任务协同,降低资源消耗并提升鲁棒性。

Comments Accepted to IEEE ICASSP 2026 (camera-ready version). Project website (code and model weights): https://umbertocappellazzo.github.io/Omni-AVSR/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19026 2026-01-28 cs.LG cs.AR cs.CL 88%

Is Finer Better? The Limits of Microscaling Formats in Large Language Models

更细更好吗?微缩格式在大语言模型中的局限性

Andrea Fasoli, Monodeep Kar, Chi-Chun Liu, Swagath Venkataramani, Viji Srinivasan, Leland Chang, Naigang Wang

机构 * IBM Research, USA(IBM研究院,美国)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 研究发现微缩格式中块大小过小会导致模型输出退化,提出 FP8 无符号 E5M3 作为更高效的硬件友好格式,提升大语言模型的压缩性能。

Comments 31 pages, 17 figures, 3 tables; accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19255 2026-01-28 cs.LG cs.AI 86%

LLM-Assisted Logic Rule Learning: Scaling Human Expertise for Time Series Anomaly Detection

基于大语言模型的逻辑规则学习:扩展人类专业知识用于时间序列异常检测

Haoting Zhang, Shekhar Jain

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出利用大语言模型学习逻辑规则,用于提升供应链时间序列异常检测的准确性和可解释性,通过三阶段框架实现专家知识的系统编码与自动化优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12619 2026-01-28 cs.LG cs.AI cs.DC 86%

BootSeer: Analyzing and Mitigating Initialization Bottlenecks in Large-Scale LLM Training

BootSeer:分析和缓解大规模大语言模型训练中的初始化瓶颈

Rui Li, Xiaoyun Zhi, Jinxin Chi, Menghan Yu, Lixin Huang, Jia Zhu, Weilun Zhang, Xing Ma, Wenjia Liu, Zhicheng Zhu, Daowen Luo, Zuquan Song, Xin Yin, Chao Xiang, Shuguang Wang, Wencong Xiao, Gene Cooperman

机构 * Northeastern University(东北大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 BootSeer通过优化容器镜像加载、依赖安装和模型检查点恢复,显著减少大规模LLM训练的启动开销。

Comments 18 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19847 2026-01-28 cs.CL 85%

Identifying and Transferring Reasoning-Critical Neurons: Improving LLM Inference Reliability via Activation Steering

识别并转移推理关键神经元:通过激活引导提升LLM推理可靠性

Fangan Dong, Zuming Yan, Xuri Ge, Zhiwei Xu, Mengqi Zhang, Xuanang Chen, Ben He, Xin Xin, Zhumin Chen, Ying Zhou

机构 * Shandong University(山东大学) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出AdaRAS,通过识别并引导推理关键神经元提升LLM推理可靠性,实验显示在数学和编程基准测试中取得显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19278 2026-01-28 cs.CL 85%

DART: Diffusion-Inspired Speculative Decoding for Fast LLM Inference

DART:基于扩散的推测解码用于快速大语言模型推理

Fuliang Liu, Xue Li, Ketai Zhao, Yinxi Gao, Ziyan Zhou, Zhonghui Zhang, Zhibin Wang, Wanchun Dou, Sheng Zhong, Chen Tian

机构 * State Key Laboratory of Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) Alibaba Group(阿里巴巴集团)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 DART通过并行生成和高效树修剪算法,提升大语言模型推理速度,比EAGLE3快30%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19260 2026-01-28 cs.SE 85%

"ENERGY STAR" LLM-Enabled Software Engineering Tools

ENERGY STAR LLM赋能的软件工程工具

Himon Thakur, Armin Moin

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文研究LLM赋能的软件工程工具的能效,通过结合RAG与PETs提升代码生成的质量和效率,验证核心理念并提供未来分析的证明。

Comments CAIN 2026 - 5th International Conference on AI Engineering - Software Engineering for AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21313 2026-01-28 cs.IR 85%

Towards On-Device Personalization: Cloud-device Collaborative Data Augmentation for Efficient On-device Language Model

面向设备端个性化:云-设备协同数据增强用于高效设备端语言模型

Zhaofeng Zhong, Wei Yuan, Liang Qu, Tong Chen, Hao Wang, Xiangyu Zhao, Hongzhi Yin

专题命中 效率与部署 :language model(title,abstract);LLM(abstract);large language model(abstract)

AI总结 提出CDCDA-PLM框架,通过云-设备协同数据增强实现高效设备端个性化语言模型部署,解决数据稀缺和网络依赖问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19221 2026-01-28 cs.CL 84%

DREAMSTATE: Diffusing States and Parameters for Recurrent Large Language Models

DREAMSTATE: 用于循环大语言模型的扩散状态和参数

Liu Xiao

专题命中 效率与部署 :large language model(title);language model(title);分类 cs.CL

AI总结 DREAMSTATE通过扩散模型实现RNN状态的生成与编辑,结合RNN局部优势与全局上下文适应性,提出混合架构提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19622 2026-01-28 cs.AI math.OC 83%

Algorithmic Prompt-Augmentation for Efficient LLM-Based Heuristic Design for A* Search

算法提示增强用于高效基于LLM的A*搜索启发式设计

Thomas Bömer, Nico Koltermann, Max Disselnmeyer, Bastian Amberg, Anne Meyer

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) TU Dortmund University(多特蒙德技术大学)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出A-CEoH算法,通过提示增强策略自动设计A*搜索的启发函数,提升启发式质量并优于专家设计。

Comments accepted at EvoStar conference; Code: https://github.com/tb-git-tud/a-ceoh-evolution-of-heuristics?tab=readme-ov-file

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14852 2026-01-28 cs.DC cs.AI cs.CL cs.LG cs.PF 82%

Agentic Plan Caching: Test-Time Memory for Fast and Cost-Efficient LLM Agents

代理计划缓存:用于快速且低成本LLM代理的测试时间内存

Qizheng Zhang, Michael Wornow, Gerry Wan, Kunle Olukotun

机构 * Stanford University(斯坦福大学)

专题命中 效率与部署 :LLM(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Agentic Plan Caching通过测试时间内存提取并重用结构化计划模板,降低LLM代理服务成本和延迟,提升效率。

Comments NeurIPS 2025. 27 pages

详情

展开后加载摘要…

URL PDF HTML 收藏