arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-27 至 2026-01-27 共收录 404 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 88 篇

2601.17786 2026-01-27 cs.CL cs.LG 62%

Beyond a Single Perspective: Text Anomaly Detection with Multi-View Language Representations

超越单一视角:基于多视图语言表示的文本异常检测

Yixin Liu, Kehan Yan, Shiyuan Li, Qingfeng Chen, Shirui Pan

机构 * School of Information and Communication Technology, Griffith University, Australia(信息与通信技术学院,格里菲斯大学,澳大利亚) School of Computer, Electronics and Information, Guangxi University, China(计算机、电子与信息学院,广西大学,中国)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出MCA^2框架,通过多视图语言表示提升文本异常检测的适应性和性能。

Comments 17 pages, 7 tables, and 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17173 2026-01-27 cs.CL cs.AI 62%

Beyond Factual QA: Mentorship-Oriented Question Answering over Long-Form Multilingual Content

超越事实问答:面向长形式多语言内容的指导型问答

Parth Bhalerao, Diola Dsouza, Ruiwen Guan, Oana Ignat

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MentorQA,首个多语言长形式视频指导型问答数据集和评估框架,通过对比不同架构发现Multi-Agent在复杂和低资源语言中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09765 2026-01-27 cs.CL cs.AI 62%

Enhancing the De-identification of Personally Identifiable Information in Educational Data

提升教育数据中个人可识别信息的脱敏

Zilyu Ji, Yuntian Shen, Jionghao Lin, Kenneth R. Koedinger

机构 * Carnegie Mellon University(卡内基梅隆大学) The University of Hong Kong(香港大学)

专题命中 评测与基准 :prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文提出使用微调后的GPT-4o-mini模型高效检测教育数据中的PII,实现高召回率和低计算成本,为隐私保护提供新的解决方案。

Journal ref Journal of Educational Data Mining 17(2) (2025) 55-85

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17377 2026-01-27 cs.CL 57%

WarrantScore: Modeling Warrants between Claims and Evidence for Substantiation Evaluation in Peer Reviews

WarrantScore: 建模主张与证据之间的证成以评估同行评审中的证成

Kiyotada Mori, Shohei Tanaka, Tosho Hirasawa, Tadashi Kozuno, Koichiro Yoshino, Yoshitaka Ushiku

机构 * Nara Institute of Science and Technology(奈良科学技术研究所) OMRON SINIC X Corporation(OMRON SINIC X公司) Institute of Science Tokyo(东京科学研究所) Guardian Robot Project, RIKEN(RIKEN守护机器人项目)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 WarrantScore通过建模主张与证据间的逻辑推理,提高同行评审中证成评估的准确性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17277 2026-01-27 cs.CL 57%

PingPong: A Natural Benchmark for Multi-Turn Code-Switching Dialogues

PingPong:多轮代码切换对话的自然基准

Mohammad Rifqi Farhansyah, Hanif Muhammad Zhafran, Farid Adilazuarda, Shamsuddeen Hassan Muhammad, Maryam Ibrahim Mukhtar, Nedjma Ousidhoum, Genta Indra Winata, Ayu Purwarianti, Alham Fikri Aji

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 PingPong基准通过多语言多轮对话数据,评估代码切换场景下语言模型的性能,揭示其在处理真实多语言交流时的不足。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11293 2026-01-27 cs.LG q-bio.QM 57%

Toward Scalable Early Cancer Detection: Evaluating EHR-Based Predictive Models Against Traditional Screening Criteria

迈向可扩展的早期癌症检测:评估基于电子健康记录的预测模型与传统筛查标准的对比

Jiheum Park, Chao Pang, Tristan Y. Lee, Jeong Yun Yang, Jacob Berkowitz, Alexander Z. Wei, Nicholas Tatonetti

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 本文评估了基于EHR的预测模型在早期癌症检测中的有效性,发现其在识别高危个体方面优于传统风险因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17191 2026-01-27 cs.CV cs.CL 57%

VaseVQA: Multimodal Agent and Benchmark for Ancient Greek Pottery

VaseVQA: 古代希腊陶器的多模态代理与基准

Jinchao Ge, Tengfei Cheng, Biao Wu, Zeyu Zhang, Shiya Huang, Judith Bishop, Gillian Shepherd, Meng Fang, Ling Chen, Yang Zhao

机构 * University of Adelaide(阿德莱德大学) University of Liverpool(利物浦大学) University of Technology Sydney(悉尼技术大学) The Australian National University(澳大利亚国立大学) La Trobe University(拉特罗布大学)

专题命中 评测与基准 :SFT(abstract);分类 cs.CL

AI总结 VaseVQA通过引入VaseVL强化学习方法,提升对古代希腊陶器的多模态推理能力,尤其在复杂推理任务中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18698 2026-01-27 cs.CV 50%

Are Video Generation Models Geographically Fair? An Attraction-Centric Evaluation of Global Visual Knowledge

视频生成模型在地理上是否公平?一种以吸引力为中心的全球视觉知识评估

Xiao Liu, Jiawei Zhang

机构 * IFM Lab, Department of Computer Science University of California, Davis(信息融合实验室,计算机科学系加州大学戴维斯分校)

专题命中 评测与基准 :language model(abstract)

AI总结 本文通过GAP框架评估了文本到视频模型在地理公平性上的表现,发现模型在不同地区和文化群体中具有相对均匀的地理相关视觉知识,表明其在全球应用中的潜力。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18493 2026-01-27 cs.CV 50%

DisasterInsight: A Multimodal Benchmark for Function-Aware and Grounded Disaster Assessment

DisasterInsight: 一种多模态基准,用于功能感知和基于事实的灾害评估

Sara Tehrani, Yonghao Xu, Leif Haglund, Amanda Berg, Michael Felsberg

机构 * Computer Vision Laboratory, Linköping University, Sweden(林奈大学计算机视觉实验室) Vantor, Linköping, Sweden(林奈瑞典)

专题命中 评测与基准 :language model(abstract)

AI总结 DisasterInsight提出一种多模态基准,用于评估视觉-语言模型在灾害分析任务中的性能,通过DI-Chat模型在损害识别和报告生成方面取得显著提升。

Comments Under review at ICPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18428 2026-01-27 cs.HC 50%

Collaposer: Transforming Photo Collections into Visual Assets for Storytelling with Collages

Collaposer:将照片集合转化为视觉资产用于讲故事的拼贴

Jiayi Zhou, Liwenhan Xie, Jiaju Ma, Zheng Wei, Huamin Qu, Anyi Rao

专题命中 评测与基准 :LLM(abstract)

AI总结 Collaposer通过用户提供的故事描述,自动将照片转化为有组织的视觉剪裁,简化拼贴制作流程,提升讲故事的效率。

Comments To be published at ACM CHI 2026 Conference on Human Factors in Computing Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03906 2026-01-27 cs.CV 50%

From Filters to VLMs: Benchmarking Defogging Methods through Object Detection and Segmentation Performance

从滤波器到视觉语言模型:通过目标检测和分割性能评估去雾方法

Ardalan Aryashad, Parsa Razmara, Amin Mahjoub, Seyedarmin Azizi, Mahdi Salmani, Arad Firouzkouhi

机构 * University of Southern California(南加州大学)

专题命中 评测与基准 :language model(abstract)

AI总结 本文通过目标检测和分割性能评估,探讨了去雾方法在真实与合成环境中的有效性,揭示了视觉语言模型在恶劣天气下的应用潜力。

Comments Accepted at WACV 2026 Proceedings (Oral), 5th Workshop on Image, Video, and Audio Quality Assessment in Computer Vision, with a focus on VLM and Diffusion Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12513 2026-01-27 cs.CV 50%

GlobalGeoTree: A Multi-Granular Vision-Language Dataset for Global Tree Species Classification

GlobalGeoTree: 一种多粒度的视觉-语言数据集用于全球树种分类

Yang Mu, Zhitong Xiong, Yi Wang, Muhammad Shahzad, Franz Essl, Holger Kreft, Mark van Kleunen, Xiao Xiang Zhu

机构 * Technical University of Munich(慕尼黑技术大学) University of Reading(reading大学) University of Vienna(维也纳大学) University of Göttingen(哥廷根大学) University of Konstanz(康斯坦茨大学) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 评测与基准 :pretraining(abstract)

AI总结 GlobalGeoTree是一种多粒度的视觉-语言数据集,用于全球树种分类,通过结合遥感数据和分类学文本标签,提升树种分类的准确性和应用价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17911 2026-01-27 cs.CR 50%

Prompt Injection Evaluations: Refusal Boundary Instability and Artifact-Dependent Compliance in GPT-4-Series Models

提示注入评估:GPT-4系列模型中的拒绝边界不稳定性与依赖于人工制品的合规性

Thomas Heverin

专题命中 评测与基准 :LLM(abstract)

AI总结 本研究发现GPT-4系列模型的拒绝行为受人工制品类型影响,存在拒绝边界不稳定性,单提示评估高估安全鲁棒性。

Comments 15 pages, 3 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17697 2026-01-27 cs.CV 50%

StyleDecoupler: Generalizable Artistic Style Disentanglement

StyleDecoupler: 可泛化艺术风格解耦

Zexi Jia, Jinchao Zhang, Jie Zhou

机构 * Wechat AI, Tencent, China(腾讯微信AI,腾讯,中国)

专题命中 评测与基准 :language model(abstract)

AI总结 StyleDecoupler通过信息论方法分离多模态视觉模型中的纯风格特征,实现艺术风格的可泛化解耦,并在大规模艺术数据集上展示出强大的风格检索和生成模型评估能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17429 2026-01-27 cs.CV 50%

Multi-scale Temporal Prediction via Incremental Generation and Multi-agent Collaboration

多尺度时间预测 via 逐步生成和多智能体协作

Zhitao Zeng, Guojian Yuan, Junyuan Mao, Yuxuan Wang, Xiaoshuang Jia, Yueming Jin

机构 * National University of Singapore(新加坡国立大学) Alibaba Group(阿里巴巴集团) Renmin University of China(中国人民大学)

专题命中 评测与基准 :language model(abstract)

AI总结 本文提出了一种多尺度时间预测方法,通过逐步生成和多智能体协作,提升多尺度和多状态预测的准确性和一致性。

Comments 20 pages, 6 figures

Journal ref NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 效率与部署 63 篇

2510.10157 2026-01-27 cs.CL cs.AI 91%

BILLY: Steering Large Language Models via Merging Persona Vectors for Creative Generation

BILLY:通过合并人设向量来引导大型语言模型进行创造性生成

Tsung-Min Pai, Jui-I Wang, Li-Chun Lu, Shao-Hua Sun, Hung-Yi Lee, Kai-Wei Chang

机构 * Department of Electrical Engineering, National Taiwan University(国立台湾大学电子工程系) Department of Computer Science & Information Engineering, National Taiwan University(国立台湾大学计算机科学与信息工程系) Graduate Institute of Communication Engineering, National Taiwan University(国立台湾大学通信工程研究所) CSAIL, Massachusetts Institute of Technology(麻省理工学院计算机科学与人工智能实验室)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 BILLY通过合并人设向量在单个模型中实现多视角生成,提升创造力并降低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15801 2026-01-27 cs.LG cs.CR 89%

Attributing and Exploiting Safety Vectors through Global Optimization in Large Language Models

通过全局优化在大语言模型中归因和利用安全向量

Fengheng Chu, Jiahao Chen, Yuhong Wang, Jun Wang, Zhihui Fu, Shouling Ji, Songze Li

机构 * Southeast University(东南大学) Zhejiang University(浙江大学) OPPO Research Institute(OPPO研究院)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG

AI总结 通过全局优化方法识别大语言模型中的安全向量,揭示安全机制的协作交互,并提出新的白盒劫持方法提升攻击效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00095 2026-01-27 cs.CL 89%

Adaptive Constraint Propagation: Scaling Structured Inference for Large Language Models via Meta-Reinforcement Learning

自适应约束传播:通过元强化学习扩展大型语言模型的结构推断

Ibne Farabi Shihab, Sanjeda Akter, Anuj Sharma

机构 * Department of Computer Science, Iowa State University(计算机科学系,爱荷华州立大学) Department of Civil, Construction & Environmental Engineering, Iowa State University(土木、建设与环境工程系,爱荷华州立大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 MetaJuLS通过元强化学习实现高效结构化推断,提升大型语言模型的跨语言和跨任务适应能力,减少推断碳足迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17443 2026-01-27 cs.CL cs.AI cs.LG 89%

Clustering-driven Memory Compression for On-device Large Language Models

基于聚类的记忆压缩用于设备端大语言模型

Ondrej Bohdal, Pramit Saha, Umberto Michieli, Mete Ozay, Taha Ceritli

机构 * University of Oxford(牛津大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种基于聚类的记忆压缩方法,通过分组和合并相似记忆以提升设备端大语言模型的上下文效率和生成质量。

Comments Accepted at ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13260 2026-01-27 cs.CL cs.AI cs.LG 89%

Stop Taking Tokenizers for Granted: They Are Core Design Decisions in Large Language Models

不要轻视分词器:它们是大型语言模型中的核心设计决策

Sawsan Alqahtani, Mir Tafseer Nayeem, Md Tahmid Rahman Laskar, Tasnim Mohiuddin, M Saiful Bari

机构 * Princess Nourah Bint Abdulrahman University(普里丝琴·努拉·本·阿卜杜勒拉赫曼大学) Saudi Data & AI Authority (SDAIA)(沙特数据与人工智能管理局) University of Alberta(阿尔伯塔大学) Dialpad(Dialpad公司) York University(约克大学) Qatar Computing Research Institute(卡塔尔计算研究所) Amazon AGI(亚马逊人工智能研究所)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出将分词视为大型语言模型的核心设计决策,强调上下文感知框架和标准化评估的重要性,以提升语言技术的公平性、效率和适应性。

Comments Accepted to EACL 2026 (long, main). The first two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17112 2026-01-27 cs.LG 88%

Low-Rank Tensor Approximation of Weights in Large Language Models via Cosine Lanczos Bidiagonalization

通过余弦兰舍兹双线性化实现大语言模型权重的低秩张量近似

A. El Ichi, K. Jbilou

机构 * Université du Littoral Cote d’Opale(卢瓦尔海岸大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 本文提出通过余弦兰舍兹双线性化对大语言模型权重进行低秩张量近似,以提高计算效率和减少内存占用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20984 2026-01-27 cs.LG cs.AI 86%

Learning Grouped Lattice Vector Quantizers for Low-Bit LLM Compression

学习分组晶格向量量化器以实现低比特LLM压缩

Xi Zhang, Xiaolin Wu, Jiamang Wang, Weisi Lin

机构 * Nanyang Technological University(南洋理工大学) Alibaba Group(阿里巴巴集团) Southwest Jiaotong University(西南交通大学)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出分组晶格向量量化器,通过学习生成矩阵优化低比特LLM压缩,实现模型大小与精度的平衡。

Comments NeurIPS 2025 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16495 2026-01-27 cs.DC 85%

Shift Parallelism: Low-Latency, High-Throughput LLM Inference for Dynamic Workloads

Shift Parallelism:低延迟、高吞吐量的LLM推理用于动态工作负载

Mert Hidayetoglu, Aurick Qiao, Michael Wyatt, Jeff Rasley, Yuxiong He, Samyam Rajbhandari

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 Shift Parallelism通过结合张量并行和序列并行,实现动态工作负载下的低延迟和高吞吐量LLM推理。

Comments Revised

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17902 2026-01-27 cs.SD eess.AS 85%

dLLM-ASR: A Faster Diffusion LLM-based Framework for Speech Recognition

dLLM-ASR:一种更高效的基于扩散大语言模型的语音识别框架

Wenjie Tian, Bingshen Mu, Guobin Ma, Xuelong Geng, Zhixian Zhao, Lei Xie

机构 * Northwestern Polytechnical University(西北工业大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 dLLM-ASR通过将扩散大语言模型的解码过程转化为先验引导的去噪流程,实现高效的语音识别,达到与自回归模型相当的准确率并提升4.44倍推理速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17818 2026-01-27 cs.CV 85%

ViTCoP: Accelerating Large Vision-Language Models via Visual and Textual Semantic Collaborative Pruning

ViTCoP: 通过视觉和文本语义协同剪枝加速大型视觉-语言模型

Wen Luo, Peng Chen, Xiaotao Huang, LiQun Huang

专题命中 效率与部署 :language model(title,abstract);LLM(abstract);large language model(abstract)

AI总结 ViTCoP通过结合视觉和文本语义协同剪枝,有效降低大型视觉-语言模型的计算成本,提升推理效率和内存利用率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18110 2026-01-27 cs.LG 83%

AttenMIA: LLM Membership Inference Attack through Attention Signals

通过注意力信号进行大语言模型成员推断攻击:AttenMIA

Pedram Zaree, Md Abdullah Al Mamun, Yue Dong, Ihsen Alouani, Nael Abu-Ghazaleh

机构 * CSE Department, University of California, Riverside, USA(加州大学河滨分校计算机科学与工程系) CSIT, Queen’s University Belfast, UK(贝尔法斯特女王大学计算机科学与信息技术系)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 AttenMIA通过分析Transformer中的注意力信号,提出了一种更有效的成员推断攻击方法,展示了其在提升攻击性能和揭示隐私风险方面的贡献。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17549 2026-01-27 cs.CR cs.AI 83%

Breaking the Protocol: Security Analysis of the Model Context Protocol Specification and Prompt Injection Vulnerabilities in Tool-Integrated LLM Agents

打破协议:模型上下文协议规范的安全分析及工具集成LLM代理中的提示注入漏洞

Narek Maloyan, Dmitry Namiot

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文分析了模型上下文协议的安全漏洞,提出MCPSec协议扩展以提升安全性,减少攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17082 2026-01-27 cs.CY cs.AI cs.CL cs.CV cs.LG 82%

Do VLMs Have a Moral Backbone? A Study on the Fragile Morality of Vision-Language Models

视觉-语言模型是否具有道德基础?对视觉语言模型脆弱道德的研究

Zhining Liu, Tianyi Wang, Xiao Lin, Penghao Ouyang, Gaotang Li, Ze Yang, Hui Liu, Sumit Keswani, Vishwa Pardeshi, Huijun Zhao, Wei Fan, Hanghang Tong

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon(亚马逊) Fidelity Investments(富达投资)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究发现视觉语言模型在面对文本和视觉扰动时道德判断易变,需通过轻量干预提升道德鲁棒性以确保负责任的部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11056 2026-01-27 cs.IR cs.AI 81%

From Reasoning LLMs to BERT: A Two-Stage Distillation Framework for Search Relevance

从推理LLM到BERT:一种两阶段蒸馏框架用于搜索相关性

Runze Xia, Yupeng Ji, Yuxi Zhou, Haodong Liu, Teng Zhang, Piji Li

机构 * Researcher(研究者)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 本文提出一种两阶段蒸馏框架,通过领域适应教师模型和对比推理自蒸馏方法,提升搜索相关性预测的效率和效果。

Comments TheWebConf 2026 Industry

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17376 2026-01-27 cs.LG cs.AI 81%

Diversified Scaling Inference in Time Series Foundation Models

时间序列基础模型中的多样化缩放推理

Ruijin Hua, Zichuan Liu, Kun Zhang, Yiyuan Yang

机构 * University of Oxford(牛津大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文研究了时间序列基础模型中多样化缩放推理的影响,通过定制扰动扩展生成分布支持范围,并提出RobustMSE指标量化性能余量。

Comments 23 pages, 16 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏