arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-13 至 2026-01-13 共收录 362 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 87 篇

2601.06838 2026-01-13 cs.CR cs.SE 85%

CHASE: LLM Agents for Dissecting Malicious PyPI Packages

CHASE:用于拆解恶意PyPI包的LLM代理

Takaaki Toda, Tatsuya Mori

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 CHASE通过多代理架构提升恶意PyPI包检测的可靠性,实现高召回率与低误报率。

Comments Accepted for publication and presented at the 2nd IEEE International Conference on AI-powered Software (AIware 2025). 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06141 2026-01-13 cs.CY 85%

An LLM -Powered Assessment Retrieval-Augmented Generation (RAG) For Higher Education

基于大语言模型的评估检索增强生成(RAG)系统用于高等教育

Reza Vatankhah Barenji, Nazila Salimi, Sina Khoshgoftar

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本研究提出基于RAG架构的大语言模型驱动评估系统,通过整合评分标准和范文生成高质量反馈,实现大规模、一致的评估反馈,提升学生自主学习能力。

Comments 19 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13772 2026-01-13 cs.SD cs.AI cs.LG cs.MM eess.AS 84%

Jailbreak-AudioBench: In-Depth Evaluation and Analysis of Jailbreak Threats for Large Audio Language Models

Jailbreak-AudioBench: 对大型音频语言模型中 jailbreak 威胁的深入评估与分析

Hao Cheng, Erjia Xiao, Jing Shao, Yichi Wang, Le Yang, Chao Shen, Philip Torr, Jindong Gu, Renjing Xu

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) University of Oxford(牛津大学) Xi’an Jiaotong University(西安交通大学) Hong Kong University of Science and Technology(香港科技大学) Northeastern University(东北大学) Beijing University of Technology(北京理工大学)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.AI、cs.LG

AI总结 Jailbreak-AudioBench 通过构建工具箱、数据集和基准,深入评估大型音频语言模型中 jailbreak 威胁,并促进安全防护机制的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06845 2026-01-13 cs.AI 83%

Code Evolution for Control: Synthesizing Policies via LLM-Driven Evolutionary Search

代码进化用于控制:通过LLM驱动的进化搜索合成策略

Ping Guo, Chao Li, Yinglan Feng, Chaoning Zhang

机构 * Shenzhen Yuyi Tech. Co. Ltd.(深圳优衣科技有限公司) City University of Hong Kong(香港城市大学) Shenzhen University(深圳大学) University of Electronic Science and Technology of China(电子科技大学)

专题命中 评测与基准 :LLM(title,abstract);foundation model(abstract);分类 cs.AI

AI总结 本文提出利用LLM驱动的进化搜索生成可解释的控制策略,通过代码进化方法合成可执行代码,提升自主系统控制策略的可解释性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06776 2026-01-13 cs.AI 83%

From Text to Simulation: A Multi-Agent LLM Workflow for Automated Chemical Process Design

从文本到模拟:一种多智能体LLM工作流用于自动化化学过程设计

Xufei Tian, Wenli Du, Shaoyi Yang, Han Hu, Hui Xin, Shifeng Qu, Ke Ye

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种多智能体LLM工作流,利用大语言模型实现从文本到自动化学过程模拟的端到端自动化,提升模拟收敛率并减少设计时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12495 2026-01-13 cs.CL 83%

KG-MuLQA: A Framework for KG-based Multi-Level QA Extraction and Long-Context LLM Evaluation

KG-MuLQA:基于知识图谱的多级问答提取与长上下文LLM评估框架

Nikita Tatarinov, Vidhyakshaya Kannan, Haricharana Srinivasa, Arnav Raj, Harpreet Singh Anand, Varun Singh, Aditya Luthra, Ravij Lade, Agam Shah, Sudheer Chava

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 KG-MuLQA通过基于知识图谱的文档表示,实现了多级问答提取与长上下文LLM评估,揭示了模型在集合运算和多跳推理上的系统性失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06640 2026-01-13 cs.AI cs.NI 81%

Agentic AI Empowered Intent-Based Networking for 6G

基于代理AI的意图驱动网络用于6G

Genze Jiang, Kezhi Wang, Xiaomin Chen, Yizhou Huang

机构 * Department of Computer Science, Brunel University London, UK(布伦埃尔大学伦敦计算机科学系) Department of Computer Science, University of Reading, UK(阅读大学计算机科学系)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出基于多代理框架的意图驱动网络方案,通过LLM自主分解意图并生成可行网络配置,提升6G无线网络的自主编排能力。

Comments Submitted for Possible Journal Publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07331 2026-01-13 cs.SD cs.LG 79%

SEE: Signal Embedding Energy for Quantifying Noise Interference in Large Audio Language Models

SEE:信号嵌入能量用于量化大型音频语言模型中的噪声干扰

Yuanhe Zhang, Jiayu Tian, Yibo Zhang, Shilinlu Yan, Liang Lin, Zhenhong Zhou, Li Sun, Sen Su

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) North China Electric Power University(华北电力大学) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) Nanyang Technological University(新加坡南洋理工大学) Chongqing University of Posts and Telecommunications(重庆邮电大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.LG

AI总结 本文提出SEE方法,用于量化LALMs中的噪声干扰,通过结构化激活子空间提升噪声感知,实验显示SEE与性能高度相关,传统去噪方法效果有限,提出基于SEE的改进策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06877 2026-01-13 cs.HC cs.AI 79%

Personality-Aware Reinforcement Learning for Persuasive Dialogue with LLM-Driven Simulation

具有人格意识的强化学习用于由LLM驱动的说服对话

Donghuo Zeng, Roberto Legaspi, Kazushi Ikeda

机构 * KDDI Research, Inc.(KDDI研究公司)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 本文提出了一种基于LLM驱动模拟的人格意识强化学习方法,通过动态人格估计和行为导向奖励提升说服对话效果。

Comments 15 pages, 7 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02598 2026-01-13 cs.DL cs.AI 79%

LongDA: Benchmarking LLM Agents for Long-Document Data Analysis

LongDA:评估基于LLM的代理在长文档数据分析中的基准测试

Yiyang Li, Zheyuan Zhang, Tianyi Ma, Zehong Wang, Keerthiram Murugesan, Chuxu Zhang, Yanfang Ye

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 LongDA通过评估基于LLM的代理在长文档数据分析中的性能,揭示了现有模型在处理复杂任务时的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11742 2026-01-13 cs.CV cs.AI 79%

Safe Vision-Language Models via Unsafe Weights Manipulation

通过不安全权重操作实现安全的视觉-语言模型

Moreno D'Incà, Elia Peruzzo, Xingqian Xu, Humphrey Shi, Nicu Sebe, Massimiliano Mancini

机构 * University of Trento(特伦托大学) NVIDIA(NVIDIA公司) Georgia Tech(佐治亚理工学院)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 本文提出UWM方法,通过不训练的方式提升视觉-语言模型在不安全查询上的安全性,同时在安全输入上表现更优。

Comments WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06357 2026-01-13 cs.CR cs.AI 79%

Smart Privacy Policy Assistant: An LLM-Powered System for Transparent and Actionable Privacy Notices

智能隐私政策助手:一种基于大语言模型的透明且可操作的隐私通知系统

Sriharshini Kalvakuntla, Luoxi Tang, Yuqiao Meng, Zhaohan Xi

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 本文提出基于大语言模型的智能隐私政策助手,通过自动提取和分类隐私条款,生成可理解的解释,提升用户对隐私政策的理解和透明度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06112 2026-01-13 cs.AI 79%

ReliabilityBench: Evaluating LLM Agent Reliability Under Production-Like Stress Conditions

ReliabilityBench: 评估LLM代理在生产类压力条件下可靠性

Aayush Gupta

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 ReliabilityBench通过评估LLM代理在生产类压力条件下的可靠性,提出统一的可靠性表面和动作元关系,评估不同模型和架构的可靠性表现。

Comments 18 pages, 5 figures, 8 tables. Evaluates ReAct vs Reflexion across four tool-using domains with perturbation (epsilon) and fault-injection (lambda) stress testing; 1,280 total episodes

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07806 2026-01-13 cs.CL cs.LG 79%

The Confidence Trap: Gender Bias and Predictive Certainty in LLMs

自信陷阱:大语言模型中的性别偏见与预测确定性

Ahmed Sabir, Markus Kängsepp, Rajesh Sharma

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本研究探讨大语言模型在性别偏见任务中的置信度校准问题,提出Gender-ECE指标以评估公平性差异,发现Gemma-2在性别偏见基准中校准最差。

Comments AAAI 2026 (AISI Track), Oral. Project page: https://bit.ly/4p8OKQD

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06666 2026-01-13 cs.CL cs.AI 79%

InFi-Check: Interpretable and Fine-Grained Fact-Checking of LLMs

InFi-Check: 可解释且细粒度的大型语言模型事实核查

Yuzhuo Bai, Shuzheng Si, Kangyang Luo, Qingyi Wang, Wenhao Li, Gang Chen, Fanchao Qi, Maosong Sun

机构 * Tsinghua University(清华大学) DeepLang AI Fudan University(复旦大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 InFi-Check通过可控数据合成和细粒度事实核查框架,提升大型语言模型事实性评估的可解释性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06189 2026-01-13 cs.AI cs.LG 79%

Rational Synthesizers or Heuristic Followers? Analyzing LLMs in RAG-based Question-Answering

理性合成器还是启发式追随者?分析基于检索增强生成的问答系统

Atharv Naphade

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文通过GroupQA数据集分析LLM在基于检索增强生成的问答系统中如何整合冲突证据,发现模型倾向于优先证据且解释不忠实,表明LLM作为脆弱的启发式追随者。

Comments 13 pages, 9 figures, ACL ARR submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06132 2026-01-13 cs.CY cs.AI cs.CL 79%

An evaluation of LLMs for political bias in Western media: Israel-Hamas and Ukraine-Russia wars

对西方媒体中政治偏见的LLM评估:以以色列-哈马斯战争和乌克兰-俄罗斯战争为例

Rohitash Chandra, Haoyan Chen, Yaqing Zhang, Jiacheng Chen, Yuting Wu

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究利用LLMs分析西方媒体在以色列-哈马斯和乌克兰-俄罗斯战争中的政治偏见,发现不同模型对偏见的识别存在差异,且媒体报道风格随事件变化而变化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07826 2026-01-13 q-bio.GN 78%

Histopathology-centered Computational Evolution of Spatial Omics: Integration, Mapping, and Foundation Models

基于组织病理学的计算进化空间组学:整合、映射与基础模型

Ninghui Hao, Xinxing Yang, Boshen Yan, Dong Li, Junzhou Huang, Xintao Wu, Emily S. Ruiz, Arlene Ruiz de Luzuriaga, Chen Zhao, Guihong Wan

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 本文综述了基于组织病理学的计算进化空间组学,从整合、映射和基础模型三个范式出发,探讨了H&E图像在不同阶段的作用及当前研究的挑战与方向。

Comments 30 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06177 2026-01-13 cs.CR cs.SE 78%

AutoVulnPHP: LLM-Powered Two-Stage PHP Vulnerability Detection and Automated Localization

AutoVulnPHP: 基于LLM的两阶段PHP漏洞检测与自动定位

Zhiqiang Wang, Yizhong Ding, Zilong Xiao, Jinyu Lu, Yan Jia, Yanjun Li

专题命中 评测与基准 :LLM(title,abstract)

AI总结 AutoVulnPHP通过结合两阶段漏洞检测与细粒度自动定位,利用LLM提升PHP漏洞检测的准确性和定位精度,首次构建大规模PHP漏洞数据集并验证其实际应用效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18951 2026-01-13 cs.CL 77%

BnMMLU: Measuring Massive Multitask Language Understanding in Bengali

BnMMLU:测量孟加拉语大规模多任务语言理解

Saman Sarker Joy, Swakkhar Shatabda

机构 * University of Malaya(马来大学) BRAC University(BRAC大学)

专题命中 评测与基准 :LLM(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 BnMMLU通过大规模多任务评估孟加拉语语言理解,揭示模型推理和应用能力的不足,并推动多语言NLP发展。

Comments 19 Pages, 10 Tables, 12 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06034 2026-01-13 cs.SE cs.AI 77%

Autonomous QA Agent: A Retrieval-Augmented Framework for Reliable Selenium Script Generation

自主问答代理:一种增强检索的框架,用于可靠的Selenium脚本生成

Dudekula Kasim Vali

机构 * Department of Computer Science(计算机科学系) VIT-AP University(VIT-AP大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种基于增强检索的框架,通过项目文档和HTML结构生成可靠的Selenium测试脚本,显著提高了脚本生成的准确性和执行成功率。

Comments 13 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06149 2026-01-13 cs.LG cs.AI 76%

A Foundation Model Approach for Fetal Stress Prediction During Labor From cardiotocography (CTG) recordings

基于胎儿压力预测的劳动期间胎心图(CTG)记录的奠基模型方法

Naomi Fridman, Berta Ben Shachar

机构 * Department of Industrial Engineering, Ariel University, Ariel, Israel(工业工程系,阿维夫大学,阿维夫,以色列)

专题命中 评测与基准 :foundation model(title);分类 cs.AI、cs.LG

AI总结 本文提出基于自监督预训练的胎儿压力预测方法,利用CTG记录实现高预测准确率,解决了数据稀缺问题,为产房决策支持提供新路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09195 2026-01-13 cs.CV 75%

Towards Trustworthy Dermatology MLLMs: A Benchmark and Multimodal Evaluator for Diagnostic Narratives

迈向可信的皮肤科多模态大语言模型:一种基准和多模态评估器用于诊断叙述

Yuhao Shen, Jiahe Qian, Shuping Zhang, Zhangtianyi Chen, Tao Lu, Juexiao Zhou

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen(数据科学学院,香港中文大学(深圳)) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Department of Dermatology, The First Affiliated Hospital, Shantou University Medical College(皮肤科,汕头大学医学院第一附属医院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出DermBench和DermEval用于评估皮肤科多模态大语言模型的诊断叙述,通过结合基准和自动评估器,实现临床意义的可重复评估,验证模型性能与专家评分的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06779 2026-01-13 cs.CR 75%

CyberLLM-FINDS 2025: Instruction-Tuned Fine-tuning of Domain-Specific LLMs with Retrieval-Augmented Generation and Graph Integration for MITRE Evaluation

CyberLLM-FINDS 2025:基于检索增强生成和图集成的领域特定LLM指令微调方法用于MITRE评估

Vasanth Iyer, Leonardo Bobadilla, S. S. Iyengar

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出了一种基于检索增强生成和图集成的领域特定LLM微调方法,通过STIX威胁情报实现与MITRE ATT&CK技术的对齐,提升网络安全威胁情报分析的准确性。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09559 2026-01-13 cs.LG cs.AI cs.CL 75%

Enhancing Rare Codes via Probability-Biased Directed Graph Attention for Long-Tail ICD Coding

通过概率偏置有向图注意力增强罕见编码以应对长尾ICD编码

Tianlei Chen, Yuxiao Chen, Yang Li, Feifei Wang

机构 * Center for Applied Statistics, Renmin University of China(中国人民大学应用统计中心) School of Statistics, Renmin University of China(中国人民大学统计学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出概率偏置有向图注意力模型,通过增强罕见代码的表示,提升ICD编码的长尾分类性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06675 2026-01-13 cs.CL 74%

Evaluating Cross-Lingual Unlearning in Multilingual Language Models

评估多语言语言模型中的跨语言反学习

Tyler Lizzo, Larry Heck

机构 * AI Virtual Assistant (AVA) Lab(人工智能虚拟助手(AVA)实验室) Georgia Institute of Technology(佐治亚理工学院)

专题命中 评测与基准 :language model(title);分类 cs.CL

AI总结 本文研究了多语言语言模型中的跨语言反学习,发现子空间投影方法在去除非训练语言事实方面表现最佳,揭示了权重空间几何结构对多语言遗忘的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07606 2026-01-13 cs.CL cs.AI 73%

Proof of Time: A Benchmark for Evaluating Scientific Idea Judgments

证明时间:评估科学思想判断的基准

Bingyang Ye, Shan Chen, Jingxuan Tu, Chen Liu, Zidi Xiong, Samuel Schmidgall, Danielle S. Bitterman

机构 * Harvard University(哈佛大学) Mass General Brigham(麻省总医院) Boston Children’s Hospital(波士顿儿童医院) Brandeis University(布兰迪大学) Yale University(耶鲁大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 PoT通过半可验证的基准框架评估科学思想判断,利用时间分区和未来可验证的目标,结合离线沙盒实现可扩展的评估。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02109 2026-01-13 cs.AI cs.CL cs.CY 73%

Deep Value Benchmark: Measuring Whether Models Generalize Deep Values or Shallow Preferences

深度价值基准:衡量模型是泛化深度价值还是浅层偏好

Joshua Ashkinaze, Hua Shen, Saipranav Avula, Eric Gilbert, Ceren Budak

机构 * University of Michigan Ann Arbor(密歇根大学安娜堡分校) New York University Shanghai(纽约大学上海)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 深度价值基准通过测试模型泛化深度价值还是浅层偏好,评估AI对齐的核心能力。

Comments NeurIPS 2025 (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11218 2026-01-13 cs.CL cs.AI 73%

The Curious Case of Factual (Mis)Alignment between LLMs' Short- and Long-Form Answers

事实性(误解)一致性在LLM短形式和长形式回答中的奇特案例

Saad Obaid ul Islam, Anne Lauscher, Goran Glavaš

机构 * WüNLP, CAIDAS, University of Würzburg(乌尔姆大学) Data Science Group, University of Hamburg(汉堡大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出SLAQ框架,揭示LLM在短长形式回答中存在事实一致性问题,通过机制分析发现重叠内部结构与78%预测准确率,挑战现有评估实践。

Comments Code: https://github.com/WorldHellow/SLAQ/tree/main

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21889 2026-01-13 cs.CV cs.AI cs.LG 73%

StarFlow: Generating Structured Workflow Outputs From Sketch Images

StarFlow: 从草图图像生成结构化工作流输出

Patrice Bechard, Chao Wang, Amirhossein Abaskohi, Juan Rodriguez, Christopher Pal, David Vazquez, Spandana Gella, Sai Rajeswar, Perouz Taslakian

专题命中 评测与基准 :language model(abstract);foundation model(abstract);分类 cs.AI、cs.LG

AI总结 StarFlow通过视觉-语言模型从草图自动生成结构化工作流,提升了自动化流程的构建效率。

Comments To be presented at EACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏