arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32411 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32411 篇

2510.06605 2026-01-22 cs.CR cs.AI cs.CL 86%

Reading Between the Lines: Towards Reliable Black-box LLM Fingerprinting via Zeroth-order Gradient Estimation

在行之间阅读:通过零阶梯度估计实现可靠的黑盒LLM指纹识别

Shuo Shao, Yiming Li, Hongwei Yao, Yifei Chen, Yuchen Yang, Zhan Qin

机构 * Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学) City University of Hong Kong(香港城市大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ZeroPrint方法,通过零阶梯度估计在黑盒环境下实现更可靠的LLM指纹识别,有效提升指纹识别的准确性和鲁棒性。

Comments This paper is accepeted by the ACM Web Conference (WWW) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13649 2026-01-21 cs.CL cs.AI 86%

Fairness or Fluency? An Investigation into Language Bias of Pairwise LLM-as-a-Judge

公平性还是流畅性?对配对LLM-as-a-judge语言偏见的调查

Xiaolin Zhou, Zheng Luo, Yicheng Gao, Qixuan Chen, Xiyang Hu, Yue Zhao, Ruishan Liu

机构 * University of Southern California(南加州大学) Arizona State University(亚利桑那州立大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了LLM-as-a-judge在配对任务中的语言偏见,发现不同语言在性能和偏好上有显著差异,且语言偏见不能仅由困惑度解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13537 2026-01-21 cs.CL cs.AI 86%

When Wording Steers the Evaluation: Framing Bias in LLM judges

当用词引导评估:在LLM评估中框架偏见的影响

Yerin Hwang, Dongryeol Lee, Taegwan Kang, Minwoo Lee, Kyomin Jung

机构 * IPAI, Seoul National University(IPAI,首尔国立大学) Dept. of ECE, Seoul National University(电子工程系,首尔国立大学) LG AI Research(LG人工智能研究) SNU-LG AI Research Center(SNU-LG人工智能研究中心)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究揭示了LLM评估中框架偏见的影响,通过设计对称提示展示框架如何扭曲模型判断,强调需建立框架意识的评估协议。

Comments 4 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01553 2026-01-21 cs.AI cs.CL 86%

MedQA-CS: Objective Structured Clinical Examination (OSCE)-Style Benchmark for Evaluating LLM Clinical Skills

MedQA-CS: 用于评估大语言模型临床技能的Objective Structured Clinical Examination (OSCE)风格基准

Zonghai Yao, Zihao Zhang, Chaolong Tang, Xingyu Bian, Youxia Zhao, Zhichao Yang, Junda Wang, Huixue Zhou, Won Seok Jang, Feiyun Ouyang, Hong Yu

机构 * University of Massachusetts, Amherst(马萨诸塞大学阿默斯特分校) Emory University(埃默里大学) University of Minnesota(明尼苏达大学) University of Massachusetts, Lowell(马萨诸塞大学洛厄尔分校) UMass Chan Medical School(UMass Chan医学学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 MedQA-CS是一种基于OSCE风格的基准,用于评估大语言模型的临床技能,通过模拟医学学生和评估者任务,提供更全面的评估方法。

Comments To appear in proceedings of the Main Conference of the European Chapter of the Association for Computational Linguistics (EACL) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11920 2026-01-21 cs.CL cs.AI 86%

Enhancing LLM-Based Data Annotation with Error Decomposition

通过错误分解增强基于LLM的数据标注

Zhen Xu, Vedant Khatri, Yijun Dai, Xiner Liu, Siyan Li, Xuanming Zhang, Renzhe Yu

机构 * Columbia University(哥伦比亚大学) University of California, Irvine(加州大学尔湾分校) University of Pennsylvania(宾夕法尼亚大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 通过错误分解增强基于LLM的数据标注,提出诊断评估范式以区分任务固有模糊性与模型不准确,提升标注质量评估的准确性与实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20721 2026-01-16 cs.CL cs.AI cs.HC 86%

User Perceptions vs. Proxy LLM Judges: Privacy and Helpfulness in LLM Responses to Privacy-Sensitive Scenarios

用户感知与代理LLM评判:隐私与帮助性在隐私敏感场景中的LLM响应

Xiaoyuan Wu, Roshni Kaushik, Wenkai Li, Lujo Bauer, Koichi Onoue

机构 * Fujitsu Research of America Inc.(富士通美国研究所) Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究发现用户对LLM响应的隐私和帮助性感知与代理LLM评判存在显著差异,需加强用户为中心的评估以提升隐私保护与实用性平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05465 2026-01-16 cs.AI cs.CL 86%

VAL-Bench: Belief Consistency as a measure for Value Alignment in Language Models

VAL-Bench:信念一致性作为语言模型价值观对齐的度量标准

Aman Gupta, Denny O'Shea, Fazl Barez

机构 * MasterClass University of Oxford(牛津大学) WhiteBox Martian

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 VAL-Bench通过评估语言模型在现实价值相关提示中的信念一致性,提出了一种衡量价值观对齐的新基准,揭示了不同模型在一致性上的显著差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02097 2026-01-16 cs.CL cs.AI 86%

JudgeAgent: Beyond Static Benchmarks for Knowledge-Driven and Dynamic LLM Evaluation

JudgeAgent: 超越静态基准的面向知识驱动和动态LLM评估

Zhichao Shi, Xuhui Jiang, Chengjin Xu, Cangli Yao, Shengjia Ma, Yinghan Shen, Zixuan Li, Jian Guo, Yuanzhuo Wang

机构 * DataArc Tech Ltd.(DataArc科技有限公司) IDEA Research, International Digital Economy Academy(国际数字经济学院IDEA研究所) School of Advanced Interdisciplinary Sciences, UCAS(北京大学交叉学科学院) State Key Lab of AI Safety, Institute of Computing Technology, CAS(中国科学院计算技术研究所人工智能安全国家重点实验室)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 JudgeAgent通过知识驱动和动态评估框架,解决LLM评估中知识覆盖不足和难度不匹配的问题,实现更全面的评估和模型优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05984 2026-01-15 cs.AI cs.CL cs.HC 86%

Development and Evaluation of HopeBot: an LLM-based chatbot for structured and interactive PHQ-9 depression screening

HopeBot的开发与评估:一种基于大语言模型的聊天机器人,用于结构化和互动的PHQ-9抑郁筛查

Zhijun Guo, Alvina Lai, Julia Ive, Alexandru Petcu, Yutong Wang, Luyuan Qi, Johan H Thygesen, Kezhi Li

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 HopeBot利用大语言模型实现结构化和互动的PHQ-9抑郁筛查,展示出作为可扩展筛查工具的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08835 2026-01-15 cs.CL cs.AI 86%

DeliberationBench: When Do More Voices Hurt? A Controlled Study of Multi-LLM Deliberation Protocols

DeliberationBench: 当更多声音有害时?多LLM协商协议的受控研究

Vaarunay Kaushal, Taranveer Singh

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 DeliberationBench研究发现,多LLM协商协议在性能上远低于简单基线,挑战了复杂性提升质量的假设。

Comments 6 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08107 2026-01-14 cs.LG cs.AI cs.SY eess.SY 86%

STO-RL: Offline RL under Sparse Rewards via LLM-Guided Subgoal Temporal Order

STO-RL:通过LLM引导的子目标时间顺序实现稀疏奖励下的离线RL

Chengyang Gu, Yuxin Pan, Hui Xiong, Yize Chen

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州)) University of Alberta(阿尔伯塔大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 STO-RL通过LLM生成子目标时间顺序,结合潜在奖励塑造,提升稀疏奖励下离线RL的性能与稳定性。

Comments Accepted at International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08003 2026-01-14 cs.CL cs.AI cs.MA 86%

LLM Review: Enhancing Creative Writing via Blind Peer Review Feedback

LLM Review: 通过盲审同行反馈增强创造性写作

Weiyue Li, Mingxiao Song, Zhenda Shen, Dachuan Zhao, Yunfan Long, Yi Li, Yongce Li, Ruyi Yang, Mengyu Wang

机构 * Harvard University(哈佛大学) Carnegie Mellon University(卡内基梅隆大学) Stanford University(斯坦福大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 LLM Review通过盲审同行反馈机制提升创造性写作,实验显示其优于多智能体基线,并使小模型超越大模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07309 2026-01-13 cs.AI cs.LG 86%

ARM: Role-Conditioned Neuron Transplantation for Training-Free Generalist LLM Agent Merging

ARM:基于角色的神经元移植用于无训练通用大语言模型代理融合

Zhuoka Feng, Kang Chen, Sihan Zhao, Kai Xiong, Yaoning Wang, Minshen Yu, Junjie Nian, Changyi Xiao, Yixin Cao, Yugang Jiang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 ARM通过角色条件神经元移植方法提升大语言模型代理在多环境中的泛化能力,实现无训练的模型融合。

Comments 17 pages, 12 figures. Project page: https://arkazhuo.github.io/ARM-homepage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05623 2026-01-13 cs.SE cs.AI cs.CL 86%

Deployability-Centric Infrastructure-as-Code Generation: Fail, Learn, Refine, and Succeed through LLM-Empowered DevOps Simulation

以部署为中心的基础设施即代码生成:通过LLM赋能的DevOps模拟实现失败、学习、细化和成功

Tianyi Zhang, Shidong Pan, Zejun Zhang, Zhenchang Xing, Xiaoyu Sun

机构 * Australian National University Canberra Australia New York University \& Columbia University USA Nanyang Technological University Singapore Australian National University Australia Australian National University New York University \& Columbia University Nanyang Technological University

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出IaCGen框架,通过迭代反馈机制提升IaC模板的部署性,实验表明其在10次迭代内可使模板部署成功率提升至91.6%,并进一步通过人工反馈将性能提升至90%以上。

Comments Accepted by FSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14268 2026-01-13 cs.CL cs.AI 86%

Think-J: Learning to Think for Generative LLM-as-a-Judge

Think-J: 生成式大语言模型作为评判者的学习思考

Hui Huang, Yancheng He, Hongli Zhou, Rui Zhang, Wei Liu, Weixun Wang, Jiaheng Liu, Wenbo Su

机构 * \dagger(机构2)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 Think-J通过学习思考方式提升生成式LLM作为评判者的性能,利用强化学习优化判断轨迹,无需额外标注即可超越现有方法。

Comments Accepted by AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06346 2026-01-09 cs.AI cs.CL 86%

LPFQA: A Long-Tail Professional Forum-based Benchmark for LLM Evaluation

LPFQA: 一个基于长尾专业论坛的LLM评估基准

Liya Zhu, Peizhuang Cong, Jingzhe Ding, Aowei Ji, Wenya Wu, Jiani Hou, Chunjie Wu, Xiang Gao, Jingkai Liu, Zhou Huan, Xuelei Sun, Yang Yang, Jianpeng Jiao, Liang Hu, Xinjie Chen, Jiashuo Liu, Tong Yang, Zaiyuan Wang, Ge Zhang, Wenhao Huang

机构 * ByteDance Seed Peking University(字节跳动种子北京大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 LPFQA是一个基于真实专业论坛的长尾知识基准,用于评估LLM在专业领域推理和领域术语理解方面的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03444 2026-01-08 cs.CL cs.AI cs.HC 86%

Grading Scale Impact on LLM-as-a-Judge: Human-LLM Alignment Is Highest on 0-5 Grading Scale

评分尺度对LLM作为裁判的影响:人类与LLM的对齐在0-5评分尺度上最高

Weiyue Li, Minda Zhao, Weixuan Dong, Jiahui Cai, Yuze Wei, Michael Pocress, Yi Li, Wanyan Yuan, Xiaoyue Wang, Ruoyu Hou, Kaiyuan Lou, Wenqi Zeng, Yutong Yang, Yilun Du, Mengyu Wang

机构 * Harvard University(哈佛大学) CMU(卡内基梅隆大学) Stanford University(斯坦福大学) UC San Diego(圣地亚哥大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了评分尺度对LLM作为裁判一致性的影响,发现0-5评分尺度在人类与LLM之间产生最强的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03276 2026-01-08 cs.CL cs.AI 86%

Topic Segmentation Using Generative Language Models

使用生成语言模型进行主题分割

Pierre Mackenzie, Maya Shah, Patrick Frenett

机构 * Adarga(阿达格) University of Edinburgh(爱丁堡大学) University of Exeter(埃克塞特大学)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种基于生成语言模型的重叠递归提示策略,用于提升主题分割效果,但指出仍需进一步解决相关问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12227 2026-01-08 cs.LG cs.AI stat.ML 86%

Uncovering Bias Paths with LLM-guided Causal Discovery: An Active Learning and Dynamic Scoring Approach

通过LLM引导的因果发现揭示偏见路径:一种主动学习和动态评分方法

Khadija Zanna, Akane Sano

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种结合LLM引导的主动学习和动态评分方法,用于在存在噪声和混杂因素时发现公平性相关的因果路径。

Comments To be presented at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03232 2026-01-07 cs.CL cs.AI 86%

Multi-RADS Synthetic Radiology Report Dataset and Head-to-Head Benchmarking of 41 Open-Weight and Proprietary Language Models

多RADS合成放射学报告数据集及41种开源和专有语言模型的头对头基准测试

Kartik Bose, Abhinandan Kumar, Raghuraman Soundararajan, Priya Mudgil, Samonee Ralmilay, Niharika Dutta, Manphool Singhal, Arun Kumar, Saugata Sen, Anurima Patra, Priya Ghosh, Abanti Das, Amit Gupta, Ashish Verma, Dipin Sudhakaran, Ekta Dhamija, Himangi Unde, Ishan Kumar, Krithika Rangarajan, Prerna Garg, Rachel Sequeira, Sudhin Shylendran, Taruna Yadav, Tej Pal, Pankaj Gupta

机构 * Postgraduate Institute of Medical Education and Research(医学教育与研究研究生院) Tata Medical Center(塔塔医学中心) All India Institute of Medical Sciences(全印度医学科学研究所) National Cancer Institute(国家癌症研究所) Banaras Hindu University(巴纳尔斯·胡斯·印度大学) Aster Malabar Institute of Medical Sciences(Aster马拉巴医学科学研究所)

专题命中 评测与基准 :language model(title,abstract);small language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出了多RADS合成放射学报告数据集RXL-RADSet,并比较了41种开源和专有语言模型在RADS分配任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22458 2026-01-06 cs.CL cs.AI 86%

Evaluating LLM-based Agents for Multi-Turn Conversations: A Survey

评估基于大语言模型的代理在多轮对话中的性能:一项调查

Shengyue Guan, Jindong Wang, Jiang Bian, Bin Zhu, Jian-guang Lou, Haoyi Xiong

机构 * Microsoft(微软)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种基于PRISMA框架的系统方法,用于评估多轮对话中基于LLM的代理,通过两个分类系统定义评估内容和方法,涵盖任务完成、响应质量等关键维度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01751 2026-01-06 cs.IR cs.AI cs.CL 86%

Query-Document Dense Vectors for LLM Relevance Judgment Bias Analysis

用于LLM相关性判断偏差分析的查询-文档密集向量

Samaneh Mohtadi, Gianluca Demartini

机构 * The University of Queensland, Brisbane, Australia(昆士兰大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种基于聚类的框架,用于分析LLM在相关性判断中的系统性偏差,通过语义空间嵌入识别分歧模式,提升IR评估的可靠性。

Comments Accepted for presentation at the ECIR 2026 Full Papers track

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09082 2026-01-06 cs.CL cs.AI 86%

CoSER: A Comprehensive Literary Dataset and Framework for Training and Evaluating LLM Role-Playing and Persona Simulation

CoSER:一个综合的文学数据集和框架,用于训练和评估LLM角色扮演和人设模拟

Xintao Wang, Heng Wang, Yifei Zhang, Xinfeng Yuan, Rui Xu, Jen-tse Huang, Siyu Yuan, Haoran Guo, Jiangjie Chen, Shuchang Zhou, Wei Wang, Yanghua Xiao

机构 * Fudan University(复旦大学) StepFun Johns Hopkins University(约翰霍普金斯大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);language agent(abstract)

AI总结 CoSER通过高质量文学数据集和开放模型,训练和评估LLM角色扮演能力,其70B模型在多个基准测试中超越GPT-4o。

Comments Accepted by ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00268 2026-01-05 cs.CL cs.AI 86%

Beyond Perfect APIs: A Comprehensive Evaluation of LLM Agents Under Real-World API Complexity

超越完美API:对LLM代理在现实API复杂性下的全面评估

Doyoung Kim, Zhiwei Ren, Jie Hao, Zhongkai Sun, Lichao Wang, Xiyao Ma, Zack Ye, Xu Han, Jun Yin, Heng Ji, Wei Shen, Xing Fan, Benjamin Yao, Chenlei Guo

机构 * Amazon(亚马逊公司) KAIST(韩国科学技术院) University of Pittsburgh(匹兹堡大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出WildAGTEval基准测试,用于评估LLM代理在现实API复杂性下的功能调用能力,发现无关信息复杂性显著降低强LLM性能并影响用户满意度。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04481 2026-01-05 cs.GR cs.AI cs.CL cs.MM 86%

Narrative-to-Scene Generation: An LLM-Driven Pipeline for 2D Game Environments

叙事到场景生成:一种由大语言模型驱动的2D游戏环境生成管道

Yi-Chun Chen, Arnav Jhala

机构 * Yale University(耶鲁大学) North Carolina State University(北卡罗来纳州立大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种由大语言模型驱动的2D游戏环境生成方法,通过时间框架分析和空间谓词提取,实现从叙述到可玩场景的自动化生成。

Comments Camera-ready version of a paper accepted at the AIIDE 2025 Workshop on Experimental AI in Games (EXAG)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23712 2026-01-01 cs.CL cs.AI 86%

STED and Consistency Scoring: A Framework for Evaluating LLM Structured Output Reliability

STED与一致性评分:一个评估LLM结构化输出可靠性的框架

Guanghui Wang, Jinze Yu, Xing Zhang, Dayuan Jiang, Yin Song, Tomal Deb, Xuefeng Liu, Peiyang He

机构 * AWS Generative AI Innovation Center(AWS生成式AI创新中心) AWS WWSO SA Field Initiatives(AWS WWSO SA现场项目)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出STED与一致性评分框架,用于评估LLM结构化输出可靠性,通过实验展示其在不同模型上的表现差异及应用价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.15272 2026-01-01 cs.CL cs.AI cs.CV 86%

OmniBench: Towards The Future of Universal Omni-Language Models

OmniBench: 向通用多语言模型的未来迈进

Yizhi Li, Yinghao Ma, Ge Zhang, Ruibin Yuan, Kang Zhu, Hangyu Guo, Yiming Liang, Jiaheng Liu, Zekun Wang, Jian Yang, Siwei Wu, Xingwei Qu, Jinjie Shi, Xinyue Zhang, Zhenzhu Yang, Yidan Wen, Yanghai Wang, Shihao Li, Zhaoxiang Zhang, Zachary Liu, Emmanouil Benetos, Wenhao Huang, Chenghua Lin

机构 * University of Manchester(曼彻斯特大学) Queen Mary University of London(伦敦大学玛丽女王学院) Hongkong University of Science and Technology(香港科学与技术大学) Nanjing University(南京大学) Dartmouth College(达特茅斯学院)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);instruction tuning(abstract);分类 cs.CL、cs.AI

AI总结 OmniBench提出了一种评估通用多语言模型三模态处理能力的基准,揭示了现有模型在多模态推理中的不足,并提出OmniInstruct数据集以改进训练方法。

Comments Accepted by The Thirty-Ninth Annual Conference on Neural Information Processing Systems (NeurIPS2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23684 2025-12-30 cs.CL cs.AI 86%

Multilingual Hidden Prompt Injection Attacks on LLM-Based Academic Reviewing

多语言隐藏提示注入攻击对基于LLM的学术评审的影响

Panagiotis Theocharopoulos, Ajinkya Kulkarni, Mathew Magimai. -Doss

机构 * International School of Athens(希腊国际学校) Idiap Research Institute(Idiap研究 institute)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究发现,多语言隐藏提示注入攻击对LLM基于的学术评审系统产生显著影响,尤其在英语、日语和中文中表现明显,而阿拉伯语则影响较小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07413 2025-12-29 cs.CR cs.AI cs.LG 86%

Hybrid LLM-Enhanced Intrusion Detection for Zero-Day Threats in IoT Networks

混合LLM增强的物联网网络零日威胁入侵检测

Mohammad F. Al-Hammouri, Yazan Otoum, Rasha Atwa, Amiya Nayak

机构 * Dept. of Computer Engineering, The Hashemite University(计算机工程系,哈希米大学) School of Computer Science and Technology, Algoma University(计算机科学与技术学院,阿尔戈马大学) College of Computer Science and Engineering, University of Jeddah(计算机科学与工程学院,朱德赫大学) School of Electrical Engineering and Computer Science, University of Ottawa(电气工程与计算机科学学院,渥太华大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种结合传统签名检测与GPT-2语言模型的混合入侵检测框架,以提升物联网网络中零日威胁的检测准确率和减少误报。

Comments 6 pages, IEEE conference

Journal ref Proc. IEEE/ACIS International Conference on Software Engineering, Artificial Intelligence, Networking and Parallel/Distributed Computing (SNPD), 2025, pp. 864-869

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21010 2025-12-25 cs.LG cs.AI cs.PF 86%

LLM Swiss Round: Aggregating Multi-Benchmark Performance via Competitive Swiss-System Dynamics

LLM瑞士轮:通过竞争瑞士系统动态聚合多基准性能

Jiashuo Liu, Jiayun Wu, Chunjie Wu, Jingkai Liu, Zaiyuan Wang, Huan Zhou, Wenhao Huang, Hongseok Namkoong

机构 * Carnegie Mellon University(卡内基梅隆大学) Columbia University(哥伦比亚大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出CSD框架,通过竞争瑞士系统动态聚合多基准性能,提升LLM评估的准确性和风险意识。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏