arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32208 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32208 篇

2601.04895 2026-01-09 cs.AI 89%

DVD: A Robust Method for Detecting Variant Contamination in Large Language Model Evaluation

DVD:一种检测大规模语言模型评估中变体污染的稳健方法

Renzhao Liang, Jingru Chen, Bo Jia, Bo Deng, Chenggang Xie, Yidong Wang, Ke Jin, Xin Wang, Linfeng Zhang, Cunxiang Wang

机构 * Beihang University(北京航空航天大学) Peking University(北京大学) Beijing University of Posts and Telecommunications(北京邮电大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 DVD通过分析生成分布的方差检测大规模语言模型评估中的变体污染,优于多种现有检测方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16036 2026-01-09 cs.CL 89%

OpenEthics: A Comprehensive Ethical Evaluation of Open-Source Generative Large Language Models

OpenEthics: 对开源生成大语言模型的全面伦理评估

Yıldırım Özen, Burak Erinç Çetin, Kaan Engür, Elif Naz Demiryılmaz, Cagri Toraman

机构 * Middle East Technical University(中东技术大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本研究对29个开源生成大语言模型进行全面伦理评估,评估鲁棒性、可靠性、安全性和公平性,发现较大模型在伦理表现上更优,禁言模板对多数模型无效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04034 2026-01-08 cs.CR cs.AI 89%

HoneyTrap: Deceiving Large Language Model Attackers to Honeypot Traps with Resilient Multi-Agent Defense

HoneyTrap: 通过坚韧的多智能体防御欺骗大语言模型攻击者以诱捕陷阱

Siyuan Li, Xi Lin, Jun Wu, Zehao Liu, Haoyu Li, Tianjie Ju, Xiang Chen, Jianhua Li

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 HoneyTrap通过多智能体协作防御机制,有效降低大语言模型劫持攻击的成功率,提升防御效率与资源消耗效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03023 2026-01-08 cs.CL cs.HC 89%

MedDialogRubrics: A Comprehensive Benchmark and Evaluation Framework for Multi-turn Medical Consultations in Large Language Models

MedDialogRubrics: 一种用于大型语言模型多轮医疗咨询的综合基准和评估框架

Lecheng Gong, Weimin Fang, Ting Yang, Dongjie Tao, Chunxiao Guo, Peng Wei, Bo Xie, Jinqun Guan, Zixiao Chen, Fang Shi, Jinjie Gu, Junwei Liu

机构 * Ant Group(蚂蚁集团)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 MedDialogRubrics提出了一种用于评估大型语言模型多轮医疗对话能力的综合基准和评估框架,通过合成患者案例和细粒度评估 rubrics,揭示了当前模型在医疗对话管理方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02677 2026-01-07 cs.LG q-fin.RM q-fin.ST 89%

Uni-FinLLM: A Unified Multimodal Large Language Model with Modular Task Heads for Micro-Level Stock Prediction and Macro-Level Systemic Risk Assessment

Uni-FinLLM:一种具有模块化任务头的统一多模态大语言模型,用于微观层面的股票预测和宏观层面的系统性风险评估

Gongao Zhang, Haijiang Zeng, Lu Jiang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG

AI总结 Uni-FinLLM通过统一多模态大语言模型,结合模块化任务头,实现了对股票预测和系统性风险评估的高效联合建模,显著提升了预测准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02669 2026-01-07 cs.CL 89%

Towards Comprehensive Stage-wise Benchmarking of Large Language Models in Fact-Checking

面向大规模语言模型事实核查的全面阶段性基准评估

Hongzhan Lin, Zixin Chen, Zhiqi Shen, Ziyang Luo, Zhen Ye, Jing Ma, Tat-Seng Chua, Guandong Xu

机构 * Department of Computer Science, Hong Kong Baptist University(香港 Baptist 大学计算机科学系) Salesforce AI Research(Salesforce AI 研究院) The Hong Kong University of Science and Technology(香港科学与技术大学) National University of Singapore(新加坡国立大学) The Education University of Hong Kong(香港教育大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 FactArena提出一个全面的LLM事实核查阶段基准评估框架,通过标准化流程和动态生成挑战性声明,揭示LLM在事实推理中的鲁棒性与准确性差异。

Comments 17 pages, 21 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02443 2026-01-07 cs.CV cs.AI eess.IV 89%

Evaluating the Diagnostic Classification Ability of Multimodal Large Language Models: Insights from the Osteoarthritis Initiative

评估多模态大语言模型的诊断分类能力:来自骨关节炎倡议的见解

Li Wang, Xi Chen, XiangWen Deng, HuaHui Yi, ZeKun Jiang, Kang Li, Jian Li

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 研究发现,多模态大语言模型在医学图像分类中表现不佳,建议优先优化视觉编码器和数据集质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02060 2026-01-06 cs.PL cs.AI cs.SE 89%

Perish or Flourish? A Holistic Evaluation of Large Language Models for Code Generation in Functional Programming

perish 或 flourish? 对于函数式编程中代码生成的大型语言模型的全面评估

Nguyet-Anh H. Lang, Eric Lang, Thanh Le-Cong, Bach Le, Quyet-Thang Huynh

机构 * Hanoi University of Science and Technology(河内科学技术大学) The University of Melbourne(墨尔本大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出FPEval框架,评估大型语言模型在函数式编程语言中的代码生成能力,发现模型性能随进步而提升,但纯函数式语言错误率较高,且生成代码风格问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00867 2026-01-06 cs.CR cs.AI cs.CY cs.HC 89%

The Silicon Psyche: Anthropomorphic Vulnerabilities in Large Language Models

硅之心:大型语言模型中的人格化脆弱性

Giuseppe Canale, Kashyap Thimmaraju

机构 * CPF3.org(CPF3组织) Flowguard Institute(Flowguard研究所)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出LLMs继承人类心理脆弱性,通过心理测量框架揭示其对权威操纵等攻击的易受性,呼吁开发心理防火墙以保护AI安全。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22249 2025-12-30 cs.LG cs.CV 89%

Temporal Visual Semantics-Induced Human Motion Understanding with Large Language Models

基于大语言模型的时序视觉语义诱导的人体运动理解

Zheng Xing, Weibing Zhao

机构 * Guangdong Laboratory of Machine Perception and Intelligent Computing, Shenzhen MSU-BIT University, China(广东机器感知与智能计算实验室,深圳MSU-BIT大学,中国) College of Computer Science and Software Engineering, Shenzhen University, Shenzhen(计算机科学与软件工程学院,深圳大学,深圳)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG

AI总结 本文提出一种利用大语言模型提取时间视觉语义并整合到子空间聚类中,以提升人体运动分割性能的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22145 2025-12-30 cs.DL cs.AI cs.CY 89%

Pre-review to Peer review: Pitfalls of Automating Reviews using Large Language Models

预审至同行评审:使用大型语言模型自动化评审的陷阱

Akhil Pandey Akella, Harish Varma Siravuri, Shaurya Rohatgi

机构 * AllSci Corp(AllSci公司) Sunwater Capital(Sunwater资本) Kellogg School of Management, Northwestern University(西北大学凯洛格管理学院) Dept. of Computer Science, Northern Illinois University(北伊利诺伊大学计算机科学系) Institute of Foundation Models, MBZUAI(基础模型研究所,MBZUAI)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文研究了使用大型语言模型进行学术评审的潜力与风险,发现其作为预审筛选工具具有一定效用,但存在与人类评审不一致的风险及系统性高估偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19697 2025-12-24 cs.NI cs.AI 89%

Automated Fault Detection in 5G Core Networks Using Large Language Models

利用大语言模型实现5G核心网络的自动化故障检测

Parsa Hatami, Ahmadreza Majlesara, Ali Majlesi, Babak Hossein Khalaj

机构 * Department of Electrical Engineering Sharif University of Technology Tehran, Iran(电气工程系 巴里夫大学 泰伦,伊朗)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本研究利用大语言模型实现5G核心网络的自动化故障检测与分类,通过微调GPT-4.1 nano模型提升故障检测准确性,为实现闭环无操作员故障管理提供新方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25535 2025-12-24 cs.LG stat.ML 89%

Meta-Router: Bridging Gold-standard and Preference-based Evaluations in Large Language Model Routing

Meta-Router: 在大语言模型路由中弥合标准评估与偏好评估之间的鸿沟

Yichi Zhang, Fangzheng Xie, Shu Yang, Chong Wu

机构 * Department of Statistics, Indiana University Bloomington(印第安纳大学布卢明顿分校统计系) Department of Statistics, North Carolina State University(北卡罗来纳州立大学统计系) Department of Biostatistics, The University of Texas MD Anderson Cancer Center(德克萨斯大学MD安德森癌症中心生物统计学系)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG

AI总结 Meta-Router通过整合标准与偏好数据,利用因果推断框架提升大语言模型路由的鲁棒性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12399 2025-12-23 cs.AI 89%

A Survey of Vibe Coding with Large Language Models

基于大语言模型的Vibe编码调研

Yuyao Ge, Lingrui Mei, Zenghao Duan, Tianhao Li, Yujia Zheng, Yiwei Wang, Lexin Wang, Jiayu Yao, Tianyu Liu, Yujun Cai, Baolong Bi, Fangda Guo, Jiafeng Guo, Shenghua Liu, Xueqi Cheng

机构 * Institute of Computing Technology Chinese Academy of Sciences(中国科学院计算技术研究所) Duke University(杜克大学) University of California Merced(加州大学默塞德分校) Peking University(北京大学) University of Queensland(昆士兰大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文调研了基于大语言模型的Vibe编码方法,系统分析了其理论基础和五个开发模型,揭示了上下文工程与协作模式对成功的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09337 2025-12-23 cs.CL 89%

Decoding Neural Emotion Patterns through Large Language Model Embeddings

通过大型语言模型嵌入解码神经情绪模式

Gideon Vos, Maryam Ebrahimpour, Liza van Eijk, Zoltan Sarnyai, Mostafa Rahimi Azghadi

机构 * College of Science and Engineering, James Cook University(科学与工程学院,詹姆斯库克大学) College of Health Care Sciences, James Cook University(健康护理科学学院,詹姆斯库克大学) College of Public Health, Medical, and Vet Sciences, James Cook University(公共健康、医学与兽医学学院,詹姆斯库克大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 通过大型语言模型嵌入解码神经情绪模式,实现情绪与大脑区域的映射,区分抑郁人群与基本情绪分布,提供AI情感表达的脑基准评估。

Comments 26 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02800 2025-12-23 cs.CL 89%

Survey and Experiments on Mental Disorder Detection via Social Media: From Large Language Models and RAG to Agents

面向社交媒体的抑郁症检测综述与实验:从大型语言模型和RAG到代理

Zhuohan Ge, Darian Li, Yubo Wang, Nicole Hu, Xinyi Zhu, Haoyang Li, Xin Zhang, Mingtao Zhang, Shihao Qi, Yuming Xu, Han Shi, Chen Jason Zhang, Qing Li

机构 * The Hong Kong Polytechnic University(香港理工大学) The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文综述并实验了基于社交媒体的抑郁症检测方法,探讨了LLM、RAG和代理系统在提升检测可靠性与推理能力中的应用。

Comments 20 pages, 10 figures. This is an extension of ICDEW 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22659 2025-12-22 cs.SE cs.AI 89%

A Systematic Literature Review on Detecting Software Vulnerabilities with Large Language Models

基于大语言模型的软件漏洞检测系统文献综述

Sabrina Kaniewski, Fabian Schmidt, Markus Enzweiler, Michael Menth, Tobias Heer

机构 * Esslingen University(埃斯林根大学) Institute for Intelligent Systems, Esslingen University(智能系统研究所,埃斯林根大学) Chair of Communication Networks, University of Tübingen(通信网络教研室,图宾根大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文系统综述了基于大语言模型的软件漏洞检测研究,分析了263项研究,提出了细粒度分类法,识别关键限制,并为未来研究提供了方向。

Comments 43 pages + 20 pages references, 7 tables, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.20900 2025-12-22 cs.CL cs.CY 89%

Large Language Models: A New Approach for Privacy Policy Analysis at Scale

大型语言模型:一种大规模隐私政策分析的新方法

David Rodriguez, Ian Yang, Jose M. Del Alamo, Norman Sadeh

机构 * ETSI Telecomunicación Universidad Politécnica de Madrid Spain(马德里理工大学电信工程学院) School of Computer Science Carnegie Mellon University(计算机科学学院卡内基梅隆大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文提出利用大型语言模型进行大规模隐私政策分析,通过高效提取隐私实践,实现高准确率和低资源消耗。

Journal ref Computing, vol. 106, no. 12, pp. 3879-3903, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14306 2025-12-17 cs.CL econ.EM 89%

Inflation Attitudes of Large Language Models

大语言模型的通胀态度

Nikoleta Anesti, Edward Hill, Andreas Joseph

机构 * Bank of England(英格兰银行)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文研究了大语言模型在宏观经济价格信号下形成通胀观念的能力,发现其在短期预测和家庭通胀观念规律上表现良好,但缺乏对消费者价格通胀的一致模型。

Comments 41 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13703 2025-12-17 cs.CR cs.AI 89%

Safe2Harm: Semantic Isomorphism Attacks for Jailbreaking Large Language Models

Safe2Harm: 语义同构攻击用于大型语言模型的劫持

Fan Yang

机构 * Jinan University(济南大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 Safe2Harm通过语义同构攻击方法,利用合法与有害场景的底层原理一致性,实现高效的大规模语言模型劫持,并提出有害内容评估数据集用于防御。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12488 2025-12-16 cs.CL 89%

The American Ghost in the Machine: How language models align culturally and the effects of cultural prompting

机器中的美国幽灵:语言模型如何实现文化对齐以及文化提示的影响

James Luther, Donald Brown

机构 * School of Data Science University of Virginia(数据科学学院 多伦多大学)

专题命中 评测与基准 :language model(title,abstract);prompting(title,abstract);large language model(abstract);分类 cs.CL

AI总结 本研究通过文化提示测试了多种LLM对不同文化适应性,发现多数模型默认倾向美国,但对日本和中国文化对齐存在困难。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03761 2025-12-16 cs.CL 89%

Pet-Bench: Benchmarking the Abilities of Large Language Models as E-Pets in Social Network Services

Pet-Bench: 评估大型语言模型作为社交网络服务中电子宠物的能力基准

Hongcheng Guo, Zheyong Xie, Shaosheng Cao, Boyang Wang, Weiting Liu, Zheyu Ye, Zhoujun Li, Zuozhu Liu, Wei Lu

机构 * Fudan University(复旦大学) Xiaohongshu Inc.(小红书公司) Beihang University(北航) Zhejiang University(浙江大学) Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 Pet-Bench是一个评估大型语言模型作为电子宠物在社交网络服务中能力的基准测试,通过多样化的任务和7500多个互动实例,评估模型在自我进化和人际互动方面的表现,揭示模型大小和能力对性能的影响,推动情感沉浸式人-宠物互动的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19877 2025-12-12 cs.MM cs.CV cs.LG eess.AS 89%

It Hears, It Sees too: Multi-Modal LLM for Depression Detection By Integrating Visual Understanding into Audio Language Models

它能听,也能看 too:通过将视觉理解整合到音频语言模型中构建多模态大语言模型以检测抑郁症

Xiangyu Zhao, Yaling Shen, Yiwen Jiang, Zimu Wang, Jiahe Liu, Maxmartwell H Cheng, Guilherme C Oliveira, Robert Desimone, Dominic Dwyer, Zongyuan Ge

机构 * Monash University(墨尔本大学) Massachusetts Institute of Technology(麻省理工学院) The University of Melbourne(墨尔本大学)

专题命中 评测与基准 :LLM(title,abstract);language model(title,abstract);large language model(abstract);分类 cs.LG

AI总结 本文提出了一种多模态大语言模型框架,通过整合视觉理解到音频语言模型中,提升抑郁症检测的准确性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09552 2025-12-11 cs.CL 89%

Systematic Framework of Application Methods for Large Language Models in Language Sciences

大型语言模型在语言科学中应用方法的系统框架

Kun Sun, Rong Wang

机构 * Tongji University, China(同济大学) University of Tübingen, Germany(图宾根大学) Institute of Natural Language Processing, University of Stuttgart, Germany(斯图加特大学自然语言处理研究所)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文提出两个系统框架,指导LLMs在语言科学中的战略应用,通过方法选择和多阶段研究流程提升研究的可重复性和科学性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08936 2025-12-11 cs.HC cs.AI cs.CY 89%

A Principle-based Framework for the Development and Evaluation of Large Language Models for Health and Wellness

基于原则的大型语言模型在健康与健身领域开发与评估框架

Brent Winslow, Jacqueline Shreibati, Javier Perez, Hao-Wei Su, Nichole Young-Lin, Nova Hammerquist, Daniel McDuff, Jason Guss, Jenny Vafeiadou, Nick Cain, Alex Lin, Erik Schenck, Shiva Rajagopal, Jia-Ru Chung, Anusha Venkatakrishnan, Amy Armento Lee, Maryam Karimzadehgan, Qingyou Meng, Rythm Agarwal, Aravind Natarajan, Tracy Giest

机构 * Google Research(谷歌研究)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出基于原则的框架,用于系统评估LLM在健康与健身领域的应用,通过迭代开发生命周期整合综合评估技术,提升系统安全性和用户反馈的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25643 2025-12-10 cs.AI 89%

SOCK: A Benchmark for Measuring Self-Replication in Large Language Models

SOCK:一种衡量大语言模型自我复制能力的基准

Justin Chavarria, Rohan Raizada, Justin White, Eyad Alhetairshi

机构 * Albion College(阿尔比恩学院) Hunter College(亨特学院) University of Arizona(亚利桑那大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 SOCK提出了一种评估大语言模型自我复制能力的基准,旨在建立标准并减少多代理系统中的潜在风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18274 2025-12-09 cs.HC cs.AI 89%

Clinician-Directed Large Language Model Software Generation for Therapeutic Interventions in Physical Rehabilitation

面向物理康复治疗的临床指导大型语言模型软件生成

Edward Kim, Yuri Cho, Jose Eduardo E. Lima, Julie Muccini, Jenelle Jindal, Alison Scheid, Erik Nelson, Seong Hyun Park, Yuchen Zeng, Alton Sturgis, Caesar Li, Jackie Dai, Sun Min Kim, Yash Prakash, Liwen Sun, Isabella Hu, Hongxuan Wu, Daniel He, Wiktor Rajca, Cathra Halabi, Maarten Lansberg, Bjoern Hartmann, Sanjit A. Seshia

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出利用大型语言模型生成临床指导的康复软件,通过个性化设计提升康复干预效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04759 2025-12-05 cs.CL 89%

Challenging the Abilities of Large Language Models in Italian: a Community Initiative

挑战大型语言模型在意大利语中的能力:一项社区倡议

Malvina Nissim, Danilo Croce, Viviana Patti, Pierpaolo Basile, Giuseppe Attanasio, Elio Musacchio, Matteo Rinaldi, Federico Borazio, Maria Francis, Jacopo Gili, Daniel Scalena, Begoña Altuna, Ekhi Azurmendi, Valerio Basile, Luisa Bentivogli, Arianna Bisazza, Marianna Bolognesi, Dominique Brunato, Tommaso Caselli, Silvia Casola, Maria Cassese, Mauro Cettolo, Claudia Collacciani, Leonardo De Cosmo, Maria Pia Di Buono, Andrea Esuli, Julen Etxaniz, Chiara Ferrando, Alessia Fidelangeli, Simona Frenda, Achille Fusco, Marco Gaido, Andrea Galassi, Federico Galli, Luca Giordano, Mattia Goffetti, Itziar Gonzalez-Dios, Lorenzo Gregori, Giulia Grundler, Sandro Iannaccone, Chunyang Jiang, Moreno La Quatra, Francesca Lagioia, Soda Marem Lo, Marco Madeddu, Bernardo Magnini, Raffaele Manna, Fabio Mercorio, Paola Merlo, Arianna Muti, Vivi Nastase, Matteo Negri, Dario Onorati, Elena Palmieri, Sara Papi, Lucia Passaro, Giulia Pensa, Andrea Piergentili, Daniele Potertì, Giovanni Puccetti, Federico Ranaldi, Leonardo Ranaldi, Andrea Amelio Ravelli, Martina Rosola, Elena Sofia Ruzzetti, Giuseppe Samo, Andrea Santilli, Piera Santin, Gabriele Sarti, Giovanni Sartor, Beatrice Savoldi, Antonio Serino, Andrea Seveso, Lucia Siciliani, Paolo Torroni, Rossella Varvara, Andrea Zaninello, Asya Zanollo, Fabio Massimo Zanzotto, Kamyar Zeinalipour, Andrea Zugarini

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 CALAMITA是一项针对意大利语的社区驱动基准测试项目,通过多样化任务和统一评估流程,系统评估大型语言模型的能力,为其他语言提供评估范例。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.07004 2025-12-04 cs.CR cs.AI 89%

Casper: Prompt Sanitization for Protecting User Privacy in Web-Based Large Language Models

Casper:用于保护Web基于大语言模型用户隐私的提示净化

Chun Jie Chong, Chenxi Hou, Zhihao Yao, Seyed Mohammadjavad Seyed Talebi

机构 * New Jersey Institute of Technology(新泽西理工学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 Casper通过浏览器扩展在用户设备上运行,利用规则过滤、机器学习和本地LLM技术,有效过滤用户输入中的敏感信息,保护隐私。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.02977 2025-12-04 cs.SE cs.AI 89%

Large Language Model-Based Agents for Software Engineering: A Survey

基于大型语言模型的软件工程代理:一项综述

Junwei Liu, Kaixin Wang, Yixuan Chen, Xin Peng, Zhenpeng Chen, Lingming Zhang, Yiling Lou

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文综述了基于大型语言模型的软件工程代理,分析了其应用、挑战及未来方向。

Comments Accepted by TOSEM

详情

展开后加载摘要…

URL PDF HTML 收藏