arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-23 至 2025-12-23 共收录 280 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 63 篇

2512.19349 2025-12-23 cs.AI cs.LG 86%

VIGOR+: Iterative Confounder Generation and Validation via LLM-CEVAE Feedback Loop

VIGOR+: 通过LLM-CEVAE反馈循环实现迭代混杂因素生成与验证

JiaWei Zhu, ZiHeng Liu

机构 * Guangdong University of Technology(广东工业大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 VIGOR+通过LLM与CEVAE的反馈循环实现迭代混杂因素生成与验证,提升因果推断的统计效用。

Comments 7 pages,1 figure,4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18940 2025-12-23 cs.CL cs.SE 85%

FASTRIC: Prompt Specification Language for Verifiable LLM Interactions

FASTRIC:用于可验证大语言模型交互的提示规范语言

Wen-Long Jin

机构 * Department of Civil and Environmental Engineering(土木与环境工程系) California Institute for Telecommunications and Information Technology(电信与信息科技学院) Institute of Transportation Studies(交通研究学院) University of California, Irvine, CA 92697-3600(加州大学伊维德分校)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 FASTRIC通过显式化有限状态机构建可验证的大语言模型交互协议,揭示模型特定的规范正式程度范围,实现交互设计的系统化工程。

Comments 13 pages, 3 figures. Supplementary materials at https://doi.org/10.17605/OSF.IO/PV6R3

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18755 2025-12-23 cs.AI 85%

MEEA: Mere Exposure Effect-Driven Confrontational Optimization for LLM Jailbreaking

MEEA: 基于mere exposure效应的对抗性优化用于LLM jailbreaking

Jianyi Zhang, Shizhao Liu, Ziyin Zhou, Zhen Li

机构 * Beijing Electronic Science and Technology Institute(北京电子科技研究所)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 MEEA通过基于mere exposure效应的对抗性优化,提升LLM jailbreaking的攻击成功率,揭示LLM安全行为的动态性和历史依赖性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18035 2025-12-23 cs.LG cs.CR 84%

Towards Benchmarking Privacy Vulnerabilities in Selective Forgetting with Large Language Models

面向大语言模型中选择性遗忘隐私漏洞的基准测试

Wei Qian, Chenxu Zhao, Yangyi Li, Mengdi Huai

专题命中 评测与基准 :large language model(title);language model(title);分类 cs.LG

AI总结 本文提出首个评估选择性遗忘隐私漏洞的基准,系统研究了反向学习技术的隐私漏洞,并为定制应用提供标准化工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.01382 2025-12-23 cs.SE cs.AI cs.LG 84%

Automatic Detection of LLM-Generated Code: A Comparative Case Study of Contemporary Models Across Function and Class Granularities

大语言模型生成代码的自动检测:对当代模型在函数和类粒度上的比较案例研究

Musfiqur Rahman, SayedHassan Khatoonabadi, Ahmad Abdellatif, Emad Shihab

机构 * Concordia University(康科迪亚大学) University of Calgary(卡尔加里大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文通过比较四个大语言模型在函数和类粒度上的代码生成能力,发现粒度效应主导模型差异,且不同模型在不同粒度上的检测性能存在显著差异。

Comments Submitted to a journal for potential publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17196 2025-12-23 cs.LG 83%

Shape it Up! Restoring LLM Safety during Finetuning

Shape it Up! 修复微调过程中LLM的安全性

ShengYun Peng, Pin-Yu Chen, Jianfeng Chi, Seongmin Lee, Duen Horng Chau

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 动态安全塑造(DSS)通过细粒度安全信号在微调过程中动态增强安全内容,有效缓解安全风险,提升模型安全性。

Comments NeurIPS'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17920 2025-12-23 cs.CL cs.AI 82%

Separating Constraint Compliance from Semantic Accuracy: A Novel Benchmark for Evaluating Instruction-Following Under Compression

分离约束合规性与语义准确性:一种新的基准,用于在压缩下评估指令遵循

Rahul Baxi

机构 * Independent Researcher(独立研究者)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);RLHF(abstract)

AI总结 本文提出CDCT基准,揭示LLMs在压缩下约束合规性与语义准确性之间的矛盾,发现中等压缩时约束违规主要由RLHF训练的有用性行为导致。

Comments 19 pages, 9 figures; currently under peer review at TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18462 2025-12-23 cs.CL cs.AI cs.LG 82%

Mitigating Spurious Correlations in NLI via LLM-Synthesized Counterfactuals and Dynamic Balanced Sampling

通过LLM合成的反事实和动态平衡采样缓解NLI中的虚假相关性

Christopher Román Jaimes

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种自动化流程,通过LLM合成反事实和动态平衡采样缓解NLI中的虚假相关性,提升了模型性能和领域内准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18745 2025-12-23 cs.CV cs.CL cs.LG 81%

InSight-o3: Empowering Multimodal Foundation Models with Generalized Visual Search

InSight-o3: 通过通用视觉搜索增强多模态基础模型

Kaican Li, Lewei Yao, Jiannan Wu, Tiezheng Yu, Jierun Chen, Haoli Bai, Lu Hou, Lanqing Hong, Wei Zhang, Nevin L. Zhang

机构 * Hong Kong University of Science and Technology(香港科技大学) Huawei(华为)

专题命中 评测与基准 :foundation model(title);LLM(abstract);分类 cs.CL、cs.LG

AI总结 InSight-o3通过通用视觉搜索任务提升多模态基础模型的推理能力,解决复杂视觉信息整合问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19122 2025-12-23 cs.SE cs.CL 79%

BanglaForge: LLM Collaboration with Self-Refinement for Bangla Code Generation

BanglaForge: 通过自反思的LLM协作实现孟加拉语代码生成

Mahir Labib Dihan, Sadif Ahmed, Md Nafiu Rahman

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Bangladesh University of Engineering and Technology(孟加拉工程与技术大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL

AI总结 BanglaForge通过双模型协作与自反思技术,实现低资源孟加拉语代码生成,达到84.00%的Pass@1准确率。

Comments Accepted at BLP Workshop @ IJCNLP-AACL 2025. Code is available at https://github.com/mahirlabibdihan/BanglaForge

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02366 2025-12-23 cs.CL 79%

LiveSecBench: A Dynamic and Event-Driven Safety Benchmark for Chinese Language Model Applications

LiveSecBench: 一种动态且事件驱动的安全基准,用于中文语言模型应用

Yudong Li, Peiru Yang, Feng Huang, Zhongliang Yang, Kecheng Wang, Haitian Li, Baocheng Chen, Xingyu An, Ziyu Liu, Youdan Yang, Kejiang Chen, Sifang Wan, Xu Wang, Yufei Sun, Liyan Wu, Ruiqi Zhou, Wenya Wen, Xingchi Gu, Tianxin Zhang, Yue Gao, Yongfeng Huang

机构 * Tsinghua University(清华大学) Beijing University of Posts and Telecommunications(北京邮电大学) University of Science and Technology of China(中国科学技术大学) IntokenTech

专题命中 评测与基准 :language model(title);LLM(abstract);分类 cs.CL

AI总结 LiveSecBench通过动态更新和多维度评估,为中文大模型的安全性提供持续改进的标准和排行榜。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19210 2025-12-23 cs.AI 78%

Observer, Not Player: Simulating Theory of Mind in LLMs through Game Observation

观察者,而非玩家:通过游戏观察模拟大语言模型中的理论心理论

Jerry Wang, Ting Yiu Liu

机构 * Department of Management Information Systems, National ChengChi University(管理信息系,国立中正大学)

专题命中 评测与基准 :language model(abstract,comments);LLM(abstract);large language model(abstract);分类 cs.AI

AI总结 通过游戏观察模拟大语言模型中的理论心理论,评估其在顺序行为中的推理能力。

Comments Accepted at NeurIPS Workshop on Foundations of Reasoning in Language Models and Workshop on Bridging Language, Agent, and World Model

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18256 2025-12-23 cs.AI cs.LO 77%

MSC-180: A Benchmark for Automated Formal Theorem Proving from Mathematical Subject Classification

MSC-180:一个用于从数学学科分类自动形式定理证明的基准

Sirui Li, Wangyue Lu, Xiaorui Shi, Ke Weng, Haozhe Sun, Minghe Yu, Tiancheng Zhang, Ge Yu, Hengyu Liu, Lun Du

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 MSC-180是一个用于评估自动形式定理证明的基准,揭示了当前基于LLM的定理证明者在数学领域覆盖和泛化能力上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18131 2025-12-23 cs.SE cs.AI 77%

Holistic Evaluation of State-of-the-Art LLMs for Code Generation

全方位评估最新大型语言模型在代码生成中的表现

Le Zhang, Suresh Kothari

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究评估了六个最新大型语言模型在代码生成中的表现,发现DeepSeek-R1和GPT-4.1在正确性、效率和鲁棒性方面表现最佳,强调了提示工程和人类监督的重要性。

Comments 13 pages, 9 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12422 2025-12-23 cs.CL 77%

FactEHR: A Dataset for Evaluating Factuality in Clinical Notes Using LLMs

FactEHR: 一个用于使用LLMs评估临床笔记事实性的数据集

Monica Munnangi, Akshay Swaminathan, Jason Alan Fries, Jenelle Jindal, Sanjana Narayanan, Ivan Lopez, Lucia Tu, Philip Chung, Jesutofunmi A. Omiye, Mehr Kashyap, Nigam Shah

机构 * Khoury College of Computer Sciences, Northeastern University(东北大学克劳尔计算机科学学院) Center for Biomedical Informatics Research, Stanford University(斯坦福大学生物医学信息学研究中心) Department of Biomedical Data Science, Stanford School of Medicine(斯坦福医学院生物医学数据科学系) Stanford Health Care(斯坦福健康系统) Department of Medicine, Stanford School of Medicine(斯坦福医学院医学系) Clinical Excellence Research Center, Stanford School of Medicine(斯坦福医学院临床卓越研究中心) Department of Anesthesiology, Perioperative & Pain Medicine, Stanford School of Medicine(斯坦福医学院麻醉学、手术及疼痛医学系) Department of Dermatology, Stanford School of Medicine(斯坦福医学院皮肤病学系) Technology and Digital Solutions, Stanford Health Care(斯坦福健康系统技术与数字解决方案)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 FactEHR是一个用于评估LLMs在临床笔记中事实分解能力的数据集,通过生成987,266个蕴含对揭示LLM在细粒度事实验证中的性能差异。

Comments To appear at MLHC 2025

Journal ref Journal-ref: Proceedings of Machine Learning Research (PMLR), vol. 298, Proceedings of the Machine Learning for Healthcare Conference (MLHC), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19675 2025-12-23 econ.GN cs.CV cs.DL q-fin.EC 75%

Multimodal LLMs for Historical Dataset Construction from Archival Image Scans: German Patents (1877-1918)

多模态大语言模型用于从档案图像扫描中构建历史数据集:德国专利(1877-1918)

Niclas Griesshaber, Jochen Streb

机构 * University of Mannheim(曼海姆大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出利用多模态大语言模型构建德国1877-1918年专利数据集,证明其在效率和质量上的优势,并开源相关工具和数据以促进经济史研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18653 2025-12-23 cond-mat.mtrl-sci 75%

Tackling dataset curation challenges towards reliable machine learning: a case study on thermoelectric materials

应对数据集整理挑战以实现可靠的机器学习:热电材料的案例研究

Shoeb Athar, Adrien Mecibah, Philippe Jund

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出了一种基于统计轮换误差的数据过滤方法,用于解决热电材料数据集中的不准确性和不一致性问题,并通过混合数据集创建流程提升数据质量。

Comments 10 pages, 9 figures

Journal ref Mater. Today Phys. 59, 101948 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19171 2025-12-23 cs.CR 75%

Can LLMs Threaten Human Survival? Benchmarking Potential Existential Threats from LLMs via Prefix Completion

大语言模型是否威胁人类生存?通过前缀完成评估大语言模型潜在的灭绝性威胁

Yu Cui, Yifei Liu, Hang Fu, Sicheng Pan, Haibin Zhang, Cong Zuo, Licheng Wang

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出 ExistBench 基准,通过前缀完成评估 LLMs 的潜在灭绝性威胁,发现 LLMs 生成内容包含危害人类生存的输出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18165 2025-12-23 q-bio.NC 75%

Coord2Region: A Python Package for Mapping 3D Brain Coordinates to Atlas Labels, Literature, and AI Summaries

Coord2Region: 一个用于将3D大脑坐标映射到图谱标签、文献和AI摘要的Python包

Hamza Abdelhedi, Yorguin-Jose Mantilla-Ramos, Sina Esmaeili, Annalisa Pascarella, Vanessa Hadid, Karim Jerbi

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 Coord2Region是一个Python工具,通过自动映射3D大脑坐标到多个图谱标签、文献和AI摘要,提升神经影像学研究的效率和可重复性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19620 2025-12-23 cs.CL cs.AI 73%

Exploring the features used for summary evaluation by Human and GPT

探索人类和GPT用于摘要评估所用的特征

Zahra Sadeghi, Evangelos Milios, Frank Rudzicz

机构 * Faculty of Computer Science, Dalhousie University, Canada(达尔豪斯大学计算机科学学院) Vector Institute for Artificial Intelligence, Canada(人工智能向量研究所)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了人类和GPT在摘要评估中使用的特征,并通过统计和机器学习指标发现与人类响应相匹配的特征,同时展示了通过使用人类指标改进GPT判断能力的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19530 2025-12-23 cs.LG cs.AI 73%

Learning Continuous Solvent Effects from Transient Flow Data: A Graph Neural Network Benchmark on Catechol Rearrangement

从瞬态流动数据中学习连续溶剂效应:一个关于儿茶酚重排的图神经网络基准测试

Hongsheng Xing, Qiuxin Si

机构 * Hongsheng Xing(洪世盛) Qiuxin Si(司琪轩)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种混合图神经网络架构,通过整合图注意力网络与微分反应指纹,实现了在连续溶剂组成范围内高精度的反应预测。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10216 2025-12-23 cs.CL cs.AI 73%

From Words to Proverbs: Evaluating LLMs Linguistic and Cultural Competence in Saudi Dialects with Absher

从词语到谚语:利用Absher评估大语言模型在沙特方言中的语言和文化能力

Renad Al-Monef, Hassan Alhuzali, Nora Alturayeif, Ashwag Alasmari

机构 * Department of Computer Science, King Khalid University(国王 Khalid 大学计算机科学系) Department of Computer Science and Artificial Intelligence, Umm Al-Qura University(乌姆·阿勒·库拉大学计算机科学与人工智能系) Imam Abdulrahman Bin Faisal University(伊玛目阿卜杜勒拉赫曼·本·法伊萨尔大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Absher基准,用于评估LLMs在沙特方言中的语言和文化能力,揭示了模型在文化推断和语境理解上的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16923 2025-12-23 cs.CL cs.AI 73%

A Systematic Survey of Automatic Prompt Optimization Techniques

大规模语言模型自动提示优化技术系统调查

Kiran Ramnath, Kang Zhou, Sheng Guan, Soumya Smruti Mishra, Xuan Qi, Zhengyuan Shen, Shuai Wang, Sangmin Woo, Sullam Jeoung, Yawei Wang, Haozhu Wang, Han Ding, Yuzhe Lu, Zhichao Xu, Yun Zhou, Balasubramaniam Srinivasan, Qiaojing Yan, Yueyan Chen, Haibo Ding, Panpan Xu, Lin Lee Cheong

机构 * Amazon Web Services(亚马逊网络服务)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文系统调查了自动提示优化技术,提出了统一框架并分类相关工作,旨在推动该领域进一步研究。

Comments 8 main pages, 31 total pages, 1 figure

Journal ref In Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing (EMNLP), pages 33066-33098, Suzhou, China, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19481 2025-12-23 cs.SE cs.AI 70%

A Dataset and Preliminary Study of Using GPT-5 for Code-change Impact Analysis

一个用于代码变更影响分析的的数据集及初步研究

Katharina Stengg, Christian Macho, Martin Pinzger

机构 * Software Engineering Research Group University of Klagenfurt(软件工程研究组 卡拉克福大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究了GPT-5和GPT-5-mini在代码变更影响分析中的性能,构建了包含种子变更、变更对和变更类型的数据库,并发现GPT-5在预测受影响代码实体方面优于GPT-5-mini。

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18661 2025-12-23 cs.AI 70%

ASTIF: Adaptive Semantic-Temporal Integration for Cryptocurrency Price Forecasting

ASTIF:自适应语义-时间整合用于加密货币价格预测

Hafiz Saif Ur Rehman, Ling Liu, Kaleem Ullah Qasim

机构 * Southwestern University of Finance and Economics(西南财经大学) Southwest Jiaotong University(西南交通大学)

专题命中 评测与基准 :language model(abstract);small language model(abstract);分类 cs.AI

AI总结 ASTIF通过自适应元学习整合语义和时间信息,提升加密货币价格预测的准确性和鲁棒性。

Comments 33 Pages, 8 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17559 2025-12-23 cs.CL cs.DB 70%

SCARE: A Benchmark for SQL Correction and Question Answerability Classification for Reliable EHR Question Answering

SCARE:一个用于SQL校正和问题可回答性分类的基准,以实现可靠的EHR问答系统

Gyubok Lee, Woosog Chay, Edward Choi

机构 * Korea Advanced Institute of Science & Technology(韩国科学技术院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 SCARE是一个用于评估SQL校正和问题可回答性分类的基准,旨在提升EHR问答系统的安全性与可靠性。

Comments ML4H 2025 Proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.16007 2025-12-23 cs.CL 70%

Label Words as Local Task Vectors in In-Context Learning

标签词作为上下文学习中的局部任务向量

Bowen Zheng, Ming Ma, Zhongqiao Lin, Tianming Yang

机构 * Institute of Neuroscience, Key Laboratory of Brain Cognition and Brain-inspired Intelligence Technology, Center for Excellence in Brain Science and Intelligence Technology, Chinese Academy of Sciences, Shanghai, China(中国科学院神经科学研究所、脑认知与脑启发智能技术重点实验室、脑科学与智能技术卓越中心、中国科学院、上海,中国)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文研究了上下文学习中局部任务向量的作用,发现其在某些任务中能形成全局任务向量,从而提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18567 2025-12-23 cs.SE cs.AI 70%

AI Code in the Wild: Measuring Security Risks and Ecosystem Shifts of AI-Generated Code in Modern Software

AI 代码在现实世界中的应用:衡量 AI 生成代码在现代软件中的安全风险和生态系统变化

Bin Wang, Wenjie Yu, Yilu Zhong, Hao Yu, Keke Lian, Chaohua Lu, Hongfang Zheng, Dong Zhang, Hui Li

机构 * Peking University(北京大学) Tencent(腾讯)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究了AI生成代码在现实世界中的安全风险和生态系统变化,通过大规模实证分析揭示了AI代码在软件开发中的分布、安全影响及人类与AI协作中的安全机制。

Comments https://mp.weixin.qq.com/s/sI_LKPnA-BeCVYr9Ko4sqg https://github.com/Narwhal-Lab/aicode-in-the-wild-security-risk-report

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13524 2025-12-23 cs.AI cs.HC 70%

FreeAskWorld: An Interactive and Closed-Loop Simulator for Human-Centric Embodied AI

FreeAskWorld: 一种面向人类的交互式闭环模拟器用于具身人工智能

Yuhang Peng, Yizhou Pan, Xinning He, Jihaoyu Yang, Xinyu Yin, Han Wang, Xiaoji Zheng, Chao Gao, Jiangtao Gong

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 FreeAskWorld通过整合大语言模型和交互式闭环模拟,提升具身人工智能在复杂社会行为和自然交互中的表现。

Comments 9 pages, 4 figures

Journal ref AAAI 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11361 2025-12-23 cs.CL 70%

VLDBench Evaluating Multimodal Disinformation with Regulatory Alignment

VLDBench:评估具有监管对齐的多模态虚假信息

Shaina Raza, Ashmal Vayani, Aditya Jain, Aravind Narayanan, Vahid Reza Khazaie, Syed Raza Bashir, Elham Dolatabadi, Gias Uddin, Christos Emmanouilidis, Rizwan Qureshi, Mubarak Shah

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 VLDBench 是首个多模态虚假信息检测基准,通过大规模标注数据提升检测准确率,支持 AI 管治框架下的可信虚假信息分析。

Comments Accepted in Information Fusion Journal

详情

展开后加载摘要…

URL PDF HTML 收藏