arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-11-25 至 2025-11-25 共收录 375 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 104 篇

2511.18782 2025-11-25 cs.SE 75%

Summary-Mediated Repair: Can LLMs use code summarisation as a tool for program repair?

基于摘要的修复:大语言模型能否将代码摘要作为程序修复工具?

Lukas Twist

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本研究提出基于摘要的程序修复方法,利用代码摘要作为中间步骤,通过提升修复效果来改进大语言模型在程序修复中的表现。

Comments 6 pages, 3 tables, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18114 2025-11-25 cs.CR 75%

ASTRA: Agentic Steerability and Risk Assessment Framework

ASTRA:代理可引导性与风险评估框架

Itay Hazan, Yael Mathov, Guy Shtar, Ron Bitton, Itsik Mantin

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 ASTRA框架通过模拟多种AI代理并测试其对新型攻击的防御能力,评估LLM在构建安全代理中的有效性,推动更安全的AI系统发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12004 2025-11-25 cs.IR 75%

ComLQ: Benchmarking Complex Logical Queries in Information Retrieval

ComLQ:信息检索中复杂逻辑查询的基准测试

Ganlin Xu, Zhitao Yin, Linghao Zhang, Jiaqing Liang, Weijia Lu, Xiaodong Zhang, Zhifei Yang, Sihang Jiang, Deqing Yang

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 ComLQ通过构建包含2909个查询和11251个候选段落的信息检索数据集,提出Log-Scaled Negation Consistency指标,评估检索模型在复杂逻辑查询,特别是含否定查询上的性能。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20495 2025-11-25 cs.CL cs.AI cs.IR cs.LG cs.SE 75%

ReCode: Updating Code API Knowledge with Reinforcement Learning

ReCode: 通过强化学习更新代码API知识

Haoze Wu, Yunzhi Yao, Wenhao Yu, Ningyu Zhang

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ReCode通过强化学习方法提升LLMs在动态API环境下的代码生成能力,尤其在CodeUpdateArena任务中表现优异。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.01971 2025-11-25 cs.SE 75%

ContrastRepair: Enhancing Conversation-Based Automated Program Repair via Contrastive Test Case Pairs

ContrastRepair: 通过对比测试用例对增强基于对话的自动程序修复

Jiaolong Kong, Mingfei Cheng, Xiaofei Xie, Shangqing Liu, Xiaoning Du, Qi Guo

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 ContrastRepair通过对比测试对提升基于对话的自动程序修复效果,显著优于现有方法。

Journal ref ACM Trans. Softw. Eng. Methodol., 34(8), Article 216, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18931 2025-11-25 cs.CL cs.AI 73%

Look It Up: Analysing Internal Web Search Capabilities of Modern LLMs

查找它:分析现代大语言模型的内部网络搜索能力

Sahil Kale

机构 * Atlanta GA USA(美国亚特兰大)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究评估了现代大语言模型的内部网络搜索能力,发现其在事实准确性上有提升,但置信度校准不足,需进一步优化。

Comments 10 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18622 2025-11-25 cs.CL cs.AI 73%

OpenGloss: A Synthetic Encyclopedic Dictionary and Semantic Knowledge Graph

OpenGloss:一个合成百科词典和语义知识图谱

Michael J. Bommarito

专题命中 评测与基准 :LLM(abstract);foundation model(abstract);分类 cs.CL、cs.AI

AI总结 OpenGloss通过结构化生成方法高效创建了包含丰富语义信息的百科词典和知识图谱,为词汇学习和NLP任务提供全面支持。

Comments 30 pages, 5 figures, 8 tables. Dataset available at https://huggingface.co/datasets/mjbommar/opengloss-dictionary

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13590 2025-11-25 cs.CL cs.AI 73%

Beyond SELECT: A Comprehensive Taxonomy-Guided Benchmark for Real-World Text-to-SQL Translation

超越SELECT:一个全面的基于分类的基准用于现实世界文本到SQL翻译

Hao Wang, Yuanfeng Song, Xiaoming Yin, Xing Chen

机构 * ByteDance, China(字节跳动)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种基于分类的文本到SQL数据集生成方法,通过引入新的分类体系和数据合成管道,生成了更具多样性和覆盖性的SQL-Synth数据集,同时揭示了现有LLMs在复杂场景下的性能局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10016 2025-11-25 cs.MM cs.AI cs.CL 73%

A Survey of Generative Categories and Techniques in Multimodal Generative Models

多模态生成模型中生成类别的综述

Longzhen Han, Awes Mubarak, Almas Baimagambetov, Nikolaos Polatidis, Thar Baker

机构 * School of Architecture, Technology and Engineering, University of Brighton, Lewes Road, BN2 4GJ(建筑、科技与工程学院,布里顿大学,勒斯路,BN2 4GJ) University of Khorfakkan, Sharjah(柯法克坎大学,沙迦)

专题命中 评测与基准 :RLHF(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文综述多模态生成模型中生成类别的发展,分析了跨模态能力的基础技术,并探讨了评估框架与治理机制以提升系统通用性和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13912 2025-11-25 cs.CL cs.AI 73%

AI Debaters are More Persuasive when Arguing in Alignment with Their Own Beliefs

AI辩论在与自身信念一致时更具说服力

María Victoria Carro, Denise Alejandra Mester, Facundo Nieto, Oscar Agustín Stanchi, Guido Ernesto Bergman, Mario Alejandro Leiva, Eitan Sprejer, Luca Nicolás Forziati Gangi, Francisca Gauna Selasco, Juan Gustavo Corvalán, Gerardo I. Simari, María Vanina Martinez

机构 * FAIR, IALAB, Universidad de Buenos Aires(FAIR、IALAB、布宜诺斯艾利斯大学) Universidad de Buenos Aires(布宜诺斯艾利斯大学) Universidad Nacional de Córdoba(科尔多瓦国立大学) BAISH, Universidad de Buenos Aires(BAISH、布宜诺斯艾利斯大学) Instituto de Investigación en Informática LIDI, Universidad Nacional de La Plata(信息研究所LIDI、拉普拉塔国立大学;CONICET) CONICET(计算机科学与工程系,南大学及ICIC UNS-CONICET) Dept. of Comp. Sci. and Eng., Universidad Nacional del Sur & ICIC UNS-CONICET(人工智能研究所(IIIA-CSIC),西班牙) Artificial Intelligence Research Institute (IIIA-CSIC), ES

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究探讨了AI辩论中模型在与自身信念一致或不一致时的说服力差异,发现模型倾向于迎合裁判观点,但不一致的论点在比较中更受好评。

Comments 31 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07793 2025-11-25 cs.CL cs.AI 73%

LLM4Cell: A Survey of Large Language and Agentic Models for Single-Cell Biology

LLM4Cell: 一种用于单细胞生物学的大语言和代理模型综述

Sajib Acharjee Dip, Adrika Zafor, Bikash Kumar Paul, Uddip Acharjee Shuvo, Muhit Islam Emon, Xuan Wang, Liqing Zhang

机构 * Department of Computer Science, Virginia Tech, Blacksburg, VA, USA(弗吉尼亚理工大学计算机科学系) Department of Computational Modeling and Data Analytics, Virginia Tech, Blacksburg, VA, USA(弗吉尼亚理工大学计算建模与数据分析系) Institute of Information and Technology, University of Dhaka, Dhaka, Bangladesh(达卡大学信息技术学院) Fralin Biomedical Research Institute at VTC: Cancer Research Center, Washington DC, USA(弗拉林生物医学研究中心:癌症研究中心)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 LLM4Cell综述了58个用于单细胞生物学的大语言和代理模型,分析了其在注释、轨迹建模和药物反应预测等任务中的表现,并指出了可解释性、标准化和可信模型开发的挑战。

Comments 34 pages, 5 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15018 2025-11-25 cs.CL 72%

Using tournaments to calculate AUROC for zero-shot classification with LLMs

利用竞赛计算零样本分类中LLM的AUROC

WonJin Yoon, Ian Bulovic, Timothy A. Miller

机构 * Boston Children’s Hospital(波士顿儿童医院) Harvard Medical School(哈佛医学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL;LLM(comments)

AI总结 本文提出利用LLM进行零样本分类的AUROC计算,通过成对比较和Elo评分系统提升分类性能并提供更多信息。

Comments The 2025 Conference on Empirical Methods in Natural Language Processing (EMNLP 2025, Findings). The code is available at: https://github.com/Machine-Learning-for-Medical-Language/cnlp_llm

Journal ref In Findings of the Association for Computational Linguistics: EMNLP 2025, pages 23583-23591, Suzhou, China. Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19306 2025-11-25 cs.CV 71%

Dual-Granularity Semantic Prompting for Language Guidance Infrared Small Target Detection

双粒度语义提示用于语言引导的红外小目标检测

Zixuan Wang, Haoran Sun, Jiaming Lu, Wenxuan Wang, Zhongling Huang, Dingwen Zhang, Xuelin Qian, Junwei Han

机构 * School of Automation, Northwestern Polytechnical University(自动化学院,西北工业大学)

专题命中 评测与基准 :prompting(title)

AI总结 本文提出DGSPNet,通过双粒度语义提示和文本引导注意力机制,提升红外小目标检测的准确率和性能。

Comments 10 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18926 2025-11-25 cs.AI cs.HC 70%

MoodBench 1.0: An Evaluation Benchmark for Emotional Companionship Dialogue Systems

MoodBench 1.0: 一种用于情感陪伴对话系统的评估基准

Haifeng Jing, Yujie Hou, Junfei Liu, Rui Xie, alan Xu, Jinlong Ma, Qichun Deng

机构 * School of Software Microelectronics,Peking University QingDao Institute of Software, Colledge of Computer Science Technology,China University of Petroleum (East China) BeiJing BeiJing China QingDao Institute of Software, Colledge of Computer Science Technology,China University of Petroleum (East China) QingDao ShanDong China Microelectronics,Peking University BeiJing BeiJing China R\&D Center,Quwan Guangzhou Guangdong China Technology,China University of Petroleum (East China) Microelectronics,Peking University R\&D Center,Quwan

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 MoodBench 1.0 是首个用于评估情感陪伴对话系统能力的基准,通过评估30种主流模型,揭示了当前模型在深层次情感陪伴方面的不足,指导未来技术优化。

Comments 26 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18486 2025-11-25 cs.CL 70%

Evaluation of OpenAI o1: Opportunities and Challenges of AGI

OpenAI o1的评估:通用人工智能的机会与挑战

Tianyang Zhong, Zhengliang Liu, Yi Pan, Yutong Zhang, Zeyu Zhang, Yifan Zhou, Shizhe Liang, Zihao Wu, Yanjun Lyu, Peng Shu, Xiaowei Yu, Chao Cao, Hanqi Jiang, Hanxu Chen, Yiwei Li, Junhao Chen, Huawen Hu, Yiheng Liu, Huaqin Zhao, Shaochen Xu, Haixing Dai, Lin Zhao, Ruidong Zhang, Wei Zhao, Zhenyuan Yang, Jingyuan Chen, Peilong Wang, Wei Ruan, Hui Wang, Huan Zhao, Jing Zhang, Yiming Ren, Shihuan Qin, Tong Chen, Jiaxi Li, Arif Hassan Zidan, Afrar Jahin, Minheng Chen, Sichen Xia, Jason Holmes, Yan Zhuang, Jiaqi Wang, Bochen Xu, Weiran Xia, Jichao Yu, Kaibo Tang, Yaxuan Yang, Bolun Sun, Tao Yang, Guoyu Lu, Xianqiao Wang, Lilong Chai, He Li, Jin Lu, Xin Zhang, Bao Ge, Xintao Hu, Lian Zhang, Hua Zhou, Lu Zhang, Shu Zhang, Zhen Xiang, Yudan Ren, Jun Liu, Xi Jiang, Yu Bao, Wei Zhang, Xiang Li, Gang Li, Wei Liu, Dinggang Shen, Andrea Sikora, Xiaoming Zhai, Dajiang Zhu, Tuo Zhang, Tianming Liu

机构 * Department of Mathematical and Statistical Sciences, University of Alberta, Edmonton, Canada(阿尔伯塔大学数学与统计学系) School of Computing, University of Georgia, GA, USA(佐治亚大学计算机科学学院) Institute of Medical Research, Northwestern Polytechnical University, Xi’an, China(西北工业大学医学研究所) Department of Computer Science and Engineering, University of Texas at Arlington, TX, USA(德克萨斯大学阿灵顿分校计算机科学与工程系) College of Arts and Sciences, University of Georgia, Athens, USA(佐治亚大学文理学院) Institute of Plant Breeding, Genetics & Genomics, University of Georgia, Athens, GA, USA(佐治亚大学植物育种、遗传与基因组研究所) School of Computer Science, Northwestern Polytechnical University, Xi’an, China(西北工业大学计算机科学学院) School of Automation, Northwestern Polytechnical University, Xi’an, China(西北工业大学自动化学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 OpenAI o1在多领域复杂推理任务中表现出色,展现出接近或超越人类水平的能力,为通用人工智能的发展提供了重要进展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18434 2025-11-25 cs.CV cs.AI 70%

DocPTBench: Benchmarking End-to-End Photographed Document Parsing and Translation

DocPTBench: 用于照片文档解析与翻译的基准测试

Yongkun Du, Pinxuan Chen, Xuye Ying, Zhineng Chen

机构 * College of Computer Science and Artificial Intelligence(计算机科学与人工智能学院) Institute of Trustworthy Embodied AI(可信具身人工智能研究所)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 DocPTBench是一个针对真实拍摄文档解析与翻译的基准测试,揭示了从数字生成文档到真实拍摄文档的性能下降问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17990 2025-11-25 cs.AI cs.GT 70%

How Far Can LLMs Emulate Human Behavior?: A Strategic Analysis via the Buy-and-Sell Negotiation Game

LLMs 能够模拟人类行为多远?:通过买与卖谈判游戏进行的战略分析

Mingyu Jeon, Jaeyoung Suh, Suwan Cho, Dohyeon Kim

机构 * MODULABS

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过买与卖谈判游戏评估LLMs模拟人类行为的能力,发现竞争性特质在谈判中更具优势,提出新的评估方法以衡量真实社交互动能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17689 2025-11-25 cs.DL cs.AI 70%

ARISE: Agentic Rubric-Guided Iterative Survey Engine for Automated Scholarly Paper Generation

ARISE: 基于代理的评分引导迭代调查引擎用于自动化学术论文生成

Zi Wang, Xingqiao Wang, Sangah Lee, Xiaowei Xu

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 ARISE是一种基于代理的评分引导迭代调查引擎,通过模块化架构和评分引导的迭代改进循环,实现高质量学术论文的自动化生成与持续改进。

Comments 20 pages including an appendix, 7 figures and 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15165 2025-11-25 cs.CR cs.AI 70%

Can MLLMs Detect Phishing? A Comprehensive Security Benchmark Suite Focusing on Dynamic Threats and Multimodal Evaluation in Academic Environments

MLLMs能否检测钓鱼?一个全面的安全基准套件,聚焦于动态威胁和学术环境中的多模态评估

Jingzhuo Zhou

机构 * School of Computer Science and Engineering(计算机科学与工程学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出AdapT-Bench,一个针对学术环境动态钓鱼攻击的多模态安全基准套件,旨在评估MLLM的防御能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11025 2025-11-25 cs.CV cs.AI 70%

AirCopBench: A Benchmark for Multi-drone Collaborative Embodied Perception and Reasoning

AirCopBench: 多无人机协作具身感知与推理的基准测试

Jirong Zha, Yuxuan Fan, Tianyu Zhang, Geng Chen, Yingfeng Chen, Chen Gao, Xinlei Chen

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 AirCopBench是一个针对多无人机协作具身感知与推理的首个全面基准测试,通过模拟与现实数据生成14600+问题,评估MLLMs在复杂协作场景中的性能差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07852 2025-11-25 cs.AI 70%

FinMR: A Knowledge-Intensive Multimodal Benchmark for Advanced Financial Reasoning

FinMR:面向高级金融推理的知识密集型多模态基准

Shuangyan Deng, Haizhou Peng, Jiachen Xu, Rui Mao, Ciprian Doru Giurcăneanu, Jiamou Liu

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 FinMR是一个面向高级金融推理的知识密集型多模态基准,通过精心设计的问题-答案对和多样化的金融主题,评估专业分析师级别的金融推理能力。

Comments The methodology section contains inaccuracies that may lead to misleading interpretations. The authors have withdrawn this version for correction

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17991 2025-11-25 cs.CV cs.CL 70%

VideoLLM Knows When to Speak: Enhancing Time-Sensitive Video Comprehension with Video-Text Duet Interaction Format

VideoLLM 知何时言:通过视频-文本双人对话交互格式增强时间敏感视频理解

Yueqian Wang, Xiaojun Meng, Yuxuan Wang, Jianxin Liang, Jiansheng Wei, Huishuai Zhang, Dongyan Zhao

机构 * Wangxuan Institute of Computer Technology, Peking University(王炫计算机技术研究所,北京大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Beijing Institute for General Artificial Intelligence(北京通用人工智能研究院) State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出视频-文本双人对话交互格式,通过MMDuetIT数据集和MAGQA任务提升VideoLLM在时间敏感任务中的表现,实现高效实时响应。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19130 2025-11-25 cs.SE 67%

Can LLMs Recover Program Semantics? A Systematic Evaluation with Symbolic Execution

LLMs能否恢复程序语义?基于符号执行的系统评估

Rong Feng, Suman Saha

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文研究LLMs通过符号执行制品微调能否有效去混淆程序,发现GPT-4.1-mini在去混淆效果上最佳,结合KLEE制品能提升语义保留和编译成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18608 2025-11-25 cs.SE cs.CR 67%

From Reviewers' Lens: Understanding Bug Bounty Report Invalid Reasons with LLMs

从评审视角:利用大语言模型理解漏洞赏金报告无效原因

Jiangrui Zheng, Yingming Zhou, Ali Abdullah Ahmad, Hanqing Yao, Xueqing Liu

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 利用大语言模型和结构化评审知识,研究如何识别和解释漏洞赏金报告的无效原因,以提高报告质量和评审一致性。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09938 2025-11-25 cs.HC 67%

Design and Evaluation of Generative Agent-based Platform for Human-Assistant Interaction Research: A Tale of 10 User Studies

生成性代理平台的设计与评估:人类-助手交互研究的叙述:10项用户研究

Ziyi Xuan, Yiwen Wu, Xuhai Xu, Vinod Namboodiri, Mooi Choo Chuah, Yu Yang

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出了一种生成性代理模拟平台,用于研究人类-助手交互,通过模拟十项现有研究验证了其有效性,为高效研究助手代理设计提供了新方法。

Journal ref Proc. ACM Interact. Mob. Wearable Ubiquitous Technol. 9, 4, Article 229 (December 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18448 2025-11-25 cs.CV 67%

EventBench: Towards Comprehensive Benchmarking of Event-based MLLMs

EventBench: 向事件驱动的大语言模型全面评估迈进

Shaoyu Liu, Jianing Li, Guanghui Zhao, Yunjian Zhang, Xiangyang Ji

机构 * Xidian University(西安电子科技大学) Tsinghua University(清华大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 EventBench通过八个任务指标和大规模数据集全面评估事件驱动MLLMs的能力,揭示其在细粒度识别和空间推理方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18399 2025-11-25 cs.CV 67%

ChineseVideoBench: Benchmarking Multi-modal Large Models for Chinese Video Question Answering

ChineseVideoBench: 多模态大模型在中文视频问答中的基准测试

Yuxiang Nie, Han Wang, Yongjie Ye, Haiyang Yu, Weitao Jia, Tao Zeng, Hao Feng, Xiang Fei, Yang Li, Xiaohui Lv, Guozhi Tang, Jingqun Tang, Jinghui Lu, Zehui Dai, Jiacong Wang, Dingkang Yang, An-Lan Wang, Can Huang

机构 * Bytedance Inc.(字节跳动公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 ChineseVideoBench通过提供中文视频问答的基准测试,评估多模态大语言模型的性能,揭示了当前模型在复杂中文视频内容上的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18104 2025-11-25 cs.CV 67%

Consolidating Diffusion-Generated Video Detection with Unified Multimodal Forgery Learning

通过统一多模态伪造学习巩固扩散生成视频检测

Xiaohong Liu, Xiufeng Song, Huayu Zheng, Lei Bai, Xiaoming Liu, Guangtao Zhai

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) School of Information Science and Electronic Engineering, Shanghai Jiao Tong University(上海交通大学信息科学与电子工程学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Department of Computer Science and Engineering, Michigan State University(密歇根州立大学计算机科学与工程系)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出MM-Det++算法,通过统一多模态学习检测扩散生成视频,结合时空分支和多模态分支,提升视频伪造检测的准确性和泛化能力。

Comments Code and dataset are available at https://github.com/SparkleXFantasy/MM-Det-Plus

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.15049 2025-11-25 cs.SE 67%

IntelliRadar: A Comprehensive Platform to Pinpoint Malicious Package Information from Cyber Intelligence

IntelliRadar:一个全面的平台,用于从网络情报中精准定位恶意包信息

Wenbo Guo, Chengwei Liu, Limin Wang, Yiran Zhang, Jiahui Wu, Zhengzi Xu, Yang Liu

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 IntelliRadar通过整合非结构化来源和大型语言模型,构建了包含34,313个恶意包的数据库,显著提高了恶意包情报提取的精度和覆盖范围。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18024 2025-11-25 cs.IR cs.AI cs.LG 62%

Extracting Interaction-Aware Monosemantic Concepts in Recommender Systems

在推荐系统中提取交互感知的单义概念

Dor Arviv, Yehonatan Elisha, Oren Barkan, Noam Koenigstein

专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种在推荐系统中提取交互感知的单义概念的方法,通过稀疏自动编码器揭示潜在语义结构,实现对用户和物品嵌入之间相互作用的保持,从而支持可控的个性化。

Journal ref AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏