arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-24 至 2025-12-24 共收录 32 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32 篇

2512.19903 2025-12-24 cs.CL 93%

How well do Large Language Models Recognize Instructional Moves? Establishing Baselines for Foundation Models in Educational Discourse

大型语言模型如何识别教学行为?为教育对话的基础模型建立基准

Kirk Vanacore, Rene F. Kizilcec

机构 * National Tutoring Observatory(国家辅导观察所) Cornell University(康奈尔大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);foundation model(title,abstract);LLM(abstract)

AI总结 研究评估了六种LLM在分类真实课堂教学行为任务中的基准性能,发现少样本提示显著提升表现,但存在可靠性限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19697 2025-12-24 cs.NI cs.AI 89%

Automated Fault Detection in 5G Core Networks Using Large Language Models

利用大语言模型实现5G核心网络的自动化故障检测

Parsa Hatami, Ahmadreza Majlesara, Ali Majlesi, Babak Hossein Khalaj

机构 * Department of Electrical Engineering Sharif University of Technology Tehran, Iran(电气工程系 巴里夫大学 泰伦,伊朗)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本研究利用大语言模型实现5G核心网络的自动化故障检测与分类,通过微调GPT-4.1 nano模型提升故障检测准确性,为实现闭环无操作员故障管理提供新方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25535 2025-12-24 cs.LG stat.ML 89%

Meta-Router: Bridging Gold-standard and Preference-based Evaluations in Large Language Model Routing

Meta-Router: 在大语言模型路由中弥合标准评估与偏好评估之间的鸿沟

Yichi Zhang, Fangzheng Xie, Shu Yang, Chong Wu

机构 * Department of Statistics, Indiana University Bloomington(印第安纳大学布卢明顿分校统计系) Department of Statistics, North Carolina State University(北卡罗来纳州立大学统计系) Department of Biostatistics, The University of Texas MD Anderson Cancer Center(德克萨斯大学MD安德森癌症中心生物统计学系)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG

AI总结 Meta-Router通过整合标准与偏好数据,利用因果推断框架提升大语言模型路由的鲁棒性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20328 2025-12-24 cs.SE cs.AI cs.LG 88%

Toward Explaining Large Language Models in Software Engineering Tasks

向软件工程任务解释大型语言模型

Antonio Vitale, Khai-Nguyen Nguyen, Denys Poshyvanyk, Rocco Oliveto, Simone Scalabrino, Antonio Mastropaolo

机构 * University of Molise \& Politecnico di Torino Termoli Italy University of Molise Italy University of Molise \& Politecnico di Torino University of Molise

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 FeatureSHAP为软件工程任务提供首个自动化、模型无关的可解释性框架,通过Shapley值归因模型输出,提升代码生成和总结任务的解释性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19758 2025-12-24 cs.SE cs.AI 88%

Attention Distance: A Novel Metric for Directed Fuzzing with Large Language Models

注意力距离:一种用于大型语言模型定向模糊测试的新度量

Wang Bin, Ao Yang, Kedan Li, Aofan Liu, Hui Li, Guibo Luo, Weixiang Huang, Yan Zhuang

机构 * Guangdong Provincial Key Laboratory of Ultra High Definition Immersive Media Technology, Shenzhen Graduate School, Peking University(广东超高清沉浸媒体技术省重点实验室,北京大学深圳研究生院) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) China Mobile Internet CO(中国移动互联网公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出注意力距离度量,利用大型语言模型分析代码元素间的注意力分数,提升定向模糊测试效率,实验显示在38个漏洞复现实验中测试效率提升3.43倍,优于DAFL和WindRanger。

Comments Accepted to ICSE 2026 Research Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20159 2025-12-24 cs.SE cs.AI 87%

AXIOM: Benchmarking LLM-as-a-Judge for Code via Rule-Based Perturbation and Multisource Quality Calibration

AXIOM:通过基于规则的扰动和多源质量校准构建LLM-as-a-Judge代码评估基准

Ruiqi Wang, Xinchen Wang, Cuiyun Gao, Chun Yong Chong, Xin Xia, Qing Liao

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Monash University Malaysia(墨尔本大学马来西亚分校) Zhejiang University(浙江大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 AXIOM通过基于规则的扰动和多源质量校准构建代码评估基准,以实现高质量代码评分的平衡分布和可靠评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20022 2025-12-24 cs.IR 87%

LLM-Assisted Abstract Screening with OLIVER: Evaluating Calibration and Single-Model vs. Actor-Critic Configurations in Literature Reviews

基于OLIVER的LLM辅助摘要筛选:评估文献综述中的校准性和单模型与Actor-Critic配置

Kian Godhwani, David Benrimoh

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出OLIVER框架,评估LLM在文献综述中的校准性和单模型与Actor-Critic配置效果,发现后者在提高区分性和减少校准误差方面表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20168 2025-12-24 cs.CR cs.AI cs.LG 86%

Odysseus: Jailbreaking Commercial Multimodal LLM-integrated Systems via Dual Steganography

奥德赛:通过双隐写术对集成多模态大语言模型系统的商业系统进行劫持

Songze Li, Jiameng Cheng, Yiming Li, Xiaojun Jia, Dacheng Tao

机构 * S3IC-Lab(S3IC实验室)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 奥德赛通过双隐写术劫持多模态大语言模型集成系统,揭示现有安全过滤器的局限性,实现高达99%的攻击成功率。

Comments This paper is accepted by Network and Distributed System Security Symposium (NDSS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19025 2025-12-24 cs.CR cs.AI cs.LG 86%

The Erasure Illusion: Stress-Testing the Generalization of LLM Forgetting Evaluation

擦除幻觉:对LLM遗忘评估泛化能力的压测试

Hengrui Jia, Taoran Li, Jonas Guan, Varun Chandrasekaran

机构 * University of Toronto and Vector Institute(多伦多大学和向量研究所)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出PSG框架,通过生成语义衍生但嵌入空间不同的替代数据集,揭示LLM无学习评估中普遍存在的度量不准确问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20557 2025-12-24 cs.CV 82%

Learning to Reason in 4D: Dynamic Spatial Understanding for Vision Language Models

在4D中学习推理:面向视觉语言模型的动态空间理解

Shengchao Zhou, Yuxin Chen, Yuying Ge, Wei Huang, Jiehong Lin, Ying Shan, Xiaojuan Qi

机构 * The University of Hong Kong(香港大学) ARC Lab, Tencent PCG(腾讯PCG实验室)

专题命中 评测与基准 :language model(title,abstract);foundation model(abstract)

AI总结 本研究提出DSR套件,通过生成多选题-答案对和轻量级几何选择模块提升视觉语言模型的动态空间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19908 2025-12-24 cs.CL cs.CY 79%

Counterfactual LLM-based Framework for Measuring Rhetorical Style

反事实LLM框架用于测量修辞风格

Jingyi Qiu, Hong Chen, Zongyi Li

机构 * School of Information University of Michigan(信息学院密歇根大学) CSAIL MIT(MIT计算机科学与人工智能实验室)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL

AI总结 本文提出基于LLM的反事实框架,用于量化机器学习论文中的修辞风格,并发现修辞风格显著影响后续关注度,且2023年后修辞强度因LLM写作辅助而显著上升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19992 2025-12-24 cs.AI cs.CY 77%

S$^3$IT: A Benchmark for Spatially Situated Social Intelligence Test

S$^3$IT:一种用于空间情境社交智能测试的基准

Zhe Sun, Xueyuan Yang, Yujie Lu, Zhenliang Zhang

机构 * State Key Laboratory of General Artificial Intelligence, Beijing Institute for General Artificial Intelligence (BIGAI)(通用人工智能国家重点实验室,北京通用人工智能研究院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 S$^3$IT基准通过座位安排任务评估代理在现实情境中整合物理与社会约束的能力,揭示LLMs在空间智能上的不足及在冲突解决中的潜力。

Comments 10 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16465 2025-12-24 cs.AI 77%

cuPilot: A Strategy-Coordinated Multi-agent Framework for CUDA Kernel Evolution

cuPilot:一种用于CUDA内核演化的策略协调多智能体框架

Jinwu Chen, Qidie Wu, Bin Li, Lin Ma, Xin Si, Yang Hu, Shouyi Yin, Jun Yang

机构 * Southeast University(东南大学) Tsinghua University(清华大学) National Center of Technology Innovation for EDA(EDA技术创新国家中心)

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI

AI总结 cuPilot通过引入策略作为中间语义表示,提出了一种策略协调的多智能体框架,实现了对CUDA内核的高效优化,实验表明其在内核生成和性能提升方面表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.19916 2025-12-24 cs.CL cs.SE 77%

Deep Learning and Machine Learning, Advancing Big Data Analytics and Management: Object-Oriented Programming

深度学习与机器学习,推动大数据分析与管理:面向对象编程

Tianyang Wang, Ziqian Bi, Keyu Chen, Jiawei Xu, Qian Niu, Junyu Liu, Benji Peng, Ming Li, Sen Zhang, Xuanhe Pan, Jinlang Wang, Pohsun Feng, Yizhu Wen, Xinyuan Song, Ming Liu

机构 * Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学) Indiana University(印第安纳大学) Rutgers University(罗格斯大学) Purdue University(普渡大学) Kyoto University(京都大学) University of Hawaii(夏威夷大学) National Tsing Hua University(国立清华大学) The University of Texas at Dallas(德克萨斯大学达拉斯分校) Georgia Institute of Technology(佐治亚理工学院) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) National Taiwan Normal University(台湾师范大学) Emory University(埃默里大学) JTB Technology Corp.(JTB技术公司)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文探讨了面向对象编程在机器学习和深度学习中的应用,通过Python示例展示了如何提升代码模块化和可维护性,为AI项目提供更稳健的开发方法。

Comments 49pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20203 2025-12-24 cs.SE 75%

Well Begun is Half Done: Location-Aware and Trace-Guided Iterative Automated Vulnerability Repair

先立于足者,半途而废

Zhenlei Ye, Xiaobing Sun, Sicong Cao, Lili Bo, Bin Li

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 \sysname通过位置感知和跟踪引导的迭代方法,改进了漏洞修复的补丁生成质量与准确性。

Comments Accepted by ICSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08189 2025-12-24 cs.CV 75%

Reinforcement Learning for Large Model: A Survey

为大模型设计强化学习:综述

Weijia Wu, Chen Gao, Joya Chen, Kevin Qinghong Lin, Qingwei Meng, Yiming Zhang, Yuke Qiu, Hong Zhou, Mike Zheng Shou

机构 * National University of Singapore(新加坡国立大学) Zhejiang University(浙江大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);RLHF(abstract)

AI总结 本文综述了视觉强化学习领域,探讨了多模态大语言模型、视觉生成等四个主题,分析了算法设计、奖励工程及评估协议,并指出了样本效率、泛化能力等开放挑战。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20595 2025-12-24 cs.CL cs.AI cs.CV 73%

Cube Bench: A Benchmark for Spatial Visual Reasoning in MLLMs

Cube Bench: 一个用于多模态大语言模型空间视觉推理的基准测试

Dhruv Anand, Ehsan Shareghi

机构 * Department of Data Science and AI, Monash University(数据科学与人工智能系,墨尔本大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 Cube Bench通过评估多模态大语言模型在空间视觉推理中的能力,揭示了模型在复杂任务中的表现差异及自我纠正的局限性。

Comments 27 pages, 5 figures, 9 tables. Cube available at https://github.com/dana-23/cube-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19935 2025-12-24 cs.LG cs.AI cs.CR 73%

Conditional Adversarial Fragility in Financial Machine Learning under Macroeconomic Stress

金融机器学习中宏观经济压力下的条件对抗脆弱性

Samruddhi Baviskar

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究探讨了金融机器学习中宏观经济压力对对抗鲁棒性的影响,发现压力环境下模型对抗脆弱性显著增加,提出基于制度意识的评估框架及解释性治理层。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10229 2025-12-24 cs.LG cs.AI 73%

Adaptive Information Routing for Multimodal Time Series Forecasting

自适应信息路由用于多模态时间序列预测

Jun Seo, Hyeokjun Choe, Seohui Bae, Soyeon Park, Wonbin Ahn, Taeyoon Lim, Junhyeok Kang, Sangjun Han, Jaehoon Lee, Dongwan Kang, Minjae Kim, Sungdong Yoo, Soonyoung Lee

机构 * LG AI Research(LG人工智能研究)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出自适应信息路由框架,通过动态利用文本信息优化时间序列模型,提升多模态预测的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20206 2025-12-24 cs.AI 70%

TongSIM: A General Platform for Simulating Intelligent Machines

TongSIM: 一个用于模拟智能机器的通用平台

Zhe Sun, Kunlun Wu, Chuanjian Fu, Zeming Song, Langyong Shi, Zihe Xue, Bohan Jing, Ying Yang, Xiaomeng Gao, Aijia Li, Tianyu Guo, Huiying Li, Xueyuan Yang, Rongkai Liu, Xinyi He, Yuxi Wang, Yue Li, Mingyuan Liu, Yujie Lu, Hongzhao Xie, Shiyun Zhao, Bo Dai, Wei Wang, Tao Yuan, Song-Chun Zhu, Yujia Peng, Zhenliang Zhang

机构 * State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室) BIGAI Beijing, China(中国北京)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 TongSIM是一个通用平台,用于训练和评估具身智能代理,提供多样化的场景和交互丰富的环境,支持从低级导航到高级复合活动的广泛研究需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20174 2025-12-24 cs.CV cs.CL cs.IR 70%

Towards Natural Language-Based Document Image Retrieval: New Dataset and Benchmark

迈向基于自然语言的文档图像检索:新数据集和基准

Hao Guo, Xugong Qin, Jun Jie Ou Yang, Peng Zhang, Gangyan Zeng, Yubo Li, Hailun Lin

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Science and Engineering, Nanjing University of Science and Technology(南京理工大学 cyber 科学与工程学院) State Key Laboratory of Cyberspace Security Defense(网络空间安全防御国家重点实验室) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) University of Southern California(美国南加州大学) Laboratory for Advanced Computing and Intelligence Engineering(先进计算与智能工程实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出基于自然语言的文档图像检索基准,通过生成细粒度语义查询提升检索性能,推动视觉文档理解领域研究。

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19753 2025-12-24 cond-mat.mtrl-sci cs.AI 70%

QMBench: A Research Level Benchmark for Quantum Materials Research

QMBench: 量子材料研究的科研级基准

Yanzhen Wang, Yiyang Jiang, Diana Golovanova, Kamal Das, Hyeonhu Bae, Yufei Zhao, Huu-Thong Le, Abhinava Chatterjee, Yunzhe Liu, Chao-Xing Liu, Felipe H. da Jornada, Binghai Yan, Xiao-Liang Qi

机构 * Department of Materials Science and Engineering, Stanford University(斯坦福大学材料科学与工程系) Department of Physics, Pennsylvania State University(宾夕法尼亚州立大学物理系) Department of Condensed Matter Physics, Weizmann Institute of Science(魏茨曼科学研究院凝聚态物理系) Path Integral Technology, Inc.(路径积分技术公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 QMBench是一个用于评估大型语言模型在量子材料研究中能力的科研级基准,旨在推动人工智能科学家在该领域的发展。

Comments 20 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19012 2025-12-24 cs.CL 70%

DramaBench: A Six-Dimensional Evaluation Framework for Drama Script Continuation

DramaBench: 一个六维评估框架用于戏剧剧本续写

Shijian Ma, Yunqi Huang, Yan Lin

机构 * University of Macau(澳门大学) University College London(伦敦大学学院)

专题命中 评测与基准 :LLM(abstract);language model(abstract);分类 cs.CL

AI总结 DramaBench是一个六维评估框架,用于评估戏剧剧本续写的能力,通过结合规则分析和大语言模型标签生成,提供客观评估并建立创意写作的标准。

Comments Project page: https://dramabench.pages.dev/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05495 2025-12-24 cs.AI 70%

Deep Research Comparator: A Platform For Fine-grained Human Annotations of Deep Research Agents

深度研究比较器:一种用于深度研究代理细粒度人工标注的平台

Prahaladh Chandrahasan, Jiahe Jin, Zhihan Zhang, Tevin Wang, Andy Tang, Lucy Mo, Morteza Ziyadi, Leonardo F. R. Ribeiro, Zimeng Qiu, Markus Dreyer, Akari Asai, Chenyan Xiong

机构 * Carnegie Mellon University(卡内基梅隆大学) Amazon(亚马逊)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 深度研究比较器平台通过细粒度人工标注和端到端代理框架,提升深度研究代理的评估与开发效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18099 2025-12-24 eess.AS cs.CV 67%

SAM Audio: Segment Anything in Audio

SAM Audio:音频中的分段任何事物

Bowen Shi, Andros Tjandra, John Hoffman, Helin Wang, Yi-Chiao Wu, Luya Gao, Julius Richter, Matt Le, Apoorv Vyas, Sanyuan Chen, Christoph Feichtenhofer, Piotr Dollár, Wei-Ning Hsu, Ann Lee

机构 * Meta Superintelligence Labs(Meta超智能实验室)

专题命中 评测与基准 :foundation model(abstract);prompting(abstract)

AI总结 SAM Audio提出了一种统一文本、视觉和时间跨度提示的通用音频分离基础模型,实现了在多种音频任务中优于现有系统的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.03839 2025-12-24 cs.SE 67%

PCART: Automated Repair of Python API Parameter Compatibility Issues

PCART: 自动修复 Python API 参数兼容性问题

Shuai Zhang, Guanping Xiao, Jun Wang, Huashan Lei, Gangqiang He, Yepang Liu, Zheng Zheng

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 PCART 是首个自动修复 Python API 参数兼容性问题的工具,通过自动化提取、仪器化、映射、评估、修复和验证,有效检测并修复多种参数变化问题。

Comments Accepted by IEEE Transactions on Software Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20086 2025-12-24 cs.LG cs.AI 62%

Spatio-Temporal Graphs Beyond Grids: Benchmark for Maritime Anomaly Detection

超越网格的时空图:海上异常检测基准

Jeehong Kim, Youngseok Hwang, Minchan Kim, Sungho Bae, Hyunwoo Park

机构 * Graduate School of Data Science(数据科学研究生院) Seoul National University(首尔国立大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一个用于海上异常检测的基准数据集,通过引入轨迹合成器和异常注入器,系统评估不同粒度的异常检测方法。

Comments Accepted at NeurIPS 2025 Workshop in AI for Science: The Reach and Limits of AI for Scientific Discovery

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09586 2025-12-24 cs.LG cs.AI 62%

Environment Scaling for Interactive Agentic Experience Collection: A Survey

交互式代理经验收集的环境缩放:综述

Yuchen Huang, Sijia Li, Minghao Liu, Wei Liu, Shijue Huang, Zhiyuan Fan, Hou Pong Chan, Yi R. Fung

机构 * Hong Kong University of Science and Technology(香港科技大学) King’s College London(伦敦国王学院) DAMO Academy, Alibaba Group(阿里云达摩院)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文综述了交互式代理经验收集中环境缩放的方法,从环境中心视角系统回顾了任务生成、执行和反馈阶段的代表性方法,并探讨了实现框架、挑战及未来研究方向。

Comments 22 pages, 5 figures, SEA Workshop @ NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20257 2025-12-24 cs.CV 50%

LADLE-MM: Limited Annotation based Detector with Learned Ensembles for Multimodal Misinformation

LADLE-MM:基于有限标注的多模态虚假信息检测器

Daniele Cardullo, Simone Teglia, Irene Amerini

机构 * Sapienza University of Rome(罗马萨皮恩扎大学)

专题命中 评测与基准 :prompting(abstract)

AI总结 LADLE-MM是一种基于有限标注的多模态虚假信息检测器,通过学习的集成方法在有限资源下实现高效检测,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20236 2025-12-24 cs.CV 50%

IndicDLP: A Foundational Dataset for Multi-Lingual and Multi-Domain Document Layout Parsing

IndicDLP: 一个多语言多领域文档布局解析基础数据集

Oikantik Nath, Sahithi Kukkala, Mitesh Khapra, Ravi Kiran Sarvadevabhatla

机构 * Indian Institute of Technology, Madras, India(印度理工学院马德拉斯分校) International Institute of Information Technology Hyderabad, India(国际信息科技研究所海得拉巴分校)

专题命中 评测与基准 :pretraining(abstract)

AI总结 IndicDLP是一个多语言多领域文档布局解析数据集,旨在解决现有数据集在规模、多样性和标注细粒度方面的不足,提升文档理解的效率和包容性。

Comments Accepted in ICDAR 2025 (Oral Presentation) - Best Student Paper Runner-Up Award

详情

展开后加载摘要…

URL PDF HTML 收藏