arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-19 至 2025-12-19 共收录 195 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 40 篇

2512.16530 2025-12-19 cs.CL cs.AI 79%

Plain language adaptations of biomedical text using LLMs: Comparision of evaluation metrics

利用大语言模型对生物医学文本进行plain language改编:评估指标的比较

Primoz Kocbek, Leon Kopitar, Gregor Stiglic

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究比较了利用大语言模型对生物医学文本进行plain language改编的不同方法,发现gpt-4o-mini在评估指标上表现优异,而微调方法效果欠佳。

Comments 5 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07392 2025-12-19 cs.CL cs.AI 79%

Voice-Interactive Surgical Agent for Multimodal Patient Data Control

多模态患者数据控制的语音交互手术代理

Hyeryun Park, Byung Mo Gu, Jun Hee Lee, Byeong Hyeon Choi, Sekeun Kim, Hyun Koo Kim, Kyungsang Kim

机构 * Image Guided Precision Cancer Surgery Institute, College of Medicine, Korea University(影像引导精准癌症手术研究所,韩国大学医学院) Department of Radiology, Massachusetts General Hospital(放射科,麻省总医院) Department of Thoracic and Cardiovascular Surgery, Korea University Guro Hospital, College of Medicine, Korea University(胸外科和心血管外科,韩国大学Guro医院,韩国大学医学院) Department of Biomedical Sciences, College of Medicine, Korea University(生物医学科学系,韩国大学医学院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种基于大型语言模型的语音交互手术代理,用于多模态患者数据的高效控制与处理,通过分层多代理框架提升手术流程中的数据操作效率与鲁棒性。

Comments 14 pages, 13 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16913 2025-12-19 cs.CV 78%

Depth Any Panoramas: A Foundation Model for Panoramic Depth Estimation

全景深度估计的基础模型:Depth Any Panoramas

Xin Lin, Meixi Song, Dizhe Zhang, Wenxuan Lu, Haodong Li, Bo Du, Ming-Hsuan Yang, Truong Nguyen, Lu Qi

机构 * Insta360 Research(Insta360研究院) University of California, San Diego(加州大学圣地亚哥分校) Wuhan University(武汉大学) University of California, Merced(加州大学默塞德分校)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 本文提出了一种全景深度估计的基础模型,通过三阶段伪标签流程和优化方法提升模型在不同场景下的鲁棒性和泛化能力。

Comments Project Page: https://insta360-research-team.github.io/DAP_website/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16750 2025-12-19 cs.HC cs.AI 77%

Plausibility as Failure: How LLMs and Humans Co-Construct Epistemic Error

可能性作为失败:大语言模型与人类如何共同构建知识错误

Claudia Vale Oliveira, Nelson Zagalo, Filipe Silva, Anabela Brandao, Syeda Faryal Hussain Khurrum, Joaquim Santos

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究探讨了大语言模型与人类在知识错误中的共同构建过程,发现人类判断受模型生成可能性和解释快捷方式影响,导致错误被误判为可信。

Comments 19 pages, 2 tables, 77 references, 6 appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16250 2025-12-19 cs.AI cs.MA 77%

AMUSE: Audio-Visual Benchmark and Alignment Framework for Agentic Multi-Speaker Understanding

AMUSE:面向代理多说话者理解的音频-视觉基准与对齐框架

Sanjoy Chowdhury, Karren D. Yang, Xudong Liu, Fartash Faghri, Pavan Kumar Anasosalu Vasu, Oncel Tuzel, Dinesh Manocha, Chun-Liang Li, Raviteja Vemulapalli

机构 * University of Maryland, College Park(马里兰大学学院公园分校) Apple(苹果公司)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 AMUSE提出一个面向多说话人理解的音频-视觉基准与对齐框架RAFT,通过代理推理提升多模态模型能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08158 2025-12-19 cs.CL 77%

Beyond Over-Refusal: Scenario-Based Diagnostics and Post-Hoc Mitigation for Exaggerated Refusals in LLMs

超越过度拒绝:基于场景的诊断与事后缓解措施以应对大语言模型中的夸大拒绝

Shuzhou Yuan, Ercong Nie, Yinuo Sun, Chenxuan Zhao, William LaCroix, Michael Färber

机构 * ScaDS.AI and TU Dresden(ScaDS.AI 和图腾德斯雷克大学) LMU Munich and MCML(慕尼黑大学和MCML) Saarland University(萨尔兰州大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出基于场景的诊断与事后缓解方法,以减少大语言模型中的夸大拒绝问题,通过两个基准测试和三种轻量级策略提升合规性与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16381 2025-12-19 cs.NI 75%

A Network Arena for Benchmarking AI Agents on Network Troubleshooting

一个用于AI代理在网络故障排除中基准测试的网络竞技场

Zhihao Wang, Alessandro Cornacchia, Alessio Sacco, Franco Galante, Marco Canini, Dingde Jiang

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 NIKA是一个开源的网络故障排除基准,用于评估AI代理在动态网络环境中的性能,包含数百个精心挑选的网络事件和54个代表性问题,旨在帮助研究人员和网络专家改进网络故障诊断能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14687 2025-12-19 cs.CL cs.AI cs.LG eess.AS 75%

Spoken DialogSum: An Emotion-Rich Conversational Dataset for Spoken Dialogue Summarization

Spoken DialogSum:用于语音对话摘要的富有情感的对话数据集

Yen-Ju Lu, Kunxiao Gao, Mingrui Liang, Helin Wang, Thomas Thebaud, Laureano Moro-Velazquez, Najim Dehak, Jesus Villalba

机构 * Center for Language and Speech Processing(语言与语音处理中心)

专题命中 评测与基准 :LLM(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Spoken DialogSum是一个用于语音对话摘要的富有情感的对话数据集,通过结合语音、摘要和非语言线索,提升情感摘要的生成效果。

Comments 12 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.13843 2025-12-19 cs.LG cs.AI eess.IV 73%

Machine Learning and Transformers for Thyroid Carcinoma Diagnosis: A Review

机器学习与变换器在甲状腺癌诊断中的应用:综述

Yassine Habchi, Hamza Kheddar, Yassine Himeur, Mohamed Chahine Ghanem

机构 * Institute of Technology, University Center Salhi Ahmed, Naama, Algeria(阿尔及利亚纳马大学中心沙利·阿赫迈德技术学院) LSEA Laboratory, Electrical Engineering Department, University of Medea, 26000, Algeria(阿尔及利亚梅德亚大学电子工程系LSEA实验室) College of Engineering and Information Technology, University of Dubai, Dubai, UAE(阿联酋迪拜大学工程与信息技术学院) Cybersecurity Institute, Department of Computer Science, University of Liverpool, Liverpool, UK(英国利物浦大学计算机科学系网络安全研究所)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文综述了利用机器学习和变换器进行甲状腺癌诊断的AI方法,探讨了其分类系统、数据集对比及未来发展方向。

Journal ref Journal of Visual Communication and Image Representation, Vol. 115, January 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16425 2025-12-19 cs.IR cs.AI 70%

Introducing ORKG ASK: an AI-driven Scholarly Literature Search and Exploration System Taking a Neuro-Symbolic Approach

引入ORKG ASK:一种采用神经符号方法的AI驱动学术文献搜索与探索系统

Allard Oelen, Mohamad Yaser Jaradeh, Sören Auer

机构 * TIB – Leibniz Information Centre for Science and Technology(蒂宾根信息科学与技术研究中心) L3S Research Center, Leibniz University of Hannover(汉诺威莱布尼茨大学L3S研究中心)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 ORKG ASK通过神经符号方法结合向量搜索和LLMs,为研究人员提供AI驱动的学术文献搜索与探索支持,提升文献检索效率和用户满意度。

详情
URL PDF HTML 收藏
2512.01185 2025-12-19 cs.CR 67%

DefenSee: Dissecting Threat from Sight and Text -- A Multi-View Defensive Pipeline for Multi-modal Jailbreaks

DefenSee:从视觉和文本中解构威胁——一种多视图防御管道用于多模态对抗突破

Zihao Wang, Kar Wai Fok, Vrizlynn L. L. Thing

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 DefenSee通过图像变体转录和跨模态一致性检查,提供一种多模态防御方法,有效降低多模态对抗攻击的成功率,提升模型鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11486 2025-12-19 cs.CV 67%

Automated Building Heritage Assessment Using Street-Level Imagery

利用街景图像进行自动建筑遗产评估

Kristina Dabrock, Tim Johansson, Anna Donarelli, Mikael Mangold, Noah Pflugradt, Jann Michael Weinand, Jochen Linßen

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本研究利用GPT模型和建筑登记数据,通过机器学习对斯德哥尔摩建筑进行遗产价值分类,验证结果显示宏F1分数达0.71。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15949 2025-12-19 cs.CV 67%

The Perceptual Observatory Characterizing Robustness and Grounding in MLLMs

感知观测站:多模态大语言模型的鲁棒性与基础性表征

Tejas Anvekar, Fenil Bardoliya, Pavan K. Turaga, Chitta Baral, Vivek Gupta

机构 * Arizona State University(亚利桑那州立大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 感知观测站通过系统性扰动和真实数据集,评估多模态大语言模型在视觉基础性和关系结构上的鲁棒性,揭示其在扰动下的表现,为模型分析提供系统基础。

Comments Accepted at WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01146 2025-12-19 q-bio.OT 67%

Retrieval-Augmented Generation in Biomedicine: A Survey of Technologies, Datasets, and Clinical Applications

生物医学中的检索增强生成:技术、数据集和临床应用的综述

Jiawei He, Boya Zhang, Hossein Rouhizadeh, Yingjian Chen, Rui Yang, Jin Lu, Xudong Chen, Nan Liu, Douglas Teodoro

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文综述了生物医学中检索增强生成技术的发展,探讨了其在临床应用中的挑战与未来发展方向。

Comments 49 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15793 2025-12-19 cs.CY cs.AI cs.CL 62%

Explainable Ethical Assessment on Human Behaviors by Generating Conflicting Social Norms

通过生成冲突的社会规范进行可解释的伦理评估

Yuxi Sun, Wei Gao, Hongzhan Lin, Jing Ma, Wenxuan Zhang

机构 * Department of Computer Science(计算机科学系) School of Computing and Information Systems(计算与信息学系) Information Systems Technology and Design(信息系统技术与设计)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ClarityEthic方法,通过生成冲突的社会规范提升AI对人类行为效用的预测和解释能力。

Comments Acceppt by Asia-Pacific Chapter of the Association for Computational Linguistics (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19509 2025-12-19 cs.CL eess.AS 57%

Which Evaluation for Which Model? A Taxonomy for Speech Model Assessment

哪种模型用哪种评估?语音模型评估的分类

Maureen de Seyssel, Eeshan Gunesh Dhekane

机构 * Apple(苹果公司)

专题命中 评测与基准 :foundation model(abstract);分类 cs.CL

AI总结 本文提出语音模型评估的分类体系,通过三个正交轴定义评估方面、模型能力及任务要求,帮助选择和优化评估方法。

Comments 57 pages (26 main, 25 appendix, 6 references)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16307 2025-12-19 cs.CR cs.AI 57%

Beyond the Benchmark: Innovative Defenses Against Prompt Injection Attacks

超越基准:对抗提示注入攻击的创新防御

Safwan Shaheer, G. M. Refatul Islam, Mohammad Rafid Hamid, Tahsin Zaman Jilan

机构 * Dept. of CS, SDS BRAC University(计算机科学系,BRAC大学) Dept. of CSE, SDS BRAC University(计算机工程系,BRAC大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 本文提出创新防御机制,通过迭代优化防御提示,有效缓解LLM中的目标劫持漏洞,提升小型开源模型的安全性与部署效率。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15798 2025-12-19 cs.DB cs.CL 57%

DP-Bench: A Benchmark for Evaluating Data Product Creation Systems

DP-Bench: 一个用于评估数据产品创建系统的基准

Faisal Chowdhury, Sola Shirai, Sarthak Dash, Nandana Mihindukulasooriya, Horst Samulowitz

机构 * IBM Research(IBM研究院)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

AI总结 DP-Bench是一个全新的基准,用于评估自动数据产品创建,结合了ELT和文本到SQL基准,并提出基于大语言模型的方法作为基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14358 2025-12-19 cs.AI cs.DB 57%

TiCard: Deployable EXPLAIN-only Residual Learning for Cardinality Estimation

TiCard: 可部署的仅解释残差学习用于基数估计

Qizhi Wang

机构 * PingCAP, Data & AI-Innovation Lab(PingCAP数据与人工智能创新实验室)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI

AI总结 TiCard通过仅使用解释信息学习残差修正,提升数据库基数估计的准确性和可部署性。

Comments 16 pages(/wo references), 4 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13089 2025-12-19 cs.CV cs.AI 57%

UniVCD: A New Method for Unsupervised Change Detection in the Open-Vocabulary Era

UniVCD:面向开放词汇时代的无监督变化检测新方法

Ziqiang Zhu, Bowei Yang

机构 * School of Aeronautics and Astronautics, Zhejiang University(航空宇航学院,浙江大学)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI

AI总结 UniVCD是一种基于冻结视觉基础模型的无监督开放词汇变化检测方法,通过轻量级多模态对齐实现高分辨率语义感知变化检测。

Comments 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00774 2025-12-19 q-bio.BM cs.LG 57%

GeoGraph: Geometric and Graph-based Ensemble Descriptors for Intrinsically Disordered Proteins

GeoGraph: 基于几何和图的集成描述符用于内在无序蛋白质

Eoin Quinn, Marco Carobene, Jean Quentin, Sebastien Boyer, Miguel Arbesú, Oliver Bent

机构 * InstaDeep

专题命中 评测与基准 :language model(abstract);分类 cs.LG

AI总结 GeoGraph通过结合几何和图方法,从序列预测内在无序蛋白质的构象集合统计信息,提升对关键生物物理性质的预测能力。

Comments Accepted at AI4Science and ML4PS NeurIPS Workshops 2025. v2: comparison with Human-IDRome model and link to github added

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12142 2025-12-19 cs.CV 50%

MAVIS: A Benchmark for Multimodal Source Attribution in Long-form Visual Question Answering

MAVIS:多模态来源归因的长形式视觉问答基准

Seokwon Song, Minsu Park, Gunhee Kim

专题命中 评测与基准 :prompting(abstract)

AI总结 MAVIS基准旨在评估多模态来源归因系统,通过多模态文档检索和长形式答案生成,揭示多模态设置下信息量、 groundedness 和流畅性之间的权衡与改进方向。

Comments AAAI 2026; code is available at https://github.com/seokwon99/MAVIS

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 效率与部署 38 篇

2512.16855 2025-12-19 cs.AI cs.LO 89%

TOGGLE: Temporal Logic-Guided Large Language Model Compression for Edge

TOGGLE: 基于时序逻辑的大型语言模型压缩用于边缘

Khurram Khalil, Khaza Anuarul Hoque

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 TOGGLE通过结合时序逻辑与贝叶斯优化,实现了在不重新训练的情况下,对大型语言模型进行高效压缩,同时保持语言属性的正式保证。

Comments Published in the IEEE ICCAD 2025 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16236 2025-12-19 cs.IR cs.AI 89%

The Evolution of Reranking Models in Information Retrieval: From Heuristic Methods to Large Language Models

信息检索中重排序模型的演变:从启发式方法到大语言模型

Tejul Pandit, Sakshi Mahendru, Meet Raval, Dhvani Upadhyay

机构 * Palo Alto Networks, USA(帕洛阿尔托网络公司,美国) University of Southern California, USA(南加州大学,美国) Dhirubhai Ambani University, India(迪鲁布希·阿姆巴尼大学,印度)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.AI

AI总结 本文综述了信息检索中重排序模型的发展历程,从传统方法到大语言模型的应用,探讨了不同模型的优缺点及效率提升方法。

Comments 15 pages, 1 figure, Accepted in CLNLP'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16650 2025-12-19 cs.AI cs.CR 88%

Prefix Probing: Lightweight Harmful Content Detection for Large Language Models

前缀探查:用于大型语言模型的轻量有害内容检测

Jirui Yang, Hengqi Guo, Zhihui Lu, Yi Zhao, Yuansen Zhang, Shijing Hu, Qiang Duan, Yinggui Wang, Tao Wei

机构 * Fudan University(复旦大学) Ant Group(蚂蚁集团) Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 Prefix Probing通过高效前缀探查实现轻量有害内容检测,在保持检测效果的同时大幅降低计算成本和部署需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14925 2025-12-19 cs.CL 88%

Multiscale Aggregated Hierarchical Attention (MAHA): A Game Theoretic and Optimization Driven Approach to Efficient Contextual Modeling in Large Language Models

多尺度聚合层次注意力(MAHA):一种基于博弈论和优化驱动的高效上下文建模方法,用于大型语言模型

Caner Erden

机构 * Sakarya University of Applied Sciences(萨卡里亚应用科技大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 MAHA通过层次化分解和数学优化方法,提升大型语言模型在长上下文任务中的计算效率与上下文建模能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15766 2025-12-19 cs.PL cs.AI cs.DC cs.PF 88%

LOOPRAG: Enhancing Loop Transformation Optimization with Retrieval-Augmented Large Language Models

LOOPRAG:通过检索增强的大语言模型增强循环变换优化

Yijie Zhi, Yayu Cao, Jianhua Dai, Xiaoyang Han, Jingwen Pu, Qingran Wu, Sheng Cheng, Ming Cai

机构 * Zhejiang University(浙江大学) Zhejiang Institute of Administration(浙江行政研究院) Beijing ShenZhou Aerospace Software Technology Ltd.(北京神舟航天软件技术有限公司)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 LOOPRAG通过检索增强大语言模型提升循环变换优化效率,实现代码生成的准确性和性能提升。

Comments Accepted to ASPLOS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16083 2025-12-19 cs.DB cs.AI cs.HC cs.LG 88%

Scaling Text2SQL via LLM-efficient Schema Filtering with Functional Dependency Graph Rerankers

通过LLM高效模式过滤实现Text2SQL扩展

Thanh Dat Hoang, Thanh Tam Nguyen, Thanh Trung Huynh, Hongzhi Yin, Quoc Viet Hung Nguyen

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 通过LLM高效模式过滤框架提升Text2SQL系统在大规模模式下的性能与效率

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20322 2025-12-19 cs.CV 88%

HyperET: Efficient Training in Hyperbolic Space for Multi-modal Large Language Models

HyperET: 在超几何空间中为多模态大语言模型实现高效训练

Zelin Peng, Zhengqin Xu, Qingyang Liu, Xiaokang Yang, Wei Shen

机构 * MoE Key Lab of Artificial Intelligence, AI Institute, School of Computer Science, SJTU(摩埃人工智能重点实验室、人工智能学院、计算机科学学院、上海交通大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract)

AI总结 HyperET通过在双曲空间中动态调整半径,实现多模态大语言模型的高效训练,提升跨模态对齐性能。

Comments Accepted by NeurIPS2025 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12769 2025-12-19 cs.SD cs.AI 86%

Adaptive Edge-Cloud Inference for Speech-to-Action Systems Using ASR and Large Language Models

基于ASR和大语言模型的自适应边缘-云推断用于语音到动作系统

Mohammad Jalili Torkamani, Israt Zarin

机构 * School of Computing, University of Nebraska--Lincoln(计算机学院,内布拉斯加大学林肯分校)

专题命中 效率与部署 :large language model(title);language model(title);LLM(abstract);分类 cs.AI

AI总结 本文提出ASTA系统,通过自适应边缘-云推断平衡性能与资源利用,实现语音到动作的可靠控制。

Comments preprint, 6 pages, 7 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏