arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-25 至 2026-08-25 共收录 706 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 177 篇

2608.22213 2026-08-25 cs.CR 新提交 87%

AdaptPrint: Response-Adaptive Fingerprinting of Black-Box LLM Services

AdaptPrint:黑盒大语言模型服务的响应自适应指纹识别

Yilin Li, Yifei Zhang, Guozhu Meng

专题命中 评测与基准 :LLM(title,summary_cn)

AI总结 针对黑盒LLM服务的不透明性问题,提出响应自适应指纹识别方法AdaptPrint,整合三种探测策略实现LLM身份识别,在27个候选模型上优于现有方法,准确率达80.6%等且鲁棒性强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22004 2026-08-25 cs.SE 新提交 87%

LLM-Enhanced Commit Message Generation via Issue Information: An Exploratory Study

结合问题信息的大语言模型增强型提交消息生成:一项探索性研究

Zongen Ren, Wei Shi, Bo Xiong, Chong Wang, Peng Liang

专题命中 评测与基准 :LLM(title,summary_cn)

AI总结 该研究提出ISAC框架,将代码差异与问题信息结合作为LLM输入生成提交消息,经实验验证其性能优于现有基线,且纳入问题信息可提升CMG效果。

Comments 28 pages, 7 images, 11 tables, Manuscript submitted to a journal (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00262 2026-08-25 cs.SE 版本更新 87%

LLM-Driven Cost-Effective Requirements Change Impact Analysis

基于大语言模型的低成本需求变更影响分析

Romina Etezadi, Sallam Abualhaija, Chetan Arora, Lionel Briand

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出ProReFiCIA方法,利用大语言模型自动识别需求变更影响,实验显示其在未见过的工业数据集上召回率达85.7%,且成本低,仅需审查3%的需求。

Comments 33 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23317 2026-08-25 cs.NE cs.AR cs.LG 新提交 86%

Spicing up Genetic Netlist Generation with LLMs

用大型语言模型(LLM)增强遗传网表生成

Stefan Uhlich, Yağız Gençer, Andrea Bonetti, Arun Venkitaraman, Chia-Yu Hsieh, Eisaku Ohbuchi, Lorenzo Servadei

专题命中 评测与基准 :LLM(title_cn,summary_cn);分类 cs.LG

AI总结 该研究提出混合合成框架LLM-SPICEMixer,将遗传网表生成与IGEL结合,在Iris分类任务中,相比无LLM引导的遗传框架,提升了多项性能指标。

Comments Accepted for MLCAD 2026, Extended Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21985 2026-08-25 cs.AI 新提交 86%

Redteaming Leading Arabic LLMs with ASAS

基于ASAS对领先阿拉伯大型语言模型开展红队测试

Fidaa Abed, Haidar Khan, M Saiful Bari, Babar Khan, Abdalghani Abujabal

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究推出首个人工策划的阿拉伯语红队测试基准ASAS,评估7款领先阿拉伯LLM的安全性,发现多数模型对50%不安全提示防御失效,自动安全评判器表现逊于人工,为阿拉伯LLM安全提供文化适配的测试方案。

Comments 13 pages, 5 figues, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01033 2026-08-25 cs.CR cs.AI 版本更新 86%

CallScreenBench: Benchmarking Small Language Models as Phone Secretaries

CallScreenBench:将端侧模型作为电话秘书的基准测试

Jiaqi Gan, Haoyuan Tang, Jamey Z. Liang, Siying Chen, Ankit Raj, Kidus Zewde, Yuchen Zhou, Yuxin Zhang, Simiao Ren

专题命中 评测与基准 :language model(title,abstract);small language model(title);分类 cs.AI

AI总结 研究人员提出CallScreenBench基准,针对端侧模型作为电话秘书的场景,从五个维度评分,发现分类性能差异是测量假象,脚本退化代理提供基准线,未设通过/失败阈值。

Comments 24 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01017 2026-08-25 cs.CL 版本更新 86%

Psychologically Potent, Computationally Invisible: LLMs Generate Social-Comparison-Eliciting Posts They Fail to Detect

心理上有效,计算上不可见:LLM 生成引发社会比较的帖子但无法检测

Hua Zhao, Jiapei Gu, Michelle Mingyue Gu

机构 * Department of English Language Education(英语语言教育系) Analytics/Assessment Research Centre(分析/评估研究中心)

专题命中 评测与基准 :LLM(title_cn,summary_cn);分类 cs.CL

AI总结 本研究通过构建小红书社会比较读者诱发基准(XHS-SCoRE),发现 LLM 在生成引发社会比较的帖子时存在生成-检测不匹配,即该信号在领域内可学习但无法通过提示分类稳健访问。

Comments Accepted at the 2026 Conference on Empirical Methods in Natural Language Processing (EMNLP 2026). 20 pages, including references and appendices; 1 figure and 6 tables. Project repository: https://github.com/zhao4hua4/XHS-SCoRE

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09874 2026-08-25 cs.CV cs.AI cs.IR 版本更新 86%

Benchmarking Document Parsers on Mathematical Formula Extraction from PDFs

对PDF中数学公式提取的文档解析器进行基准测试

Pius Horn, Janis Keuper

机构 * Institute for Machine Learning and Analytics (IMLA), Offenburg University, Offenburg, Germany(机器学习与分析研究所(IMLA)、奥芬堡大学) University of Mannheim, Mannheim, Germany(曼海姆大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种新的PDF数学公式提取基准测试框架,通过合成数据和LLM评估方法,评估了多种解析器的性能差异,揭示了选择合适解析器的关键因素。

Comments Best Scientific Paper Award, ICPR 2026 (Document Analysis and Recognition Track)

Journal ref Pattern Recognition. ICPR 2026. Lecture Notes in Computer Science, vol 16813, pp. 93-107. Springer, Cham, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21766 2026-08-25 cs.CL cs.AI 新提交 86%

Evaluation Awareness in Language Models: Representation, Verbalization, and Control

语言模型中的评估感知:表示、语言化与控制

Farzaneh Heidari, Amin Memarian, Guillaume Rabusseau

专题命中 评测与基准 :language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 该研究系统探测了6个语言模型的评估感知,发现其可线性解码、与语言化部分对齐,且在Olmo模型中随微调放大,需评估时考虑模型内部表示与语言化的脱节。

Comments The first two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23084 2026-08-25 cs.SE 新提交 86%

ARGUS: MCP-Grounded Root Cause Analysis for Kubernetes Incidents

ARGUS:基于MCP的Kubernetes事件根本原因分析工具

Ergi Senja, Seyed Mohammad Reza Razavi Zadegan, Philipp Leitner

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 ARGUS是一款基于MCP的Kubernetes事件根本原因分析助手,通过标准化MCP服务器关联LLM与实时可观测数据,在Slack频道提供诊断摘要,经评估其能100%识别根本原因,但修复建议可信度不足。

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21387 2026-08-25 cs.RO cs.SY eess.SY 新提交 86%

Multimodal-Language-Model-Driven Interaction and Companionship for Service Robots in Elderly-Care Facilities

面向养老机构服务机器人的多模态语言模型驱动的交互与陪伴

Ching-Chieh Liu, Cong-Thanh Vu, Yen-Chen Liu

机构 * National Cheng Kung University (NCKU)(成功大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 该研究针对养老机构服务机器人缺乏综合陪伴与安全能力的问题,提出整合主动视觉跟人、LLM语音交互及VLM安全监测的智能陪伴机器人系统,实验验证其跟随交互与跌倒检测的有效性。

Comments Accepted to the 2026 IEEE/ASME International Conference on Advanced Intelligent Mechatronics (AIM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21929 2026-08-25 cs.CR cs.CL 新提交 85%

SkillBloat: Token Amplification Attacks via Skill Injection in LLM Coding Agents

SkillBloat:通过大语言模型编码智能体中的技能注入实现的令牌放大攻击

Yuanjin Zheng, Jingbang Chen

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.CL

AI总结 本文提出SkillBloat两阶段框架,通过技能注入对LLM编码智能体实施令牌放大攻击,在真实基准上实现5.4184x-10.1455x平均最佳放大,揭示了技能生态系统的新型资源攻击面。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17445 2026-08-25 cs.CR cs.CL 版本更新 85%

Decomposition Attacks Across Unlinkable Identities: Limits of Stateful Defenses for LLM Services

跨不可链接身份的分解攻击:大语言模型服务的有状态防御的局限性

Bowen Sun, Zhengyue Zhao, Xiaogeng Liu, Yinzhi Cao, Chaowei Xiao

专题命中 评测与基准 :LLM(title,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文研究发现,针对跨不可链接身份的分解攻击,现有有状态防御策略在攻击者可重试学习时无法有效阻止攻击,需引入身份链接等额外分组相关机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18466 2026-08-25 cs.CL 85%

Purdah and Patriarchy: Evaluating and Mitigating South Asian Biases in Open-Ended Multilingual LLM Generations

Mamnuya Rinki, Chahat Raj, Anjishnu Mukherjee, Ziwei Zhu

机构 * George Mason University(乔治·马歇尔大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments Accepted to TrustNLP at ACL (Association for Computational Linguistics) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22417 2026-08-25 cs.AI cs.CL cs.HC 新提交 85%

LLMs for Survey Text Analysis - A Performance Comparison Between Humans and GPT-5 on Inductive Content Analysis

用于调查文本分析的大语言模型(LLMs):人类与GPT-5在归纳内容分析上的性能比较

Leonardo Bergmann, Renata Gheorghiu, Ana Gvritishvili, Alex Mican, Chris Stewart, Topias Tolonen-Weckström

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本研究对比人类与GPT-5.4在903份欧洲博士生调查开放式回答的归纳内容分析中的性能,发现GPT-5.4编码的ARI为0.61,可近似人类编码表现,或可作为归纳质性分析的可扩展支持工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22108 2026-08-25 cs.AI cs.LG 新提交 85%

Development and Feasibility Evaluation of an Edge AI as Medical Device System for Breast Cancer Multidisciplinary Team Meetings

用于乳腺癌多学科团队会议的边缘人工智能医疗设备系统的开发与可行性评估

Aarzoo Dhiman, Farzana Haque, Kartikae Grover, Lydia Brian Smith, William Stephen Jones

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 该研究开发了基于边缘AI的乳腺癌MDT会议系统,利用开源ASR、LLM和RAG实现设备上运行,经评估其ASR与RAG性能优异,证明了该系统的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21664 2026-08-25 cs.AI cs.CL 新提交 85%

Measuring Activation Control in Large Language Models

测量大语言模型中的激活控制

Marek Mateusz Kowalski, Joshua Fonseca Rivera, Uzay Macar, David Demitri Africa

机构 * UK AI Security Institute(英国人工智能安全研究所)

专题命中 评测与基准 :large language model(title);language model(title);分类 cs.CL、cs.AI

AI总结 本研究推出Activation Controllability Benchmark量化大语言模型的激活控制能力,发现多数模型可调控残差流,其控制可规避部分激活监控方法,建议追踪该能力以优化模型监控。

Comments 19 figures, 4 tables. Code: https://github.com/mkobalski/activation-control. Data: https://huggingface.co/datasets/joshycodes/activation-control-battery

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16890 2026-08-25 cs.CL cs.AI cs.LG 版本更新 85%

LLM-Based Adversarial Persuasion Attacks on Fact-Checking Systems

基于大语言模型的对抗说服攻击对事实核查系统的攻击

João A. Leite, Olesya Razuvayevskaya, Kalina Bontcheva, Carolina Scarton

机构 * Department of Computer Science, University of Sheffield, UK(计算机科学系,谢菲尔德大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出基于大语言模型的说服对抗攻击方法,通过重述声明影响事实核查系统的验证和证据检索效果。

Comments Accepted to EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22390 2026-08-25 cs.CL 新提交 84%

SchemaGUI: A Schema-Driven Benchmark for Controllable GUI Generation Evaluation

SchemaGUI:一种用于可控图形用户界面生成评估的模式驱动基准

Jiarui Dong, Yin Cai, Zhouhong Gu, Chenmou Wu, Ci Tao, Yiran Chen, Jialing Li, Xiaoran Shi, Juntao Zhang, Zhijun Fang

机构 * Shanghai University of Engineering Science(上海工程技术大学) Fudan University(复旦大学)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对LLM的GUI生成评估难题,提出SchemaGUI基准,测试Qwen3.5等5种主流模型,发现几何控制、布局复杂度、思维模式对GUI生成效果的影响规律。

Comments 18 pages, 6 figures, and 7 tables. Code is available at https://github.com/xdong2002/SchemaGUI

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21374 2026-08-25 cs.AI 新提交 84%

LitReview Arena: Evaluating Literature Review Agents with Battle-Style Peer Review Platform

LitReview Arena:基于对战式同行评审平台的文献综述智能体评估

Ruotong Zhao, Zhiyu Chen, Xurui Liu, Haidong Xue, Dong Liang, Jigao Fu, Wu YanBiao, Yuanyi Zhen, Fengli Xu, Yong Li

专题命中 评测与基准 :LLM(summary_cn,abstract);language model(abstract);分类 cs.AI

AI总结 该研究推出对战式文献综述评估平台LitReview Arena,收集约3000条专家判断发现现有最强LLM综述系统仅23.0%胜率,校准后的评估器LitJudge将一致性提升至0.78。

Comments 20 pages, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12645 2026-08-25 cs.AI 版本更新 84%

Jagged Judges: Epistemic Stability Under Perturbation, Pressure, and Persistence

波动评判者:在沉默、压力与坚持下的认知稳定性

Justin Zhao, Himaghna Bhattacharjee, Hannah Korevaar, Bhaktipriya Radharapu, Khalid El-Arini

机构 * Meta Superintelligence Labs(元超级智能实验室) FAIR at Meta(元公司FAIR研究院)

专题命中 评测与基准 :LLM(summary_cn,abstract);prompting(abstract);分类 cs.AI

AI总结 本研究提出Wiggle框架测试LLM评判者的认知稳定性,发现9个前沿模型在压力下裁决波动显著,且多数压力会损害真实值,基线陪审团多数强度可预测波动项目。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23474 2026-08-25 cs.CL cs.AI cs.CV 新提交 84%

What's the Catch? Evaluating Temporal Consistency in Vision-Language Models

有何玄机?评估视觉-语言模型的时间一致性

Marek Hradil, Danae Sánchez Villegas

机构 * University of Copenhagen(哥本哈根大学)

专题命中 评测与基准 :language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出TimeCatch基准,发现视觉-语言模型可检测单帧异常但难整合跨帧信息,在时间异常检测上表现接近随机水平。

Comments 17 pages, ACL format

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22948 2026-08-25 cs.CL cs.AI 新提交 84%

What Proves You Wrong: Benchmarking Language Models on Falsifiable Research Ideation

什么能证明你错:对可证伪的研究构思进行基准测试的语言模型

Ziyue Wang, Aomufei Yuan, Yiran Yao, Linli Yao, Hongyao Zuo, Ziwen Gong, Yuanxin Liu, Shicheng Li, Yishuo Cai, Tong Yang, Xu Sun, Xiaohui Li, Haoli Bai

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出 Lit2Test 基准,通过六领域契约让研究构想可证伪,对四个前沿模型的研究构想进行盲态成对比较,恢复了模型的严格排名并公开相关资源。

Comments Equal contribution by Ziyue Wang, Aomufei Yuan and Yiran Yao. Corresponding authors: Tong Yang and Xu Sun

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18061 2026-08-25 cs.CL cs.AI cs.SD eess.AS 版本更新 84%

TELEVAL: A Benchmark Designed for Spoken Language Models in Chinese Interactive Scenarios

TELEVAL: 为中国交互场景中的语音语言模型设计的动态基准

Zehan Li, Hongjie Chen, Qing Wang, Yuxin Zhang, Jing Zhou, Hang Lv, Mengjie Du, Yaodong Song, Jie Lian, Jian Kang, Jie Li, Yongxiang Li

机构 * Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究院(TeleAI)、中国电信)

专题命中 评测与基准 :language model(title,abstract);SLM(abstract);分类 cs.CL、cs.AI

AI总结 TELEVAL是一个为中国语音交互场景设计的动态基准,旨在评估语音语言模型在真实对话中的表现,强调内容准确性和互动适当性,揭示当前模型在自然交互回应上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21736 2026-08-25 cs.LG 新提交 83%

Adaptive Multilevel Twisted Sequential Monte Carlo for Rare Events Estimation in Language Models

用于语言模型稀有事件估计的自适应多级扭曲序贯蒙特卡洛方法

Zixuan Liu, Fangzheng Wu, Brian Summa, Zizhan Zheng

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.LG

AI总结 针对现有扭曲序贯蒙特卡洛稀有事件估计依赖稀有正样本导致不可靠的问题,提出自适应多级扭曲SMC,通过逐步稀有中间事件学习扭曲,提升语言模型稀有不安全行为概率估计准确性,助力模型安全评估与对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16646 2026-08-25 cs.SE cs.AI 版本更新 83%

Falsification-Based Verification of LLM-Generated Optimization Models: Sound Test Batteries and Their Detection Limits

基于证伪的大语言模型生成优化模型验证:可靠的测试组及其检测极限

Haifeng Li, Mo Hai

机构 * School of Information, Central University of Finance and Economics(信息学院,中央财经大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究大语言模型生成优化模型的验证问题,基于证伪理论开发测试组,通过求解器调用测试候选模型,实验证实该测试组可靠,能检测多种错误,误报率低,再现可检测性模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22634 2026-08-25 cs.CL cs.AI 新提交 82%

GeoRisk-RAG: A Hierarchy-Aware Risk Framework for Improving RAG Reliability through Selective Answering

GeoRisk-RAG:一种通过选择性回答提升RAG可靠性的层级感知风险框架

Meenu Ravi, Shailik Sarkar, Lulwah AlKulaib, Yordanos Tessema, Chang-Tien Lu

机构 * Virginia Tech(弗吉尼亚理工大学) Florida Polytechnic University(佛罗里达理工大学) Kuwait University(科威特大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 GeoRisk-RAG是一种层级感知框架,通过选择性回答结合有向无环图距离估计地理适用性,在野火QA数据集上将位置相关问题错误置信率降至0.009,提升RAG可靠性,助力地理空间领域安全决策。

Comments Accepted for CIKM '26 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22559 2026-08-25 cs.AI cs.CL cs.IR 新提交 82%

ExecRubrics: Executable Tool-Augmented Rubrics for Verifiable and Efficient Long-Form Evaluation

ExecRubrics:用于可验证且高效的长文本评估的可执行工具增强型评分标准

Kaustubh D. Dhole, Charles L. A. Clarke, Eugene Y. Agichtein

机构 * Emory University(埃默里大学) University of Waterloo(滑铁卢大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 ExecRubrics是将评分标准转化为可执行Python程序的框架,可替代黑盒LLM评判者,在三个长文本基准上实现与自然语言评分标准相当或更优的偏好准确率,且评估延迟降低最多320倍,提升了评估的可解释性与效率。

Comments Accepted to EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04565 2026-08-25 cs.CR cs.AI cs.CL 版本更新 82%

Breadcrumbing Search Agents

面包屑式搜索智能体

Xuebin Li, Hanqing Zhao, Siyuan Liang, Kejiang Chen, Weiming Zhang, Dacheng Tao, Nenghai Yu

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 该研究针对LLM搜索智能体的安全问题,提出ACH和TGSE策略,通过操纵搜索结果形成连贯证据链,大幅提升攻击成功率。

Comments 39 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.16183 2026-08-25 cs.CV 版本更新 82%

Expert-level vision-language foundation model for real-world radiology and comprehensive evaluation

面向真实世界放射学的专家级视觉-语言基础模型及综合评估

Xiaohong Liu, Guoxing Yang, Yulin Luo, Jiaji Mao, Xiang Zhang, Haibo Wang, Zhiyang He, Ming Gao, Shanghang Zhang, Jun Shen, Guangyu Wang

专题命中 评测与基准 :foundation model(title,abstract);pretraining(abstract)

AI总结 本研究提出面向放射学的开源VL基础模型RadFound,通过增强视觉编码器与跨模态学习设计,在自主构建的真实世界基准RadVLBench上显著优于其他VL模型,具备专家级放射学多模态处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏