arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 1423 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 1423 篇

2510.25577 2026-08-17 eess.AS cs.AI cs.CL 版本更新 84%

Lost in Phonation: Voice Quality Variation as an Evaluation Dimension for Speech Foundation Models

语音迷失在发声中:语音质量变化作为语音基础模型的评估维度

Harm Lameris, Shree Harsha Bokkahalli Satish, Joakim Gustafson, Éva Székely

机构 * Department of Speech, Music and Hearing(语音、音乐与听觉系)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究推出VQ-Bench评估套件,发现语音基础模型(SFMs)对发声类型的解释存在性能差距,还会反映或放大人类社会偏见,为确保基于语音的AI的副语言解释责任性建立了可复现框架。

Comments 5 pages, 2 figures, 3 tables, accepted at Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16941 2026-08-11 cs.LG cs.AI 版本更新 84%

FoMoH: A clinically meaningful foundation model evaluation for structured electronic health records

FoMoH:针对结构化电子健康记录的具有临床意义的基础模型评估

Vincent Jeanselme, Zilin Jing, Aparajita Kashyap, Chao Pang, Florent Pollet, Young Sang Choi, Xinzhuo Jiang, Yuta Kobayashi, Yanwei Li, Sara Matijevic, Karthik Natarajan, Shalmali Joshi

机构 * Department of Biomedical Informatics Columbia University(生物医学信息学系 哥伦比亚大学)

专题命中 评测与基准 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本研究构建含14项临床预测任务的基准,评估6种EHR基础模型,发现其在标注数据有限时区分性能更优、群体公平性更好,但低患病率场景表现差、跨机构可迁移性不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07322 2026-08-06 cs.CL cs.AI 版本更新 84%

FinRpt: Dataset, Evaluation System and LLM-based Multi-agent Framework for Equity Research Report Generation

FinRpt:用于权益研究报告生成的数据集、评估系统及基于大语言模型的多智能体框架

Song Jin, Shuqi Li, Shukun Zhang, Rui Yan

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.AI

AI总结 本文首次明确权益研究报告生成任务,推出含数据集、评估系统的FinRpt基准,提出多智能体框架FinRpt-Gen,实验验证其有效性,相关代码与数据集公开。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22774 2026-08-04 cs.LG cs.AI cs.HC 版本更新 84%

CogAdapt: Adapting Clinical ECG Foundation Models for Wearable Cognitive Load Assessment

CogAdapt: 通过导联适应将临床心电图基础模型迁移至可穿戴认知负荷评估

Amir Mousavi, Erfan Nourbakhsh, Mohammad Sadegh Sirjani, Mimi Xie, Rocky Slavin, Leslie Neely, John Davis, John Quarles

机构 * Department of Computer Science, College of AI, Cyber and Computing, The University of Texas at San Antonio(计算机科学系,人工智能、网络与计算学院,德克萨斯大学圣安东尼奥分校) Department of Educational Psychology, College of Education and Human Development, The University of Texas at San Antonio(教育心理学系,教育与人类发展学院,德克萨斯大学圣安东尼奥分校)

专题命中 评测与基准 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 提出CogAdapt框架,通过可学习适配器LeadBridge将3导联可穿戴信号转换为12导联表示,并结合渐进微调策略ProFine,实现临床心电图基础模型向可穿戴认知负荷评估的迁移,在跨受试者验证中显著优于从头训练的基线模型。

Comments 7 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08543 2026-07-30 cs.CV cs.AI cs.CL cs.CY 版本更新 84%

VideoNorms: Benchmarking Cultural Awareness of Video Language Models

VideoNorms:视频语言模型文化意识基准测试

Nikhil Reddy Varimalla, Yunfei Xu, Meng Fan Wang, Arkadiy Saakyan, Smaranda Muresan

机构 * Department of Computer Science, Columbia University(哥伦比亚大学计算机科学系)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究推出VideoNorms数据集评估VideoLLMs的文化规范意识,发现模型中文表现逊于英文、提供非语言证据更困难,视频模态必要且规模扩大无分类分数提升,成果助力文化导向的视频模型训练与评估。

Comments 29 pages, 6 figures, 19 tables. IC2S2 2026, C3NLP@ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05554 2026-07-22 cs.CL cs.AI 版本更新 84%

Prompt Robustness Is Task-Dependent: Comparing Objective and Belief-Style Questions in LLM Evaluation

提示鲁棒性取决于任务:在大语言模型评估中比较客观和信念风格问题

Sadia Kamal, Arefa Patwary, Anthony Marchiafava, Sagnik Ray Choudhury, Atriya Sen

机构 * Oklahoma State University(俄克拉荷马州立大学) University of North Texas(北德克萨斯大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型评估中提示鲁棒性,比较客观与主观问题,在多个数据集上评估四个模型家族,通过多种提示更改及特定方程分析,发现提示鲁棒性取决于问题类型、提示变化和模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22328 2026-07-21 cs.LG cs.AI cs.CE 版本更新 84%

FETS Benchmark: Foundation Models Enable Scalable and Generalizable Energy Time Series Forecasting

FETS基准:基础模型在能源时间序列预测中优于数据集特定的机器学习

Marco Obermeier, Marco Pruckner, Florian Haselbeck, Andreas Zeiselmair

机构 * Julius-Maximilians-Universität Würzburg, Modeling and Simulation Lab(乌尔姆-马克斯·普朗克大学,建模与仿真实验室) Weihenstephan-Triesdorf University of Applied Sciences, Smart Farming(魏因施泰因-特里尔夫应用科学大学,智能农业) Weihenstephan-Triesdorf University of Applied Sciences, Digital Energy Transition(魏因施泰因-特里尔夫应用科学大学,数字能源转型)

专题命中 评测与基准 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文通过FETS基准展示了基础模型在能源时间序列预测中优于传统机器学习方法,揭示了基础模型在不同数据集和场景下的优越性能及应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23786 2026-07-20 cs.AI cs.LG 版本更新 84%

FAIR_XAI: Improving Multimodal Foundation Model Fairness via Explainability for Wellbeing Assessment

FAIR_XAI: 通过可解释性提升多模态基础模型公平性以用于幸福感评估

Sophie Chiang, Tom Brennan, Fethiye Irmak Dogan, Jiaee Cheong, Hatice Gunes

机构 * Department of Computer Science & Technology, University of Cambridge(计算机科学与技术系,剑桥大学) Harvard University(哈佛大学)

专题命中 评测与基准 :foundation model(title);language model(abstract);prompting(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了多模态基础模型在幸福感评估中的公平性问题,通过可解释性干预框架改善诊断可靠性与公平性,发现不同模型在不同数据集上表现差异显著,且存在性别和种族偏见。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10029 2026-07-20 cs.CL cs.AI cs.CR 版本更新 84%

Latent Fusion Jailbreak: Blending Harmful and Harmless Representations to Elicit Unsafe LLM Outputs

潜在融合越狱:融合有害与无害表征以引出不安全的大语言模型输出

Wenpeng Xing, Bohan Yang, Mohan Li, Chunqiang Hu, Haitao Xu, Ningyu Zhang, Bo Lin, Meng Han

机构 * Bingjiang Institute of Zhejiang University(浙江大学滨江学院) Zhejiang University(浙江大学) Guangzhou University(广州大学) Chongqing University(重庆大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究如何通过白盒干预操纵安全对齐的大语言模型,核心方法是潜在融合越狱(LFJ),通过配对有害与良性表征、优化混合系数等实现,在多个模型和基准上取得高攻击成功率,还设计了对抗训练程序降低攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08803 2026-07-16 q-bio.QM cs.AI cs.LG 版本更新 84%

TheBioCollection: Unified Pre-Training Scale LLM Corpus for Biology

TheBioCollection:用于生物学的统一预训练规模语言模型语料库

Hyunjin Seo, Hyeon Hwang, Gyubok Lee, Jay Shin, Jimin Park, Taesoo Kim, Sanghoon Lee, Hongjoon Ahn, Sungjun Han, Sangwon Jung

机构 * Trillion Labs KAIST(韩国科学技术院) SK Biopharmaceuticals Co., Ltd.(SK生物制药公司) Lunit Inc.(Lunit公司) AIGEN Sciences Inc.(AIGEN科学公司)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 为满足生物学大语言模型训练需求,提出TheBioCollection语料库,整合异构生物资源并丰富记录、引入新任务,配对TheBioCollection-Eval评估,固定架构训练后模型在各领域表现提升,语言能力基本不变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04689 2026-07-15 cs.CL cs.AI 版本更新 84%

Adaptive Testing for LLM Evaluation: A Psychometric Alternative to Static Benchmarks

大语言模型评估的自适应测试:一种替代静态基准的心理测量方法

Peiyu Li, Xiuxiu Tang, Si Chen, Ying Cheng, Ronald Metoyer, Ting Hua, Nitesh V. Chawla

机构 * University of Notre Dame(诺丁汉大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对大语言模型评估成本高、现有协议不合理的问题,提出基于项目反应理论的自适应测试框架ATLAS,通过Fisher信息引导选项目,减少90%项目数仍保持精度,能重构准确率,还可在准确率相当模型中提供精细区分。

Comments ICML 2026 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06861 2026-07-14 cs.CL cs.AI 版本更新 84%

BiasLab: A Multilingual Dual-Framing Framework for LLM Bias Measurement, Applied to Workplace and HR Contexts

BiasLab:用于大语言模型偏差测量的多语言双框架框架,应用于职场和人力资源领域

William Guey, Wei Zhang, Pei-Luen Patrick Rau, Pierrick Bougault, Vitor D. de Moura, Bertan Ucar, Jose O. Gomes

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对大语言模型在工作场所和人力资源领域的偏差问题,提出BiasLab多语言双框架框架,结合多种方法对十个模型在六个主题上评估,发现模型有一致方向性偏好,为模型偏差测量提供标准化工具助组织审查。

Comments 15 pages, 4 figures, 6 tables

Journal ref Work: A Journal of Prevention, Assessment and Rehabilitation, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29283 2026-07-03 cs.LG cs.AI 版本更新 84%

Do Physics Foundation Models Learn Generalizable Physics? A Bias-Aware Benchmark Across Physical Regimes and Distribution Shifts

物理基础模型能否学习可泛化的物理?一种跨物理机制和分布偏移的偏差感知基准

Mengdi Chu, Yang Liu, Ayan Biswas, Han-Wei Shen

机构 * The Ohio State University(俄亥俄州立大学) Los Alamos National Laboratory(洛斯阿拉莫斯国家实验室)

专题命中 评测与基准 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 通过构建包含8种物理动力学、3种训练数据混合和25种测试机制的基准,评估五种物理基础模型架构,发现当前模型是条件性而非通用性泛化者,其泛化能力依赖于物理机制、时间尺度、初始条件、预训练、模型大小和架构,并指出改进需超越缩放模型或扩展数据,转向学习跨机制、时间尺度和分布偏移的可迁移物理知识。

Comments 26 pages, 31 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27286 2026-06-10 cs.LG cs.AI 版本更新 84%

Falcon-X: A Time Series Foundation Model for Heterogeneous Multivariate Modeling

Falcon-X:面向异构多变量建模的时间序列基础模型

Yiding Liu, Yifan Hu, Hongjie Xia, Peiyuan Liu, Hongzhou Chen, Xilin Dai, Zewei Dong, Jiang-Ming Yang

机构 * Ant Group(蚂蚁集团)

专题命中 评测与基准 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 针对现有时间序列基础模型在语义对齐和关系表达上的局限,提出Falcon-X,通过将变量映射到统一潜在原型空间,利用统一原型差分注意力机制对齐异构变量,并在共享空间中通过潜在实体注意力进行跨变量交互,实现零样本结构迁移,在GIFT-Eval和fev-bench基准上取得最先进预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15084 2026-06-08 physics.plasm-ph cs.AI cs.LG 版本更新 84%

TokaMind: A Multi-Modal Transformer Foundation Model for Tokamak Plasma Dynamics

TokaMind: 用于托卡马克等离子体动力学的多模态Transformer基础模型

Tobia Boschi, Andrea Loreti, Nicola C. Amorisco, Rodrigo H. Ordonez-Hurtado, Cécile Rousseau, George K. Holt, Eszter Székely, Alexander Whittle, Samuel Jackson, Adriano Agnello, Stanislas Pamela, Alessandra Pascale, Robert Akers, Juan Bernabe Moreno, Vassil Alexandrov, Mykhaylo Zayats

机构 * IBM Research(IBM研究院) UK Atomic Energy Authority(英国原子能局) STFC Hartree Centre(科学与技术设施研究中心哈特ree中心)

专题命中 评测与基准 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 提出TokaMind,首个开源托卡马克等离子体动力学基础模型,基于多模态Transformer在MAST数据集上预训练,支持多种数据模态和缺失信号处理,在14个任务上优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03162 2026-08-11 cs.CY cs.AI cs.CL cs.LG 版本更新 83%

MateInfoUB: A Real-World Benchmark for Testing LLMs in Competitive, Multilingual, and Multimodal Educational Tasks

MateInfoUB:用于测试大型语言模型(LLMs)在竞争性、多语言及多模态教育任务中表现的真实世界基准

Adrian Marius Dumitran, Theodor-Pierre Moroianu, Mihnea-Vicentiu Buca

机构 * University of Bucharest Faculty of Mathematics and Computer Science(布加勒斯特大学数学与计算机科学学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究构建了双语多模态计算机科学竞赛题数据集,评估当前最先进LLMs在该数据集上的表现,揭示其优劣势及语言选择的影响,还发布了教育应用以支持罗马尼亚学生自我评估。

Comments 14 pages (9 paper, 2 references, 3 annexes). Accepted for BEA 2025!

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00215 2026-07-31 cs.SE 版本更新 83%

DocPrism: Multi-lingual Detection of Incorrectness Inconsistencies between Code and Documentation

DocPrism:代码与文档间错误不一致性的多语言检测

Xiaomeng Xu, Zahin Wahab, Reid Holmes, Caroline Lemieux

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出轻量级多语言代码-文档不一致性检测工具DocPrism,通过LCEF方法降低标记率、提升F1分数,在多语言真实场景中表现优于现有技术。

Comments 22 pages. To appear in Proceedings of the ACM on Software Engineering, Volume 3, ISSTA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24592 2026-07-22 cs.CV 版本更新 83%

GH-ESD: Grounded Hypothesis-Driven Error Slice Discovery for Instance-Level Vision Tasks

GH-ESD:基于假设驱动的实例级视觉任务错误切片发现

Wei Zhang, Chaoqun Wang, Zixuan Guan, Ping Sheng Kao, Pengfei Zhao, Peng Wu, Sifeng He

机构 * Apple(苹果公司)

专题命中 评测与基准 :LLM(summary_cn,abstract);language model(abstract)

AI总结 提出GH-ESD框架,通过LLM生成假设与视觉语言模型验证,在实例级任务中自动发现空间关系错误切片,并构建GESD基准,显著提升检测和分割任务的错误切片发现精度。

Comments Accepted by ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.13378 2026-07-07 cs.AI cs.CL cs.IR cs.LG q-bio.QM 版本更新 83%

DrugAgent: Reliable Multi-Agent Integration of Conflicting Biomedical Evidence for Drug-Target Interaction Assessment

DrugAgent:用于药物-靶点相互作用评估的冲突生物医学证据的可靠多智能体整合

Yoshitaka Inoue, Tianci Song, Xinling Wang, Rui Kuang, Tianfan Fu, Augustin Luna

机构 * Department of Computer Science and Engineering, University of Minnesota(计算机科学与工程系,明尼苏达大学) Computational Biology Branch, National Library of Medicine(国家医学图书馆计算生物学分支) Khoury College of Computer Sciences, Northeastern University(东北大学计算机科学学院) State Key Laboratory for Novel Software Technology at Nanjing University, School of Computer Science, Nanjing University(南京大学新型软件技术国家重点实验室,南京大学计算机科学学院) Developmental Therapeutics Branch, National Cancer Institute(国家癌症研究所发育治疗分支)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究药物-靶点相互作用评估中整合异构数据问题,核心方法是基于大语言模型的多智能体系统DrugAgent,贡献是能进行异构证据支持的DTI评估,补充独立DTI预测,还提供相关策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02813 2026-07-03 cs.AI cs.CL cs.LG 版本更新 83%

HAL: Inducing Human-likeness in LLMs with Alignment

HAL: 通过对齐引导LLM的人类相似性

Masum Hasan, Junjie Zhao, Ehsan Hoque

机构 * University of Rochester(罗切斯特大学)

专题命中 评测与基准 :LLM(title_cn);language model(abstract);preference optimization(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出HAL框架,利用可解释的数据驱动奖励信号,通过对比对话数据提取显式会话特征并优化偏好,使模型在对话中更常被视为类人,同时保持整体性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16975 2026-06-16 cs.SD eess.AS 版本更新 83%

Interpretable Audio Editing Evaluation via Chain-of-Thought Difference-Commonality Reasoning with Multimodal LLMs

基于多模态大语言模型的链式思维差异-共性推理的可解释音频编辑评估

Yuhang Jia, Xu Zhang, Yang Chen, Hui Wang, Enzhi Wang, Yong Qin

机构 * College of Computer Science, Nankai University, Tianjin, China(南开大学计算机科学学院,天津,中国) Academy for Advanced Interdisciplinary Studies, Nankai University, Tianjin, China(南开大学先进跨学科研究学院,天津,中国)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出首个基于自然语言的音频编辑自动评估框架,利用Qwen2-Audio和链式思维推理策略,实现可解释且与人类判断高度一致的评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14367 2026-06-12 cs.CL cs.AI cs.IR cs.LG 版本更新 83%

InnoEval: On Research Idea Evaluation as a Knowledge-Grounded, Multi-Perspective Reasoning Problem

InnoEval:将研究思路评估视为基于知识的多视角推理问题

Shuofei Qiao, Yunxiang Wei, Xuehai Wang, Bin Wu, Boyang Xue, Ningyu Zhang, Hossein A. Rahmani, Yanshan Wang, Qiang Zhang, Keyan Ding, Jeff Z. Pan, Huajun Chen, Emine Yilmaz

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出InnoEval框架,通过异构深度知识检索和多视角评审委员会,实现基于知识的多维度解耦评估,在点对点、成对和分组评估任务中优于基线方法。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17947 2026-06-09 cs.CR cs.AI cs.CL cs.LG cs.MA 版本更新 83%

PLAGUE: Plug-and-play framework for Lifelong Adaptive Generation of Multi-turn Exploits

PLAGUE:面向多轮利用的终身自适应生成的即插即用框架

Neeladri Bhuiya, Madhav Aggarwal, Diptanshu Purwar

机构 * A10 Networks, Inc.(A10网络公司) University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出PLAGUE框架,通过终身学习启发的三阶段设计(Primer、Planner、Finisher)实现高效多轮越狱攻击,在o3和Opus 4.1等强安全模型上ASR提升超30%。

Comments Accepted in ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24575 2026-08-18 cs.CV cs.AI 版本更新 83%

VFIG: Vectorizing Complex Figures in SVG with Vision-Language Models

VFIG:利用视觉-语言模型矢量化SVG中的复杂图形

Qijia He, Xunmei Liu, Hammaad Memon, Ziang Li, Zixian Ma, Jaemin Cho, Zhongzheng Ren, Daniel S Weld, Ranjay Krishna

机构 * University of Washington(华盛顿大学) Allen Institute for Artificial Intelligence(人工智能 Allen 机构) UNC-Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 评测与基准 :language model(title);SFT(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出VFIG,一种基于视觉-语言模型的矢量化方法,通过大规模数据集和分层训练策略,实现复杂图形到SVG的高保真转换,并在基准测试中取得优异成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14975 2026-08-17 cs.AI 版本更新 83%

CFM-Bench: A Unified Multi-Domain, Multi-Task Benchmark for Channel Foundation Models

CFM-Bench:用于信道基础模型的统一多域、多任务基准测试

Yuan Gao, Wenjun Yu, Jun Jiang, Yunfan Li, Xinyu Guo, Shugong Xu

机构 * School of Communication and Information Engineering, Shanghai University(上海大学通信与信息工程学院) Xi’an Jiaotong-Liverpool University(西交利物浦大学)

专题命中 评测与基准 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 研究针对信道基础模型评估缺乏统一基准的问题,发布CFM-Bench,涵盖多种信道配置、官方分区,规定数据使用规则,组织六个任务组,为比较信道表示跨模型、域和任务的可迁移性提供通用平台。

Comments CFM-Bench dataset download: https://www.chaspark.com/\#/s/CFM-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12090 2026-08-14 cs.LG q-bio.BM 版本更新 83%

Task- and dataset-specific information in protein language models

蛋白质语言模型中特定任务与数据集的信息

Roman Joeres, Ilya Senatorov, Anastasia Kolchina, Dietrich Klakow, Olga V. Kalinina

机构 * Helmholtz Institute for Pharmaceutical Research Saarland(萨尔兰亥姆霍兹药物研究所) Saarland University(萨尔兰大学) Saarland Informatics Campus(萨尔兰信息学园区) Pharma Science Hub(制药科学中心) Medical Faculty, University Hospital Saarland(萨尔兰大学医院医学院)

专题命中 评测与基准 :language model(title,abstract);分类 cs.LG

AI总结 本研究分析13个蛋白质语言模型在15个下游任务上的表现,发现其最后一层嵌入并非最优,任务与数据集特性影响各层嵌入的信息有效性,人工蛋白质任务会显著降低模型性能。

Comments 22 pages, 10 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05224 2026-08-12 cs.AI cs.CY 版本更新 83%

Small Foundation Models of Human Cognition and Behaviour

人类认知与行为的小型基础模型

Nick Oh, Fernand Gobet

专题命中 评测与基准 :foundation model(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究训练不同规模的小型认知微调模型,发现其在分布内表现稳定、分布外泛化需更大模型,且可作为心理学实验噪声上限估计器。

Comments published as a conference paper at COLM'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17162 2026-08-12 cs.AI q-bio.GN 版本更新 83%

JEPA-DNA: Grounding Genomic Foundation Models through Joint-Embedding Predictive Architectures

JEPA-DNA:通过联合嵌入预测架构夯实基因组基础模型

Ariel Larey, Elay Dahan, Amit Bleiweiss, Raizy Kellerman, Guy Leib, Omri Nayshool, Dan Ofer, Tal Zinger, Dan Dominissini, Gideon Rechavi, Nicole Bussola, Simon Lee, Shane O'Connell, Dung Hoang, Marissa Wirth, Alexander W. Charney, Nati Daniel, Yoli Shavit

机构 * Applied AI Architecture, NVIDIA, Israel(NVIDIA应用人工智能架构,以色列) Worldwide Field Ops, NVIDIA, Israel(NVIDIA全球现场运营,以色列) Developer Programs, NVIDIA, Israel(NVIDIA开发者计划,以色列) Cancer Research Center and Wohl Institute of Translational Medicine, Sheba Medical Center, Tel Hashomer, Israel(癌症研究中心和Wohl转化医学研究所,Sheba医疗中心,Tel Hashomer,以色列) Windreich Department of AI and Human Health, Icahn School of Medicine at Mount Sinai, New York, USA(AI与人类健康风reich部门,Mount Sinai医学中心,纽约,美国)

专题命中 评测与基准 :foundation model(title,abstract);language model(abstract);分类 cs.AI

AI总结 提出JEPA-DNA框架,将联合嵌入预测架构与生成式目标结合,通过潜在空间监督全局序列嵌入,实现从令牌恢复到语义对齐的转变,在17项基因组基准任务上提升线性探测和零样本性能,达到新最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22665 2026-08-11 cs.CV cs.AI 版本更新 83%

SARVLM: A Vision Language Foundation Model for Semantic Understanding in SAR Imagery

SARVLM:一种用于SAR图像语义理解的视觉语言基础模型

Qiwei Ma, Xukun Lu, Wang Liu, Puhong Duan, Xudong Kang, Shutao Li

机构 * School of Artificial Intelligence and Robotics, Hunan University(湖南大学人工智能与机器人学院) Yuelushan Center for Industrial Innovation(岳麓山创新中心) School of Medical Information Engineering, Jining Medical University(济南医学院医学信息工程学院)

专题命中 评测与基准 :foundation model(title,abstract);language model(abstract);分类 cs.AI

AI总结 本文提出SARVLM,一种专为SAR图像设计的视觉语言基础模型,通过多阶段领域迁移策略和集成策略提升跨场景泛化能力,在多个基准测试中表现优异。

Comments 13 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26993 2026-07-31 cs.LG 版本更新 83%

Foundation Models for Face Presentation Attack Detection: A Unified Linear-Probing Benchmark

用于人脸呈现攻击检测的基础模型:统一的线性探测基准

Peter Lorenz, Anjith George, Sébastien Marcel

机构 * Idiap Research Institute(Idiap研究所) University of Lausanne (UNIL)(洛桑大学)

专题命中 评测与基准 :foundation model(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 本研究在MCIO基准上评估24种冻结基础模型编码器的线性探测性能,发现其仅通过线性分类器可实现强劲的数据集内PAD性能,但跨数据集迁移能力有限,需明确适配以解决域偏移问题。

Comments accepted at IJCB 2026

详情

展开后加载摘要…

URL PDF HTML 收藏