arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-27 至 2026-01-27 共收录 88 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 88 篇

2601.09028 2026-01-27 cs.CL cs.AI cs.IR 91%

OpenDecoder: Open Large Language Model Decoding to Incorporate Document Quality in RAG

OpenDecoder: 开源大型语言模型解码以纳入文档质量在RAG中

Fengran Mo, Zhan Su, Yuchen Hui, Jinghan Zhang, Jia Ao Sun, Zheyuan Liu, Chao Zhang, Tetsuya Sakai, Jian-Yun Nie

机构 * Clemson University(克莱姆森大学) University of Notre Dame(诺特丹大学) Georgia Institute of Technology(佐治亚理工学院) Waseda University(早稻田大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);post-training(abstract)

AI总结 OpenDecoder通过整合文档质量评估提升RAG模型的鲁棒性,利用相关性、排序和QPP评分优化生成过程。

Comments Accepted by ACM WWW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16444 2026-01-27 cs.CL 90%

Exploring the Effects of Alignment on Numerical Bias in Large Language Models

探索对大型语言模型中数值偏差的影响

Ayako Sato, Hwichan Kim, Zhousi Chen, Masato Mita, Mamoru Komachi

机构 * Tokyo Metropolitan University(东京 Metropolitan 大学) Hitotsubashi University(立命馆大学) CyberAgent Inc.(CyberAgent 公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);instruction tuning(abstract)

AI总结 本文研究了对齐对大型语言模型数值偏差的影响,发现对齐会增加偏差,并提出分数范围调整作为缓解策略。

Comments Accepted at AIBSD 2026 (Workshop at AAAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17344 2026-01-27 cs.CL 90%

The Shadow Self: Intrinsic Value Misalignment in Large Language Model Agents

阴影自我:大型语言模型代理中的内在价值偏差

Chen Chen, Kim Young Il, Yuan Yang, Wenhao Su, Yilin Zhang, Xueluan Gong, Qian Wang, Yongsen Zheng, Ziyao Liu, Kwok-Yan Lam

机构 * Nanyang Technological University(南洋理工大学) Wuhan University(武汉大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 研究提出IMPRESS框架,系统评估大型语言模型代理中的内在价值偏差风险,发现其在不同模型中普遍存在,且受上下文化和框架机制显著影响。

Comments 21 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17312 2026-01-27 cs.CL cs.AI 90%

Meta-Judging with Large Language Models: Concepts, Methods, and Challenges

元评判与大型语言模型:概念、方法与挑战

Hugo Silva, Mateus Mendes, Hugo Gonçalo Oliveira

机构 * University of Coimbra, CISUC/LASI – Centre for Informatics and Systems of the University of Coimbra, Department of Informatics Engineering(科英布拉大学,CISUC/LASI——科英布拉大学信息与系统研究中心,信息工程系) Polytechnic University of Coimbra, Rua da Misericórdia, Lagar dos Cortiços, S. Martinho do Bispo, 3045-093 Coimbra, Portugal(科英布拉理工大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了LLM-as-a-Meta-Judge在提升自动化评估稳定性与可信度方面的潜力,同时指出需解决的成本、提示敏感性及共享偏差等挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18271 2026-01-27 cs.DL cs.CL 89%

Designing large language model prompts to extract scores from messy text: A shared dataset and challenge

设计大型语言模型提示以从杂乱文本中提取分数:一个共享数据集和挑战

Mike Thelwall

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文提出一个共享数据集和挑战,旨在通过设计提示提升大型语言模型从杂乱文本中提取分数的准确性。

Journal ref Trends in Information Management, 13(2), paper 1 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16516 2026-01-27 cs.LG 89%

Rethinking Large Language Models For Irregular Time Series Classification In Critical Care

重新思考用于危重监护中不规则时间序列分类的大型语言模型

Feixiang Zheng, Yu Wu, Cecilia Mascolo, Ting Dang

机构 * The University of Melbourne, Australia(墨尔本大学) University of Cambridge, UK(剑桥大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG

AI总结 本文研究了LLMs在不规则ICU时间序列分类中的有效性,发现编码器设计比对齐策略更重要,但LLMs在训练时间和少样本学习中表现欠佳。

Comments Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01993 2026-01-27 cs.AI 89%

Towards Privacy-Preserving Mental Health Support with Large Language Models

面向隐私保护的大型语言模型在心理健康支持中的应用

Dong Xue, Jicheng Tu, Ming Wang, Xin Yan, Fangzhou Liu, Jie Hu

机构 * IEEE

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出MindChat和MindCorpus,通过多智能体角色扮演框架生成高质量咨询数据,结合联邦学习和差分隐私优化,实现隐私保护的高效心理健康支持系统。

Comments 15 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09493 2026-01-27 cs.IR 89%

Evaluating Conversational Recommender Systems via Large Language Models: A User-Centric Framework

通过大语言模型评估对话推荐系统:一种以用户为中心的框架

Nuo Chen, Quanyu Dai, Xiaoyu Dong, Piaohong Wang, Qinglin Jia, Zhaocheng Du, Zhenhua Dong, Xiao-Ming Wu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文提出CoRE框架,通过大语言模型评估对话推荐系统,结合用户评价和多代理辩论,提升用户体验评估的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18053 2026-01-27 cs.CL cs.AI cs.LG 88%

Addressing LLM Diversity by Infusing Random Concepts

通过注入随机概念来解决LLM多样性问题

Pulin Agrawal, Prasoon Goyal

机构 * Pennsylvania State University(宾夕法尼亚州立大学) Amazon(亚马逊)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本研究通过在提示中注入随机概念提高LLM输出多样性,并提出系统评估协议以更系统地研究LLM多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18554 2026-01-27 cs.AI 88%

Deconstructing Instruction-Following: A New Benchmark for Granular Evaluation of Large Language Model Instruction Compliance Abilities

解构指令遵循:一个用于大语言模型指令合规能力细粒度评估的新基准

Alberto Purpura, Li Wang, Sahil Badyal, Eugenio Beaufrand, Adam Faulkner

机构 * Card Intelligence, Capital One(Card Intelligence,Capital One)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出MOSAIC基准,通过细粒度分析揭示大语言模型在复杂指令遵循中的差异与弱点,为提升模型可靠性提供关键洞察。

Comments Paper accepted to EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21679 2026-01-27 cs.CL cs.CY 88%

JiraiBench: A Bilingual Benchmark for Evaluating Large Language Models' Detection of Human Self-Destructive Behavior Content in Jirai Community

JiraiBench:一个双语基准,用于评估大型语言模型在Jirai社区中检测人类自毁行为内容的效果

Yunze Xiao, Tingyu He, Lionel Z. Wang, Yiming Ma, Xingyu Song, Xiaohang Xu, Mona Diab, Irene Li, Ka Chung Ng

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Washington(华盛顿大学) The Hong Kong Polytechnic University(香港理工大学) The University of Tokyo(东京大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 JiraiBench通过双语评估揭示文化接近性在检测自毁内容中的重要性,展示跨语言知识迁移的潜力。

Comments 20 pages, 1 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18346 2026-01-27 cs.CV 88%

Q-Bench-Portrait: Benchmarking Multimodal Large Language Models on Portrait Image Quality Perception

Q-Bench-Portrait:多模态大语言模型在肖像图像质量感知上的基准测试

Sijing Wu, Yunhao Li, Zicheng Zhang, Qi Jia, Xinyue Li, Huiyu Duan, Xiongkuo Min, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 Q-Bench-Portrait首次提出用于评估多模态大语言模型在肖像图像质量感知上的能力,包含2765个三元组,涵盖多种图像来源和质量维度,评估20个模型后发现其表现有限,与人类判断存在差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18712 2026-01-27 cs.CV 88%

LLaVAction: evaluating and training multi-modal large language models for action understanding

LLaVAction:评估和训练多模态大语言模型进行动作理解

Haozhe Qi, Shaokai Ye, Alexander Mathis, Mackenzie W. Mathis

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 LLaVAction通过引入动作标记和两阶段流程提升多模态大语言模型的动作理解能力,显著提升基准测试性能。

Comments https://github.com/AdaptiveMotorControlLab/LLaVAction

Journal ref International Conference on Learning Representations (ICLR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15436 2026-01-27 cs.AI cs.CL cs.CY 87%

Not Your Typical Sycophant: The Elusive Nature of Sycophancy in Large Language Models

并非典型的阿谀者:在大语言模型中阿谀行为的 elusive 性

Shahar Ben Natan, Oren Tsur

机构 * Ben Gurion University(本· Gurion 大学)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种评估大语言模型阿谀倾向的方法,发现阿谀行为与最近性偏见相互作用,导致建设性干扰效应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18785 2026-01-27 cs.HC cs.AI cs.CL 86%

Design Techniques for LLM-Powered Interactive Storytelling: A Case Study of the Dramamancer System

基于LLM的交互叙事设计技术:Dramamancer系统的案例研究

Tiffany Wang, Yuqian Sun, Yi Wang, Melissa Roemmele, John Joon Young Chung, Max Kreminski

机构 * Midjourney

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 Dramamancer系统利用LLM将作者创建的故事架构转化为玩家驱动的交互叙事,探讨了相关设计技术和评估方法。

Comments Extended abstract presented at the 2025 Wordplay Workshop at EMNLP

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04663 2026-01-27 cs.CL cs.LG cs.MA 86%

Debate, Deliberate, Decide (D3): A Cost-Aware Adversarial Framework for Reliable and Interpretable LLM Evaluation

辩论、 deliberative、决定(D3):一种成本意识的对抗框架,用于可靠且可解释的LLM评估

Abir Harrasse, Chaithanya Bandi, Hari Bandi

机构 * Martian NUS(新加坡国立大学) MIT(麻省理工学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 D3是一种通过结构化辩论和聚合机制提升LLM评估可靠性和可解释性的对抗框架,通过预算停止机制优化成本效率。

Journal ref EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18754 2026-01-27 cs.CR cs.AI 85%

$α^3$-SecBench: A Large-Scale Evaluation Suite of Security, Resilience, and Trust for LLM-based UAV Agents over 6G Networks

$α^3$-SecBench:一个大规模评估套件,用于评估基于LLM的无人机代理在6G网络中的安全、韧性与信任

Mohamed Amine Ferrag, Abderrahmane Lakas, Merouane Debbah

机构 * Department of Computer and Network Engineering, College of Information Technology, United Arab Emirates University(计算机与网络工程系,信息科技学院,阿拉伯联合酋长国大学) Khalifa University of Science and Technology(科学与技术喀拉奇大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 $α^3$-SecBench通过大规模评估基于LLM的无人机代理在6G网络中的安全、韧性和信任,揭示了现有模型在对抗环境下的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18630 2026-01-27 cs.AI cs.HC 85%

Assessing the Quality of Mental Health Support in LLM Responses through Multi-Attribute Human Evaluation

通过多属性人类评估评估LLM响应中的心理健康支持质量

Abeer Badawi, Md Tahmid Rahman Laskar, Elahe Rahimi, Sheri Grach, Lindsay Bertrand, Lames Danok, Frank Rudzicz, Jimmy Huang, Elham Dolatabadi

机构 * York University(约克大学) Vector Institute(向量研究所) Dalhousie University(达尔豪斯大学) IWK Health Hospital(IWK健康医院) King’s College London(伦敦国王学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出通过多属性人类评估方法,评估LLM在心理健康对话中的响应质量,揭示LLMs在认知可靠性与情感一致性方面的差异,并倡导以治疗敏感性为核心的评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01289 2026-01-27 cs.AI cs.GR 85%

OntoMetric: An Ontology-Driven LLM-Assisted Framework for Automated ESG Metric Knowledge Graph Generation

OntoMetric: 一种基于本体的LLM辅助框架,用于自动化生成ESG指标知识图谱

Mingqin Yu, Fethi Rabhi, Boming Xia, Zhengyi Yang, Felix Tan, Qinghua Lu

机构 * School of Computer Science and Engineering, University of New South Wales(新南威尔士大学计算机科学与工程学院) Faculty of Sciences, Engineering and Technology, The University of Adelaide(阿德莱德大学科学、工程与技术学院) School of Information Systems and Technology Management, University of New South Wales(新南威尔士大学信息系统与技术管理学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 OntoMetric通过基于本体的LLM辅助框架,实现了从监管文件中自动化生成ESG指标知识图谱,显著提升语义准确性和模式合规性,同时降低成本并提高效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17348 2026-01-27 cs.AI 85%

Auditing Disability Representation in Vision-Language Models

对视觉-语言模型中残障人表示的审计

Srikant Panda, Sourabh Singh Yadav, Palkesh Malviya

机构 * Lam Research

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);prompting(abstract);分类 cs.AI

AI总结 本文研究了视觉-语言模型在残障人表示上的表现,通过引入残障情境化提示和评估框架,发现残障情境会降低模型解释忠实度,并提出针对性提示和微调方法来改善模型表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17010 2026-01-27 cs.LG stat.AP 85%

Optimizing the Landscape of LLM Embeddings with Dynamic Exploratory Graph Analysis for Generative Psychometrics: A Monte Carlo Study

通过动态探索图分析优化LLM嵌入景观:生成心理测量学的蒙特卡洛研究

Hudson Golino

机构 * University of Virginia(弗吉尼亚大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本研究通过动态探索图分析优化LLM嵌入景观,发现嵌入深度与项目池大小相关,需基于加权复合标准进行优化以平衡准确性和组织性。

Comments 18 pages, 6 figures, conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17817 2026-01-27 cs.CR cs.NI 85%

Multi-Agent Collaborative Intrusion Detection for Low-Altitude Economy IoT: An LLM-Enhanced Agentic AI Framework

多智能体协作入侵检测用于低空经济物联网:一种基于大语言模型的智能AI框架

Hongjuan Li, Hui Kang, Jiahui Li, Geng Sun, Ruichen Zhang, Jiacheng Wang, Dusit Niyato, Wei Ni, Abbas Jamalipour

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出一种基于大语言模型的多智能体协作入侵检测框架,用于提升低空经济物联网的安全性能,实验显示其在多个数据集上达到90%以上的分类准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17540 2026-01-27 cs.CY 85%

Ethical Risk Assessment of the Data Harnessing Process of LLM supported on Consensus of Well-known Multi-Ethical Frameworks

基于知名多伦理框架共识的LLM数据获取过程伦理风险评估

Javed I. Khan, Sharmila Rahman Prithula

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出基于多伦理框架共识的伦理风险评分系统,用于量化评估AI系统数据获取过程的伦理完整性,促进负责任的大语言模型发展。

Journal ref Proceedings of the 38th Canadian Conference on Artificial Intelligence, 2025, Calgary, Canada. Retrieved from https://caiac.pubpub.org/pub/s50xrmxh

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26136 2026-01-27 cs.CL 83%

CliniBench: A Clinical Outcome Prediction Benchmark for Generative and Encoder-Based Language Models

CliniBench: 一种用于生成式和编码器型语言模型的临床结果预测基准

Paul Grundmann, Dennis Fast, Jan Frick, Thomas Steffek, Felix Gers, Wolfgang Nejdl, Alexander Löser

机构 * DATEXIS, Berlin University of Applied Sciences, Berlin, Germany(德累斯顿应用技术大学DATEXIS机构,柏林,德国) Leibniz University Hannover(汉诺威莱布尼茨大学)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 CliniBench通过比较编码器型分类器和生成式LLMs在医疗诊断预测中的表现,揭示编码器型分类器的优越性及检索增强策略对生成式模型的提升作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17814 2026-01-27 cs.AI 83%

MMR-Bench: A Comprehensive Benchmark for Multimodal LLM Routing

MMR-Bench: 多模态大语言模型路由的综合基准

Haoxuan Ma, Guannan Lai, Han-Jia Ye

机构 * School of Artificial Intelligence, Nanjing University(人工智能学院,南京大学) National Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家实验室,南京大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 MMR-Bench提供多模态大语言模型路由的统一基准,通过可控环境和广泛任务集评估路由策略,实验证明多模态信号可提升路由性能并超越单模型表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18951 2026-01-27 cs.DB cs.AI 83%

SWE-SQL: Illuminating LLM Pathways to Solve User SQL Issues in Real-World Applications

SWE-SQL:揭示LLM解决现实应用中用户SQL问题的路径

Jinyang Li, Xiaolong Li, Ge Qu, Per Jacobsson, Bowen Qin, Binyuan Hui, Shuzheng Si, Nan Huo, Xiaohan Xu, Yue Zhang, Ziwei Tang, Yuanshuai Li, Florensia Widjaja, Xintong Zhu, Feige Zhou, Yongfeng Huang, Yannis Papakonstantinou, Fatma Ozcan, Chenhao Ma, Reynold Cheng

机构 * HKU STAR Lab(香港大学STAR实验室) Google Cloud(谷歌云) CUHKSZ(香港中文大学) CUHK(香港中文大学) THU(清华大学) The BIRD Team(BIRD团队)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 SWE-SQL通过引入BIRD-CRITIC基准和Six-Gym训练环境,提升开源模型解决SQL问题的能力,实现对复杂SQL调试任务的突破。

Comments 29 pages, 10 figures, NeurIPS 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11908 2026-01-27 cs.RO 82%

Safe Learning for Contact-Rich Robot Tasks: A Survey from Classical Learning-Based Methods to Safe Foundation Models

接触丰富机器人任务的安全学习:从经典学习方法到安全基础模型的综述

Heng Zhang, Rui Dai, Gokhan Solak, Pokuang Zhou, Yu She, Arash Ajoudani

机构 * Human-Robot Interfaces and Interaction Lab, Istituto Italiano di Tecnologia, Genova, Italy(人类-机器人接口与交互实验室,意大利技术研究院,热那亚,意大利) Ph.D. program of national interest in Robotics and Intelligent Machines (DRIM) and Università di Genova, Genoa, Italy(机器人与智能机器国家利益博士项目(DRIM)和热那亚大学,热那亚,意大利) Edwardson School of Industrial Engineering, Purdue University, West Lafayette, IN, USA(工业工程埃德华森学校,普渡大学,西拉法伊斯,美国)

专题命中 评测与基准 :foundation model(title,abstract);language model(abstract)

AI总结 本文综述了接触丰富机器人任务的安全学习方法,探讨了从经典学习方法到安全基础模型的发展,分析了安全探索与执行的关键技术及未来方向。

Comments version 2

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04192 2026-01-27 cs.CV 82%

PixFoundation: Are We Heading in the Right Direction with Pixel-level Vision Foundation Models?

PixFoundation: 我们在像素级视觉基础模型的方向正确吗?

Mennatullah Siam

专题命中 评测与基准 :foundation model(title);large language model(abstract);language model(abstract)

AI总结 PixFoundation提出新的基准测试,揭示像素级基础模型在视觉问答中的不足,并提出可解释性工具分析接地机制。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16387 2026-01-27 cs.CL cs.AI cs.SD eess.AS 81%

Probing the Hidden Talent of ASR Foundation Models for L2 English Oral Assessment

探测ASR基础模型在二语英语口语评估中的隐藏潜能

Fu-An Chao, Bi-Cheng Yan, Berlin Chen

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文通过探测Whisper模型的隐藏能力,展示了其在二语英语口语评估中的潜力,通过轻量级分类器和辅助线索提升性能。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18250 2026-01-27 cs.CV cs.AI 79%

A multimodal vision foundation model for generalizable knee pathology

一种用于通用膝部病理的多模态视觉基础模型

Kang Yu, Dingyu Wang, Zimu Yuan, Nan Zhou, Jiajun Liu, Jiaxin Liu, Shanggui Liu, Yaoyan Zheng, Huishu Yuan, Di Huang, Dong Jiang

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI

AI总结 OrthoFoundation是一种多模态视觉基础模型,通过自监督学习在膝关节影像上实现高泛化能力,提升骨科影像诊断的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏