arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-01 至 2025-12-01 共收录 284 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 52 篇

2511.18192 2025-12-01 cs.CV cs.AI 57%

ARIAL: An Agentic Framework for Document VQA with Precise Answer Localization

ARIAL:一个用于文档视觉问答的代理框架,具有精确答案定位

Ahmad Mohammadshirazi, Pinaki Prasad Guha Neogi, Dheeraj Kulshrestha, Rajiv Ramnath

机构 * Ohio State University(俄亥俄州立大学) Flairsoft(Flairsoft公司)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

AI总结 ARIAL通过代理协调专门工具,实现文档VQA的高精度和可解释性,取得最佳性能和可解释性成果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13361 2025-12-01 cs.CV cs.AI 57%

VLMs have Tunnel Vision: Evaluating Nonlocal Visual Reasoning in Leading VLMs

VLMs有隧道视野:评估领先VLMs的非局部视觉推理能力

Shmuel Berman, Jia Deng

机构 * Princeton University(普林斯顿大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 本文评估了领先VLMs的非局部视觉推理能力,发现其在复杂视觉任务上表现不佳,缺乏人类核心视觉推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22738 2025-12-01 cs.LG cs.CR 57%

ShieldAgent: Shielding Agents via Verifiable Safety Policy Reasoning

ShieldAgent: 通过可验证的安全策略推理实现安全代理

Zhaorun Chen, Mintong Kang, Bo Li

机构 * University of Chicago, Chicago IL, USA(芝加哥大学) University of Illinois at Urbana-Champaign, Champaign IL, USA(伊利诺伊大学厄巴纳-香槟分校)

专题命中 推理与问题求解 :foundation model(abstract);分类 cs.LG

AI总结 ShieldAgent通过逻辑推理实现对代理动作轨迹的安全策略合规性,有效提升代理防护性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22659 2025-12-01 cs.AI cs.CV 57%

Geometrically-Constrained Agent for Spatial Reasoning

几何约束代理用于空间推理

Zeren Chen, Xiaoya Lu, Zhijie Zheng, Pengrui Li, Lehan He, Yijin Zhou, Jing Shao, Bohan Zhuang, Lu Sheng

机构 * School of Software, Beihang University(北京航空航天大学软件学院) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) ZIP Lab, Zhejiang University(浙江大学ZIP实验室)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 Geometrically-Constrained Agent 通过引入正式任务约束,解决视觉语言模型在空间推理中的语义到几何差距问题,实现更稳健的推理路径。

Comments 27 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22532 2025-12-01 cs.CV cs.AI 57%

CoT4AD: A Vision-Language-Action Model with Explicit Chain-of-Thought Reasoning for Autonomous Driving

CoT4AD: 一种具有显式推理链的视觉-语言-动作模型用于自动驾驶

Zhaohui Wang, Tengbo Yu, Hao Tang

机构 * Peking University(北京大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 CoT4AD通过引入显式推理链提升自动驾驶中的视觉-语言-动作模型的推理能力,实现更精确的因果推理和决策。

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21882 2025-12-01 cs.LG cs.CV 57%

Closed-Loop Transformers: Autoregressive Modeling as Iterative Latent Equilibrium

闭环变换器:将自回归建模作为迭代潜在均衡

Akbar Anbar Jafari, Gholamreza Anbarjafari

机构 * University of Tartu(塔尔图大学) S Holding OÜ(3S控股公司)

专题命中 推理与问题求解 :language model(abstract);分类 cs.LG

AI总结 本文提出均衡变换器(EqT),通过迭代细化潜在表示实现自洽均衡,解决自回归模型中错误传播问题,提升长序列推理和多步规划能力。

Comments 22 pages, 1 figure, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01088 2025-12-01 cs.CL 57%

Privacy-Preserving Reasoning with Knowledge-Distilled Parametric Retrieval Augmented Generation

基于知识蒸馏的参数化检索增强生成隐私保护推理

Jinwen Chen, Hainan Zhang, Liang Pang, Yongxin Tong, Haibo Zhou, Yuan Zhan, Wei Lin, Zhiming Zheng

机构 * Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing(北京未来区块链与隐私计算先进创新中心) School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) Meituan(美团)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.CL

AI总结 DistilledPRAG通过知识蒸馏实现高效参数化RAG,提升隐私保护推理的准确性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09185 2025-12-01 cs.CV cs.AI 57%

A Neurosymbolic Framework for Interpretable Cognitive Attack Detection in Augmented Reality

面向增强现实的认知攻击检测的神经符号框架

Rongqian Chen, Allison Andreyev, Yanming Xiu, Joshua Chilukuri, Shunav Sen, Mahdi Imani, Bin Li, Maria Gorlatova, Gang Tan, Tian Lan

机构 * George Washington University(乔治华盛顿大学) Duke University(杜克大学) Pennsylvania State University(宾夕法尼亚州立大学) Northeastern University(东北大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 本文提出CADAR框架,结合神经网络与符号推理,用于增强现实中的认知攻击检测,通过多模态表示和统计推理提升检测的可解释性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23115 2025-12-01 cs.CV 50%

Analyzing Image Beyond Visual Aspect: Image Emotion Classification via Multiple-Affective Captioning

超越视觉层面的图像分析:通过多情感描述进行图像情感分类

Zibo Zhou, Zhengjun Zhai, Huimin Chen, Wei Dai, Hansen Yang

机构 * School of Computer Science, Northwestern Polytechnical University(计算机科学学院,西北工业大学) School of Cybersecurity, Northwestern Polytechnical University(网络安全学院,西北工业大学) School of Electronics and Information, Northwestern Polytechnical University(电子与信息学院,西北工业大学)

专题命中 推理与问题求解 :language model(abstract)

AI总结 本文提出基于多情感描述的图像情感分类方法,通过文本捕捉图像情感信息,有效解决情感差距问题,提升分类性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22974 2025-12-01 cs.CV 50%

McSc: Motion-Corrective Preference Alignment for Video Generation with Self-Critic Hierarchical Reasoning

McSc: 基于自批评分层推理的视频生成运动校正偏好对齐

Qiushi Yang, Yingjie Chen, Yuan Yao, Yifang Men, Huaizhuo Liu, Miaomiao Cui

机构 * Tongyi Lab, Alibaba Group(阿里集团通义实验室)

专题命中 推理与问题求解 :preference optimization(abstract)

AI总结 McSc通过自批评分层推理框架,提升视频生成中对人类偏好的对齐精度,减少对低运动内容的偏见。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19221 2025-12-01 cs.CV cs.RO 50%

Percept-WAM: Perception-Enhanced World-Awareness-Action Model for Robust End-to-End Autonomous Driving

Percept-WAM:感知增强的环境感知-行动模型用于鲁棒的端到端自动驾驶

Jianhua Han, Meng Tian, Jiangtong Zhu, Fan He, Huixin Zhang, Sitong Guo, Dechang Zhu, Hao Tang, Pei Xu, Yuze Guo, Minzhe Niu, Haojie Zhu, Qichao Dong, Xuechao Yan, Siyuan Dong, Lu Hou, Qingqiu Huang, Xiaosong Jia, Hang Xu

机构 * Yinwang Intelligent Technology Co. Ltd.(亿网通智能科技有限公司) Fudan University(复旦大学)

专题命中 推理与问题求解 :language model(abstract)

AI总结 Percept-WAM通过整合2D/3D场景理解能力,提升自动驾驶的感知与行动决策,实现端到端鲁棒性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22172 2025-12-01 cs.CV 50%

Guiding the Inner Eye: A Framework for Hierarchical and Flexible Visual Grounded Reasoning

引导内在之眼:一种用于层次化和灵活的视觉基础推理的框架

Zhaoyang Wei, Wenchao Ding, Yanchao Hao, Xi Chen

机构 * Basic Algorithm Center, PCG, Tencent(腾讯基本算法中心、PCG、腾讯)

专题命中 推理与问题求解 :SFT(abstract)

AI总结 GRiP通过认知增强的强化学习框架,提升视觉基础推理的鲁棒性和灵活性,实现复杂场景下的高性能表现。

Comments 9pages

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 60 篇

2511.22598 2025-12-01 cs.LG 92%

LLM-Cave: A benchmark and light environment for large language models reasoning and decision-making system

LLM-Cave: 一个用于大型语言模型推理和决策系统的基准和轻量环境

Huanyu Li, Zongyuan Li, Wei Huang, Xian Guo

机构 * College of Artificial Intelligence Nankai University(人工智能学院 南开大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 LLM-Cave提出了一种轻量环境和基准,用于评估大型语言模型的推理和决策能力,展示了不同模型在复杂任务中的表现及改进方法。

Comments 8 pages, 5 figures, ICICN 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14222 2025-12-01 cs.AI cs.CL cs.LG stat.OT 90%

A Survey on Large Language Model-based Agents for Statistics and Data Science

关于基于大型语言模型的统计与数据科学代理的综述

Maojun Sun, Ruijian Han, Binyan Jiang, Houduo Qi, Defeng Sun, Yancheng Yuan, Jian Huang

机构 * Department of Data Science and Artificial Intelligence, The Hong Kong Polytechnic University(数据科学与人工智能系,香港理工大学) Department of Applied Mathematics, The Hong Kong Polytechnic University(应用数学系,香港理工大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文综述了基于大型语言模型的数据科学代理的发展、能力和应用,探讨了其设计趋势及实际应用,并提出了未来研究方向。

Journal ref Am. Statist. (2025) 1-14

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21758 2025-12-01 cs.CR cs.AI cs.CY 89%

A Longitudinal Measurement of Privacy Policy Evolution for Large Language Models

大型语言模型隐私政策演变的纵向测量

Zhen Tao, Shidong Pan, Zhenchang Xing, Emily Black, Talia Gillis, Chunyang Chen

机构 * Technical University of Munich(慕尼黑技术大学) Columbia University(哥伦比亚大学) New York University(纽约大学) CSIRO’s Data61(CSIRO的数据61)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文首次对全球主流LLM提供者的隐私政策进行了纵向研究,揭示了隐私政策的演变趋势、内容特征及地区差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22047 2025-12-01 cs.CR 89%

Evaluating the Robustness of Large Language Model Safety Guardrails Against Adversarial Attacks

评估大型语言模型安全防护措施对对抗攻击的鲁棒性

Richard J. Young

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本研究评估了大型语言模型安全防护措施对对抗攻击的鲁棒性,发现模型在未见过的提示上表现显著下降,且存在新的失败模式,强调泛化能力的重要性。

Comments 21 pages, 9 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22016 2025-12-01 cs.CL cs.AI cs.LG 89%

AfriStereo: A Culturally Grounded Dataset for Evaluating Stereotypical Bias in Large Language Models

AfriStereo:一种基于文化背景的数据集,用于评估大型语言模型中的刻板印象偏见

Yann Le Beux, Oluchi Audu, Oche D. Ankeli, Dhananjay Balakrishnan, Melissah Weya, Marie D. Ralaiarinosy, Ignatius Ezeani

专题命中 评测与基准 :language model(title,abstract);large language model(title);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 AfriStereo通过构建基于非洲文化的数据集,评估大型语言模型中的刻板印象偏见,揭示了模型在性别、年龄、职业等维度上的系统性偏见。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17808 2025-12-01 cs.CL 88%

PoETa v2: Toward More Robust Evaluation of Large Language Models in Portuguese

PoETa v2:迈向更稳健的葡萄牙语大型语言模型评估

Thales Sales Almeida, Ramon Pires, Hugo Abonizio, Rodrigo Nogueira, Hélio Pedrini

机构 * Institute of Computing, University of Campinas (UNICAMP)(计算学院,坎皮纳斯大学) School of Electrical and Computer Engineering, University of Campinas (UNICAMP)(电气与计算机工程学院,坎皮纳斯大学) Maritaca AI

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 PoETa v2通过评估超过20个葡萄牙语模型,揭示计算投入和语言适应对性能的影响,并分析与英语任务的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22055 2025-12-01 cs.CV cs.MM 88%

OralGPT-Omni: A Versatile Dental Multimodal Large Language Model

OralGPT-Omni: 一种多功能的牙科多模态大语言模型

Jing Hao, Yuci Liang, Lizhuo Lin, Yuxuan Fan, Wenkai Zhou, Kaixin Guo, Zanting Ye, Yanpeng Sun, Xinyu Zhang, Yanqi Yang, Qiankun Li, Hao Tang, James Kit-Hon Tsoi, Linlin Shen, Kuo Feng Hung

机构 * Faculty of Dentistry, The University of Hong Kong(香港大学牙科学院) College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院) The Hong Kong University of Science and Technology (GZ)(香港科学与技术大学) School of Biomedical Engineering, Southern Medical University(南方医科大学生物医学工程学院) Singapore University of Technology and Design(新加坡科技与设计大学) University of Auckland(奥克兰大学) University of Science and Technology of China(中国科学技术大学) School of Computer Science, Peking University(北京大学计算机学院) College of Artificial Intelligence, Shenzhen University(深圳大学人工智能学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 OralGPT-Omni是一种专门用于牙科的多模态大语言模型,通过TRACE-CoT数据集和四阶段训练范式,实现了对牙科图像的高效分析和高准确率评估。

Comments 47 pages, 42 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.11561 2025-12-01 cs.CV 88%

Teaching Large Language Models to Regress Accurate Image Quality Scores using Score Distribution

利用大规模语言模型回归准确的图像质量评分使用分数分布

Zhiyuan You, Xin Cai, Jinjin Gu, Tianfan Xue, Chao Dong

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) Multimedia Laboratory, The Chinese University of Hong Kong(香港中文大学多媒体实验室) Shanghai AI Laboratory(上海人工智能实验室) Shenzhen University of Advanced Technology(深圳先进技术大学) CPII under InnoHK(创新香港下的CPII)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 本研究提出基于分布的DeQA-Score模型,通过离散化评分分布为软标签,提升图像质量评分的准确性和一致性。

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21761 2025-12-01 cs.CL cs.CY 87%

LLMs for Low-Resource Dialect Translation Using Context-Aware Prompting: A Case Study on Sylheti

基于上下文感知提示的低资源方言翻译中的大语言模型:斯利赫蒂方言案例研究

Tabia Tanzin Prama, Christopher M. Danforth, Peter Sheridan Dodds

专题命中 评测与基准 :prompting(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本研究提出斯利赫蒂-CAP框架,通过上下文感知提示提升低资源方言翻译质量,验证了其在方言特定词汇处理上的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21747 2025-12-01 physics.chem-ph cs.AI cs.LG 86%

QuantumChem-200K: A Large-Scale Open Organic Molecular Dataset for Quantum-Chemistry Property Screening and Language Model Benchmarking

QuantumChem-200K:一个大规模开放有机分子数据集用于量子化学性质筛选和语言模型基准测试

Yinqi Zeng, Renjie Li

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.AI、cs.LG

AI总结 QuantumChem-200K通过提供大规模有机分子数据集和微调语言模型,实现了光引发剂筛选和光敏感材料发现的高效预测。

Comments 9 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21742 2025-12-01 cs.CL cs.AI 86%

EduMod-LLM: A Modular Approach for Designing Flexible and Transparent Educational Assistants

EduMod-LLM: 一种用于设计灵活且透明教育助手的模块化方法

Meenakshi Mittal, Rishi Khare, Mihran Miroyan, Chancharik Mitra, Narges Norouzi

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 EduMod-LLM通过模块化方法评估教育问答系统各组件性能,揭示失败模式,提升透明度和教学对齐效果。

Comments Proceedings of the AAAI Conference on Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02821 2025-12-01 cs.CV cs.AI cs.LG 86%

Sparse Autoencoders Learn Monosemantic Features in Vision-Language Models

稀疏自编码器在视觉-语言模型中学习单义特征

Mateusz Pach, Shyamgopal Karthik, Quentin Bouniot, Serge Belongie, Zeynep Akata

机构 * Technical University of Munich(慕尼黑技术大学) Helmholtz Munich(亥姆霍兹慕尼黑) Munich Center for Machine Learning(慕尼黑机器学习中心) Munich Data Science Institute(慕尼黑数据科学研究所) University of Tübingen(图宾根大学) University of Copenhagen(哥本哈根大学)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究通过稀疏自编码器提升视觉-语言模型中神经元的单义性,展示其在增强模型可解释性和可控性方面的有效性。

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22943 2025-12-01 cs.CL cs.CV 85%

Visual Puns from Idioms: An Iterative LLM-T2IM-MLLM Framework

基于成语的视觉双关:一个迭代的LLM-T2IM-MLLM框架

Kelaiti Xiao, Liang Yang, Dongyu Zhang, Paerhati Tulajiang, Hongfei Lin

机构 * Dalian University of Technology(大连理工大学) Xinjiang Normal University(新疆师范大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出一个迭代框架,结合LLM、T2IM和MLLM,实现基于成语的视觉双关的自动生成与评估,实验表明MLLM选择对性能影响最大。

Comments Submitted to ICASSP 2026 (under review)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22769 2025-12-01 cs.CL 85%

Modeling Romanized Hindi and Bengali: Dataset Creation and Multilingual LLM Integration

构建罗马化印地语和孟加拉语的模型:数据集创建与多语言大语言模型整合

Kanchon Gharami, Quazi Sarwar Muhtaseem, Deepti Gupta, Lavanya Elluri, Shafika Showkat Moni

机构 * Department of EECS, Embry-Riddle Aeronautical University, Daytona Beach, FL, USA(电子工程与科学系,埃姆布里-里德尔航空大学,日落海滩,佛罗里达州,美国) NLP Engineering Team, Hishab Singapore Pte. Ltd, Singapore(自然语言处理工程团队,Hishab新加坡私人有限公司,新加坡) Department of Computer Information Systems, Texas A&M University - Central Texas, Texas, USA(计算机信息系统系,德克萨斯A&M大学-中央德克萨斯分校,德克萨斯州,美国)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出了一种新的转写数据集和定制多语言模型,用于提高罗马化印地语和孟加拉语的转写效果。

Comments Proceedings of the 8th Workshop on Big Data for Cybersecurity (BigCyber)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22275 2025-12-01 cs.AI 85%

RecToM: A Benchmark for Evaluating Machine Theory of Mind in LLM-based Conversational Recommender Systems

RecToM:用于评估基于LLM的对话推荐系统机器理论 of mind 的基准

Mengfan Li, Xuanhua Shi, Yang Deng

机构 * SMU(德克萨斯南方大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 RecToM是一个用于评估基于LLM的对话推荐系统中机器理论 of mind 能力的新基准,重点关注认知推理和行为预测两个维度。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22929 2025-12-01 cs.CV cs.CL 83%

Artwork Interpretation with Vision Language Models: A Case Study on Emotions and Emotion Symbols

用视觉语言模型进行艺术解读:情感与情感符号的案例研究

Sebastian Padó, Kerstin Thomas

机构 * Institute for Natural Language Processing (IMS)(自然语言处理研究所) Institute for Art History (IKG)(艺术史研究所) University of Stuttgart, Germany(斯图加特大学)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文研究了2025年视觉语言模型在艺术情感和符号识别上的表现,发现其在具体图像识别上表现良好,但对抽象或象征性图像及符号识别存在困难。

Comments Accepted for publication at the IJCNLP-AACL workshop on Multimodal Models for Low-Resource Contexts and Social Impact

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19079 2025-12-01 cs.CV cs.AI cs.HC 83%

Reading Smiles: Proxy Bias in Foundation Models for Facial Emotion Recognition

读微笑:面部情绪识别基础模型中的代理偏差

Iosif Tsangko, Andreas Triantafyllopoulos, Adem Abdelmoula, Adria Mallol-Ragolta, Bjoern W. Schuller

机构 * CHI – Chair of Health Informatics, MRI, Technical University of Munich(慕尼黑技术大学健康信息学系) MCML – Munich Center for Machine Learning(慕尼黑机器学习中心) GLAM – Group on Language, Audio, & Music(语言、音频与音乐小组) MDSI – Munich Data Science Institute(慕尼黑数据科学研究所)

专题命中 评测与基准 :foundation model(title,abstract);language model(abstract);分类 cs.AI

AI总结 本文研究了面部情绪识别基础模型中视觉线索的依赖性及潜在偏差,揭示了模型在情绪推理中的内在一致性及公平性风险。

Journal ref IEEE Access, Early Access, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22001 2025-12-01 eess.IV cs.AI cs.CV 83%

When Do Domain-Specific Foundation Models Justify Their Cost? A Systematic Evaluation Across Retinal Imaging Tasks

当领域特定基础模型是否值得其成本?跨视网膜成像任务的系统评估

David Isztl, Tahm Spitznagel, Gabor Mark Somfai, Rui Santos

机构 * Stadtspital Zürich Department of Ophthalmology(苏黎世城市医院眼科部) Spross Research Institute(斯普罗斯研究所)

专题命中 评测与基准 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 本文通过系统评估发现,紧凑型通用模型在大多数视网膜分类任务中表现优异,而专门领域模型仅在特定高难度任务中值得其成本。

详情

展开后加载摘要…

URL PDF HTML 收藏