arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-11-25 至 2025-11-25 共收录 375 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 50 篇

2505.23518 2025-11-25 cs.AI 57%

TRAP: Targeted Redirecting of Agentic Preferences

TRAP:面向目标的代理偏好重定向

Hangoo Kang, Jehyeok Yeon, Gagandeep Singh

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 TRAP通过语义引导的跨模态操纵,诱导代理AI系统产生一致的选择偏见,揭示了语义层面的安全漏洞。

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18164 2025-11-25 cs.CV cs.AI 57%

Nested Unfolding Network for Real-World Concealed Object Segmentation

嵌套展开网络用于现实世界隐蔽物体分割

Chunming He, Rihan Zhang, Dingming Zhang, Fengyang Xiao, Deng-Ping Fan, Sina Farsiu

机构 * Duke University(杜克大学) Nankai University(南开大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 本文提出嵌套展开网络(NUN),通过解耦恢复与分割并引入自一致性损失,提升现实世界隐蔽物体分割的性能。

Comments 6 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17986 2025-11-25 cs.CV cs.AI 57%

Plan-X: Instruct Video Generation via Semantic Planning

Plan-X: 通过语义规划指导视频生成

Lun Huang, You Xie, Hongyi Xu, Tianpei Gu, Chenxu Zhang, Guoxian Song, Zenan Li, Xiaochen Zhao, Linjie Luo, Guillermo Sapiro

机构 * Duke University(杜克大学) Princeton University(普林斯顿大学) ByteDance Intelligent Creation(字节跳动智能创作) Apple(苹果公司)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 Plan-X通过语义规划框架减少视频生成中的视觉幻觉,实现与多模态上下文一致的精细指令对齐生成。

Comments The project page is at https://byteaigc.github.io/Plan-X

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17597 2025-11-25 cs.HC 50%

SonoCraftAR: Towards Supporting Personalized Authoring of Sound-Reactive AR Interfaces by Deaf and Hard of Hearing Users

SonoCraftAR:面向聋人及听力障碍者个性化声音反应AR界面创作的支持系统

Jaewook Lee, Davin Win Kyi, Leejun Kim, Jenny Peng, Gagyeom Lim, Jeremy Zhengqi Huang, Dhruv Jain, Jon E. Froehlich

专题命中 推理与问题求解 :LLM(abstract)

AI总结 SonoCraftAR通过自然语言输入实现聋人及听力障碍者自定义声音反应AR界面创作,展示开放式的可视化创作可能性及AI辅助的可及性提升。

Journal ref 2025 IEEE International Symposium on Mixed and Augmented Reality Adjunct (ISMAR-Adjunct 2025), pp. 536-540

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 104 篇

2511.18966 2025-11-25 cs.AI cs.CR 92%

LLM-CSEC: Empirical Evaluation of Security in C/C++ Code Generated by Large Language Models

LLM-CSEC: 对大型语言模型生成的C/C++代码安全性的实证评估

Muhammad Usman Shahid, Chuadhry Mujeeb Ahmed, Rajiv Ranjan

机构 * Independent Researcher(独立研究者) Newcastle University(新castle大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本研究评估了大型语言模型生成的C/C++代码安全性,发现存在大量漏洞,强调开发人员需谨慎使用此类代码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15216 2025-11-25 cs.CL cs.CY 92%

Assessing Historical Structural Oppression Worldwide via Rule-Guided Prompting of Large Language Models

通过规则引导提示法评估全球历史结构性压迫

Sreejato Chatterjee, Linh Tran, Quoc Duy Nguyen, Roni Kirson, Drue Hamlin, Harvest Aquino, Hanjia Lyu, Jiebo Luo, Timothy Dye

机构 * Goergen Institute for Data Science(数据科学研究所) University of Rochester(罗切斯特大学) Department of Computer Science(计算机科学系) Department of Economics(经济学系) College of Arts and Sciences(文理学院) Rochester Institute of Technology(罗切斯特理工学院) Department of Sociology and Anthropology(社会学与人类学系) Department of Public Health(公共卫生系) University of Rochester School of Medicine(罗切斯特大学医学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);分类 cs.CL

AI总结 本文提出利用大型语言模型和规则引导提示法,评估全球历史结构性压迫,提供可扩展的跨文化测量工具。

Comments To appear in the 2025 IEEE International Conference on Big Data (IEEE BigData 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19422 2025-11-25 cs.SE cs.AI cs.PL 91%

SLMFix: Leveraging Small Language Models for Error Fixing with Reinforcement Learning

SLMFix:利用小型语言模型通过强化学习进行错误修复

David Jiahao Fu, Aryan Gupta, Aaron Councilman, David Grove, Yu-Xiong Wang, Vikram Adve

专题命中 评测与基准 :language model(title,abstract);small language model(title,abstract);LLM(abstract);large language model(abstract)

AI总结 SLMFix通过强化学习微调小型语言模型,有效修复LLMs生成代码的语法错误,提升领域特定语言代码质量,优于传统微调方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18302 2025-11-25 cs.AI 91%

The Catastrophic Paradox of Human Cognitive Frameworks in Large Language Model Evaluation: A Comprehensive Empirical Analysis of the CHC-LLM Incompatibility

人类认知框架在大语言模型评估中的灾难性悖论:对CHC-LLM不兼容性的全面实证分析

Mohan Reddy

机构 * Stanford University(斯坦福大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(title);分类 cs.AI

AI总结 本研究揭示了人类认知框架与大语言模型评估之间的不兼容性悖论,指出模型在结晶知识任务上的低准确率与高IQ评分的矛盾,提出发展原生机器认知评估框架的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17125 2025-11-25 cs.SE 90%

Large Language Model Unlearning for Source Code

大型语言模型的源代码去学习

Xue Jiang, Yihong Dong, Huangzhao Zhang, Tangxinyu Wang, Zheng Fang, Yingwei Ma, Rongyu Cao, Binhua Li, Zhi Jin, Wenpin Jiao, Yongbin Li, Ge Li

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);post-training(abstract)

AI总结 本研究提出PROD方法,通过精确去学习源代码中的违规片段,提升代码生成的可靠性与安全性。

Comments Accepted to AAAI'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10727 2025-11-25 cs.CL cs.AI 90%

Word-level Annotation of GDPR Transparency Compliance in Privacy Policies using Large Language Models

基于大型语言模型的GDPR透明性合规性隐私政策词级注释

Thomas Cory, Wolf Rieder, Julia Krämer, Philip Raschke, Patrick Herbke, Axel Küpper

机构 * Erasmus University Rotterdam(埃因霍温大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于LLM的隐私政策词级注释方法,用于评估GDPR透明性合规性,通过模块化管道和双层评估提升注释准确性。

Comments Accepted to Proceedings on Privacy Enhancing Technologies (PoPETs) 1 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12183 2025-11-25 cs.CL cs.LG 90%

Leveraging large language models for structured information extraction from pathology reports

利用大型语言模型从病理报告中提取结构化信息

Jeya Balaji Balasubramanian, Daniel Adams, Ioannis Roxanis, Amy Berrington de Gonzalez, Penny Coulson, Jonas S. Almeida, Montserrat García-Closas

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.LG

AI总结 本文提出利用大型语言模型从病理报告中提取结构化信息,通过对比人类标注员和多个LLM模型的准确性,展示了一种可定制、模块化的开源工具,提升病理数据的分析效率和互操作性。

Comments 29 pages, 6 figures

Journal ref J. Pathol. Inform. 19 (2025) 100521

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.19492 2025-11-25 cs.CL cs.AI 90%

MedHalu: Hallucinations in Responses to Healthcare Queries by Large Language Models

MedHalu:大型语言模型在医疗查询中生成幻觉的研究

Vibhor Agarwal, Yiqiao Jin, Mohit Chandra, Munmun De Choudhury, Srijan Kumar, Nishanth Sastry

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 MedHalu研究了LLM在医疗查询中生成幻觉的问题,提出MedHalu基准和MedHaluDetect框架,发现LLM在检测医学幻觉方面表现不佳,提出专家在环方法提升检测效果。

Comments Accepted at ICWSM2026. https://netsys.surrey.ac.uk/datasets/medhalu/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18891 2025-11-25 cs.CL 89%

Reproducibility Study of Large Language Model Bayesian Optimization

大型语言模型贝叶斯优化的可重复性研究

Adam Rychert, Gasper Spagnolo, Evgenii Posashkov

机构 * UL FRI Data Science(UL FRI数据科学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL

AI总结 本研究验证了LLAMBO框架在更换语言模型backbone时的鲁棒性,并展示了其在Llama 3.1 70B上的有效性。

Comments 7 pages, 8 figures. Reproducibility study of the LLAMBO framework (ICLR 2024). Code: https://github.com/spagnoloG/llambo-reproducibility

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18597 2025-11-25 cs.CL 89%

Toward Trustworthy Difficulty Assessments: Large Language Models as Judges in Programming and Synthetic Tasks

迈向可信的难度评估:大型语言模型作为编程和合成任务的裁判

H. M. Shadman Tabib, Jaber Ahmed Deedar

机构 * Department of Computer Science, Bangladesh University of Engineering and Technology(计算机科学系,孟加拉国工程与技术大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文研究了大型语言模型在评估编程问题难度时的可靠性,发现LightGBM在准确性上显著优于GPT-4o,揭示了模型在处理数字约束方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.15687 2025-11-25 cs.AI 89%

A Comprehensive Evaluation of Large Language Models on Mental Illnesses

对大语言模型在心理健康领域应用的全面评估

Abdelrahman Hanafi, Mohammed Saad, Noureldin Zahran, Radwa J. Hanafy, Mohammed E. Fouda

机构 * Compumacy for Artificial Intelligence solutions(人工智能解决方案公司) Department of Behavioural Health- Saint Elizabeths Hospital(行为健康部门-圣伊丽莎白医院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本研究评估了33个大语言模型在心理健康任务中的表现,发现GPT-4和Llama 3在障碍检测中表现优异,同时提示工程对提升模型性能至关重要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18221 2025-11-25 cs.CY cs.AI cs.HC 89%

Enhancing Large Language Models for Automated Homework Assessment in Undergraduate Circuit Analysis

增强大型语言模型以用于大学电路分析课程的自动作业评估

Liangliang Chen, Huiru Xie, Zhihao Qin, Yiming Guo, Jacqueline Rohde, Ying Zhang

机构 * School of Electrical Computer Engineering, Georgia Institute of Technology, Atlanta, USA Corresponding Author. E-mail

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.AI

AI总结 本研究通过多步骤提示和数据增强技术提升GPT-4o在电路分析作业评估中的准确性,使其正确响应率提高至97.70%。

Comments Accepted to 2025 Frontiers in Education (FIE) Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18177 2025-11-25 cs.CL 89%

Rethinking Retrieval: From Traditional Retrieval Augmented Generation to Agentic and Non-Vector Reasoning Systems in the Financial Domain for Large Language Models

重新思考检索:从传统检索增强生成到金融领域大语言模型中的代理和非向量推理系统

Elias Lumer, Matt Melich, Olivia Zino, Elena Kim, Sara Dieter, Pradeep Honaganahalli Basavaraju, Vamse Kumar Subbiah, James A. Burke, Roberto Hernandez

机构 * PricewaterhouseCoopers U.S.(普华永道美国公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文提出基于向量的代理RAG方法,在金融问答中优于非向量方法,通过交叉编码器重排序和小到大块检索显著提升检索精度和回答质量,但需权衡成本性能。

Comments 8 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16654 2025-11-25 cs.CL 89%

Comparison of Text-Based and Image-Based Retrieval in Multimodal Retrieval Augmented Generation Large Language Model Systems

多模态检索增强生成大语言模型系统中基于文本和基于图像的检索比较

Elias Lumer, Alex Cardenas, Matt Melich, Myles Mason, Sara Dieter, Vamse Kumar Subbiah, Pradeep Honaganahalli Basavaraju, Roberto Hernandez

机构 * PricewaterhouseCoopers U.S.(普华永道美国公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文比较了多模态RAG系统中基于文本和基于图像的检索方法,发现直接多模态嵌入检索在性能和准确性上优于基于LLM总结的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02744 2025-11-25 cs.AI 89%

Large Language Model-based Data Science Agent: A Survey

基于大型语言模型的数据科学代理:综述

Ke Chen, Peiran Wang, Yaoning Yu, Xianyang Zhan, Haohan Wang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文综述了基于LLM的数据科学代理,从代理设计和数据科学流程两个角度探讨其关键原则与应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18860 2025-11-25 cs.CL cs.AI 88%

Generating Reading Comprehension Exercises with Large Language Models for Educational Applications

利用大语言模型生成阅读理解练习用于教育应用

Xingyu Huang, Fei Jiang, Jianli Xiao

机构 * School of Optical-Electrical and Computer Engineering, University of Shanghai for Science and Technology, Shanghai, China(光学电子与计算机工程学院,上海理工大学,上海,中国) Chongqing Academy of Science and Technology, Chongqing, China(重庆市科学技术院,重庆,中国)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出RCEG框架,利用大语言模型自动生成高质量、个性化的英语阅读理解练习,通过内容候选生成、判别器筛选和综合评估指标提升练习质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18933 2025-11-25 cs.CR cs.AI 88%

Defending Large Language Models Against Jailbreak Exploits with Responsible AI Considerations

用负责任的AI考虑来防御大型语言模型对抗劫持攻击

Ryan Wong, Hosea David Yu Fei Ng, Dhananjai Sharma, Glenn Jun Jie Ng, Kavishvaran Srinivasan

机构 * National University of Singapore(新加坡国立大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出三种防御策略,通过提示级、logit引导和领域特定代理方法,有效降低大型语言模型的劫持攻击成功率。

Comments 20 pages including appendix; technical report; NeurIPS 2024 style

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18848 2025-11-25 cs.CL 88%

Large Language Models for the Summarization of Czech Documents: From History to the Present

大型语言模型在捷克文件摘要中的应用:从历史到现代

Václav Tran, Jakub Šmíd, Ladislav Lenc, Jean-Pierre Salmon, Pavel Král

机构 * Department of Computer Science and Engineering(计算机科学与工程系) NTIS - New Technologies for the Information Society(信息社会新技术) LaBRI

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文利用大型语言模型和翻译方法,展示了在捷克语历史文档摘要中的新成果,并引入了新的数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17511 2025-11-25 cs.HC cs.AI 88%

A Multidisciplinary Design and Optimization (MDO) Agent Driven by Large Language Models

由大型语言模型驱动的多学科设计与优化(MDO)代理

Bingkun Guo, Wentian Li, Xiaojian Liu, Jiaqi Luo, Zibin Yu, Dalong Dong, Shuyou Zhang, Yiming Zhang

机构 * State Key Laboratory of Fluid Power Transmission and Control(流体动力传动与控制国家重点实验室) School of Aeronautics and Astronautics(航空宇航科学与技术学院) China Ship Development and Design Center(船舶设计发展研究中心)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 由大型语言模型驱动的MDO代理通过参数建模、知识引导和智能协调实现机械设计的自动化与创新。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22688 2025-11-25 cs.SE cs.AI cs.PL 88%

CodeIF-Bench: Evaluating Instruction-Following Capabilities of Large Language Models in Interactive Code Generation

CodeIF-Bench: 评估大型语言模型在交互式代码生成中的指令遵循能力

Peiding Wang, Li Zhang, Fang Liu, Lin Shi, Minxiao Li, Bo Shen, An Fu

机构 * School of Computer Science & Engineering, State Key Laboratory of Complex & Critical Software Environment, Beihang University(计算机科学与工程学院、复杂与关键软件环境国家重点实验室、北京航空航天大学) School of Software, Beihang University(软件学院、北京航空航天大学) Huawei Cloud Computing Technologies Co., Ltd. China(华为云计算技术有限公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 CodeIF-Bench通过九种可验证指令评估LLMs在多轮交互中的指令遵循能力,揭示了上下文管理对性能的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02298 2025-11-25 cs.IR 88%

A Zero-shot Explainable Doctor Ranking Framework with Large Language Models

基于大语言模型的零样本可解释医生排名框架

Ziyang Zeng, Dongyuan Li, Yuqing Yang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出基于大语言模型的零样本可解释医生排名框架,通过动态生成疾病特定的排名标准和逐步推理理由,提升医生排名的透明度和可解释性,并在DrRank数据集上取得显著性能提升。

Comments Accepted by Big Data Mining and Analytics (JCR Q1)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18403 2025-11-25 cs.CY 87%

UnWEIRDing LLM Entity Recommendations

去WEIRD化LLM实体推荐

Aayush Kumar, Sanket Mhatre

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文研究了LLM在现实世界实体推荐中的文化偏见,通过WEIRD框架评估并应用多元提示策略以减轻偏见,发现不同模型的偏见减轻效果不一致。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23799 2025-11-25 cs.CL cs.AI cs.HC cs.LG 87%

Estimating LLM Consistency: A User Baseline vs Surrogate Metrics

估计LLM一致性:用户基准与替代指标

Xiaoyuan Wu, Weiran Lin, Omer Akgul, Lujo Bauer

机构 * Carnegie Mellon University(卡内基梅隆大学) RSAC Labs(RSAC实验室)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种基于logits的集成方法,用于估计LLM一致性,并展示了其在匹配人类评分方面与现有最佳指标相当。

Comments Published as a main conference paper at EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15289 2025-11-25 cs.CR cs.AI cs.CL 86%

SATA: A Paradigm for LLM Jailbreak via Simple Assistive Task Linkage

SATA: 一种通过简单辅助任务链接实现LLM劫持的范式

Xiaoning Dong, Wenbo Hu, Wei Xu, Tianxing He

机构 * Tsinghua University(清华大学) Shanghai Qi Zhi Institute(上海启智研究院) Hefei University of Technology(合肥工业大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 SATA通过简单辅助任务链接实现LLM劫持,有效绕过安全措施并提升攻击成功率

Comments ACL Findings 2025. Welcome to employ SATA as a baseline

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.08426 2025-11-25 cs.CL cs.AI cs.DB 86%

Next-Generation Database Interfaces: A Survey of LLM-based Text-to-SQL

下一代数据库接口:基于大语言模型的文本到SQL调研

Zijin Hong, Zheng Yuan, Qinggang Zhang, Hao Chen, Junnan Dong, Feiran Huang, Xiao Huang

机构 * Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系) Faculty of Data Science, City University of Macau(澳门城市大学数据科学学院) College of Cyber Security, Jinan University(暨南大学网络安全学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文调研了基于大语言模型的文本到SQL方法,分析了技术挑战、数据集、指标及最新进展,并讨论了未来研究方向。

Comments Accepted to IEEE TKDE2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19659 2025-11-25 cs.CV 85%

Bias in the Picture: Benchmarking VLMs with Social-Cue News Images and LLM-as-Judge Assessment

图像中的偏见:使用社会线索新闻图像和LLM作为裁判的基准测试

Aravind Narayanan, Vahid Reza Khazaie, Shaina Raza

机构 * Vector Institute for AI(向量人工智能研究院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文通过社会线索新闻图像基准测试,揭示了VLMs在视觉上下文中存在系统性偏见,特别是性别和职业属性,指出高忠实度并不必然降低偏见,提出公平的多模态评估方法。

Comments Accepted to NeurIPS 2025 Workshop (Evaluating the Evolving LLM Lifecycle)

详情

展开后加载摘要…

URL PDF HTML 收藏