arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-01 至 2025-12-01 共收录 60 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 60 篇

2511.22598 2025-12-01 cs.LG 92%

LLM-Cave: A benchmark and light environment for large language models reasoning and decision-making system

LLM-Cave: 一个用于大型语言模型推理和决策系统的基准和轻量环境

Huanyu Li, Zongyuan Li, Wei Huang, Xian Guo

机构 * College of Artificial Intelligence Nankai University(人工智能学院 南开大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 LLM-Cave提出了一种轻量环境和基准,用于评估大型语言模型的推理和决策能力,展示了不同模型在复杂任务中的表现及改进方法。

Comments 8 pages, 5 figures, ICICN 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14222 2025-12-01 cs.AI cs.CL cs.LG stat.OT 90%

A Survey on Large Language Model-based Agents for Statistics and Data Science

关于基于大型语言模型的统计与数据科学代理的综述

Maojun Sun, Ruijian Han, Binyan Jiang, Houduo Qi, Defeng Sun, Yancheng Yuan, Jian Huang

机构 * Department of Data Science and Artificial Intelligence, The Hong Kong Polytechnic University(数据科学与人工智能系,香港理工大学) Department of Applied Mathematics, The Hong Kong Polytechnic University(应用数学系,香港理工大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文综述了基于大型语言模型的数据科学代理的发展、能力和应用,探讨了其设计趋势及实际应用,并提出了未来研究方向。

Journal ref Am. Statist. (2025) 1-14

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21758 2025-12-01 cs.CR cs.AI cs.CY 89%

A Longitudinal Measurement of Privacy Policy Evolution for Large Language Models

大型语言模型隐私政策演变的纵向测量

Zhen Tao, Shidong Pan, Zhenchang Xing, Emily Black, Talia Gillis, Chunyang Chen

机构 * Technical University of Munich(慕尼黑技术大学) Columbia University(哥伦比亚大学) New York University(纽约大学) CSIRO’s Data61(CSIRO的数据61)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文首次对全球主流LLM提供者的隐私政策进行了纵向研究,揭示了隐私政策的演变趋势、内容特征及地区差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22047 2025-12-01 cs.CR 89%

Evaluating the Robustness of Large Language Model Safety Guardrails Against Adversarial Attacks

评估大型语言模型安全防护措施对对抗攻击的鲁棒性

Richard J. Young

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本研究评估了大型语言模型安全防护措施对对抗攻击的鲁棒性,发现模型在未见过的提示上表现显著下降,且存在新的失败模式,强调泛化能力的重要性。

Comments 21 pages, 9 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22016 2025-12-01 cs.CL cs.AI cs.LG 89%

AfriStereo: A Culturally Grounded Dataset for Evaluating Stereotypical Bias in Large Language Models

AfriStereo:一种基于文化背景的数据集,用于评估大型语言模型中的刻板印象偏见

Yann Le Beux, Oluchi Audu, Oche D. Ankeli, Dhananjay Balakrishnan, Melissah Weya, Marie D. Ralaiarinosy, Ignatius Ezeani

专题命中 评测与基准 :language model(title,abstract);large language model(title);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 AfriStereo通过构建基于非洲文化的数据集,评估大型语言模型中的刻板印象偏见,揭示了模型在性别、年龄、职业等维度上的系统性偏见。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17808 2025-12-01 cs.CL 88%

PoETa v2: Toward More Robust Evaluation of Large Language Models in Portuguese

PoETa v2:迈向更稳健的葡萄牙语大型语言模型评估

Thales Sales Almeida, Ramon Pires, Hugo Abonizio, Rodrigo Nogueira, Hélio Pedrini

机构 * Institute of Computing, University of Campinas (UNICAMP)(计算学院,坎皮纳斯大学) School of Electrical and Computer Engineering, University of Campinas (UNICAMP)(电气与计算机工程学院,坎皮纳斯大学) Maritaca AI

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 PoETa v2通过评估超过20个葡萄牙语模型,揭示计算投入和语言适应对性能的影响,并分析与英语任务的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22055 2025-12-01 cs.CV cs.MM 88%

OralGPT-Omni: A Versatile Dental Multimodal Large Language Model

OralGPT-Omni: 一种多功能的牙科多模态大语言模型

Jing Hao, Yuci Liang, Lizhuo Lin, Yuxuan Fan, Wenkai Zhou, Kaixin Guo, Zanting Ye, Yanpeng Sun, Xinyu Zhang, Yanqi Yang, Qiankun Li, Hao Tang, James Kit-Hon Tsoi, Linlin Shen, Kuo Feng Hung

机构 * Faculty of Dentistry, The University of Hong Kong(香港大学牙科学院) College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院) The Hong Kong University of Science and Technology (GZ)(香港科学与技术大学) School of Biomedical Engineering, Southern Medical University(南方医科大学生物医学工程学院) Singapore University of Technology and Design(新加坡科技与设计大学) University of Auckland(奥克兰大学) University of Science and Technology of China(中国科学技术大学) School of Computer Science, Peking University(北京大学计算机学院) College of Artificial Intelligence, Shenzhen University(深圳大学人工智能学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 OralGPT-Omni是一种专门用于牙科的多模态大语言模型,通过TRACE-CoT数据集和四阶段训练范式,实现了对牙科图像的高效分析和高准确率评估。

Comments 47 pages, 42 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.11561 2025-12-01 cs.CV 88%

Teaching Large Language Models to Regress Accurate Image Quality Scores using Score Distribution

利用大规模语言模型回归准确的图像质量评分使用分数分布

Zhiyuan You, Xin Cai, Jinjin Gu, Tianfan Xue, Chao Dong

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) Multimedia Laboratory, The Chinese University of Hong Kong(香港中文大学多媒体实验室) Shanghai AI Laboratory(上海人工智能实验室) Shenzhen University of Advanced Technology(深圳先进技术大学) CPII under InnoHK(创新香港下的CPII)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 本研究提出基于分布的DeQA-Score模型,通过离散化评分分布为软标签,提升图像质量评分的准确性和一致性。

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21761 2025-12-01 cs.CL cs.CY 87%

LLMs for Low-Resource Dialect Translation Using Context-Aware Prompting: A Case Study on Sylheti

基于上下文感知提示的低资源方言翻译中的大语言模型:斯利赫蒂方言案例研究

Tabia Tanzin Prama, Christopher M. Danforth, Peter Sheridan Dodds

专题命中 评测与基准 :prompting(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本研究提出斯利赫蒂-CAP框架,通过上下文感知提示提升低资源方言翻译质量,验证了其在方言特定词汇处理上的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21747 2025-12-01 physics.chem-ph cs.AI cs.LG 86%

QuantumChem-200K: A Large-Scale Open Organic Molecular Dataset for Quantum-Chemistry Property Screening and Language Model Benchmarking

QuantumChem-200K:一个大规模开放有机分子数据集用于量子化学性质筛选和语言模型基准测试

Yinqi Zeng, Renjie Li

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.AI、cs.LG

AI总结 QuantumChem-200K通过提供大规模有机分子数据集和微调语言模型,实现了光引发剂筛选和光敏感材料发现的高效预测。

Comments 9 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21742 2025-12-01 cs.CL cs.AI 86%

EduMod-LLM: A Modular Approach for Designing Flexible and Transparent Educational Assistants

EduMod-LLM: 一种用于设计灵活且透明教育助手的模块化方法

Meenakshi Mittal, Rishi Khare, Mihran Miroyan, Chancharik Mitra, Narges Norouzi

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 EduMod-LLM通过模块化方法评估教育问答系统各组件性能,揭示失败模式,提升透明度和教学对齐效果。

Comments Proceedings of the AAAI Conference on Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02821 2025-12-01 cs.CV cs.AI cs.LG 86%

Sparse Autoencoders Learn Monosemantic Features in Vision-Language Models

稀疏自编码器在视觉-语言模型中学习单义特征

Mateusz Pach, Shyamgopal Karthik, Quentin Bouniot, Serge Belongie, Zeynep Akata

机构 * Technical University of Munich(慕尼黑技术大学) Helmholtz Munich(亥姆霍兹慕尼黑) Munich Center for Machine Learning(慕尼黑机器学习中心) Munich Data Science Institute(慕尼黑数据科学研究所) University of Tübingen(图宾根大学) University of Copenhagen(哥本哈根大学)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究通过稀疏自编码器提升视觉-语言模型中神经元的单义性,展示其在增强模型可解释性和可控性方面的有效性。

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22943 2025-12-01 cs.CL cs.CV 85%

Visual Puns from Idioms: An Iterative LLM-T2IM-MLLM Framework

基于成语的视觉双关:一个迭代的LLM-T2IM-MLLM框架

Kelaiti Xiao, Liang Yang, Dongyu Zhang, Paerhati Tulajiang, Hongfei Lin

机构 * Dalian University of Technology(大连理工大学) Xinjiang Normal University(新疆师范大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出一个迭代框架,结合LLM、T2IM和MLLM,实现基于成语的视觉双关的自动生成与评估,实验表明MLLM选择对性能影响最大。

Comments Submitted to ICASSP 2026 (under review)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22769 2025-12-01 cs.CL 85%

Modeling Romanized Hindi and Bengali: Dataset Creation and Multilingual LLM Integration

构建罗马化印地语和孟加拉语的模型:数据集创建与多语言大语言模型整合

Kanchon Gharami, Quazi Sarwar Muhtaseem, Deepti Gupta, Lavanya Elluri, Shafika Showkat Moni

机构 * Department of EECS, Embry-Riddle Aeronautical University, Daytona Beach, FL, USA(电子工程与科学系,埃姆布里-里德尔航空大学,日落海滩,佛罗里达州,美国) NLP Engineering Team, Hishab Singapore Pte. Ltd, Singapore(自然语言处理工程团队,Hishab新加坡私人有限公司,新加坡) Department of Computer Information Systems, Texas A&M University - Central Texas, Texas, USA(计算机信息系统系,德克萨斯A&M大学-中央德克萨斯分校,德克萨斯州,美国)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出了一种新的转写数据集和定制多语言模型,用于提高罗马化印地语和孟加拉语的转写效果。

Comments Proceedings of the 8th Workshop on Big Data for Cybersecurity (BigCyber)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22275 2025-12-01 cs.AI 85%

RecToM: A Benchmark for Evaluating Machine Theory of Mind in LLM-based Conversational Recommender Systems

RecToM:用于评估基于LLM的对话推荐系统机器理论 of mind 的基准

Mengfan Li, Xuanhua Shi, Yang Deng

机构 * SMU(德克萨斯南方大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 RecToM是一个用于评估基于LLM的对话推荐系统中机器理论 of mind 能力的新基准,重点关注认知推理和行为预测两个维度。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22929 2025-12-01 cs.CV cs.CL 83%

Artwork Interpretation with Vision Language Models: A Case Study on Emotions and Emotion Symbols

用视觉语言模型进行艺术解读:情感与情感符号的案例研究

Sebastian Padó, Kerstin Thomas

机构 * Institute for Natural Language Processing (IMS)(自然语言处理研究所) Institute for Art History (IKG)(艺术史研究所) University of Stuttgart, Germany(斯图加特大学)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文研究了2025年视觉语言模型在艺术情感和符号识别上的表现,发现其在具体图像识别上表现良好,但对抽象或象征性图像及符号识别存在困难。

Comments Accepted for publication at the IJCNLP-AACL workshop on Multimodal Models for Low-Resource Contexts and Social Impact

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19079 2025-12-01 cs.CV cs.AI cs.HC 83%

Reading Smiles: Proxy Bias in Foundation Models for Facial Emotion Recognition

读微笑:面部情绪识别基础模型中的代理偏差

Iosif Tsangko, Andreas Triantafyllopoulos, Adem Abdelmoula, Adria Mallol-Ragolta, Bjoern W. Schuller

机构 * CHI – Chair of Health Informatics, MRI, Technical University of Munich(慕尼黑技术大学健康信息学系) MCML – Munich Center for Machine Learning(慕尼黑机器学习中心) GLAM – Group on Language, Audio, & Music(语言、音频与音乐小组) MDSI – Munich Data Science Institute(慕尼黑数据科学研究所)

专题命中 评测与基准 :foundation model(title,abstract);language model(abstract);分类 cs.AI

AI总结 本文研究了面部情绪识别基础模型中视觉线索的依赖性及潜在偏差,揭示了模型在情绪推理中的内在一致性及公平性风险。

Journal ref IEEE Access, Early Access, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22001 2025-12-01 eess.IV cs.AI cs.CV 83%

When Do Domain-Specific Foundation Models Justify Their Cost? A Systematic Evaluation Across Retinal Imaging Tasks

当领域特定基础模型是否值得其成本?跨视网膜成像任务的系统评估

David Isztl, Tahm Spitznagel, Gabor Mark Somfai, Rui Santos

机构 * Stadtspital Zürich Department of Ophthalmology(苏黎世城市医院眼科部) Spross Research Institute(斯普罗斯研究所)

专题命中 评测与基准 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 本文通过系统评估发现,紧凑型通用模型在大多数视网膜分类任务中表现优异,而专门领域模型仅在特定高难度任务中值得其成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17554 2025-12-01 cs.CY cs.CL 83%

Beyond the Rubric: Cultural Misalignment in LLM Benchmarks for Sexual and Reproductive Health

超越标准:性与生殖健康LLM基准测试中的文化错位

Sumon Kanti Dey, Manvi S, Zeel Mehta, Meet Shah, Unnati Agrawal, Suhani Jalota, Azra Ismail

机构 * Emory University(埃默里大学) Hoover Institution(霍夫曼研究所) Myna Mahila Foundation(米娜妇女基金会)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文指出现有LLM基准测试在性与生殖健康领域存在文化偏见,提出需开发适应不同文化需求的评估框架。

Comments https://github.com/Sumon/healthbench-srh-eval/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21788 2025-12-01 cs.SE 82%

Code Refactoring with LLM: A Comprehensive Evaluation With Few-Shot Settings

基于LLM的代码重构:结合少样本设置的全面评估

Md. Raihan Tapader, Md. Mostafizer Rahman, Ariful Islam Shiplu, Md Faizul Ibne Amin, Yutaka Watanobe

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract)

AI总结 本研究提出基于LLM的多语言代码重构框架,通过少样本学习和提示工程提升重构准确性与效率,实验显示Java在正确性与可编译性上表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21730 2025-12-01 cs.CL cs.AI cs.LG 82%

A Benchmark for Procedural Memory Retrieval in Language Agents

一种用于语言代理中程序记忆检索的基准测试

Ishant Kohar, Aswanth Krishnan

机构 * Qpi AI

专题命中 评测与基准 :language agent(title);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种用于评估语言代理程序记忆检索能力的基准测试,通过构建双语料库和系统分层查询,揭示了基于嵌入的方法在新上下文中的泛化问题,并展示了LLM生成的程序抽象在跨上下文转移中的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20737 2025-12-01 cs.CV cs.AI cs.CL 81%

CANVAS: A Benchmark for Vision-Language Models on Tool-Based User Interface Design

CANVAS:基于工具的用户界面设计的视觉-语言模型基准

Daeheon Jeong, Seoyeon Byun, Kihoon Son, Dae Hyun Kim, Juho Kim

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 CANVAS是一个用于评估视觉-语言模型在基于工具的用户界面设计任务中性能的基准,通过复制和修改UI设计任务来测试模型的工具调用能力和设计质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21843 2025-12-01 cs.CL cs.AI cs.DL cs.LG 80%

FLAWS: A Benchmark for Error Identification and Localization in Scientific Papers

FLAWS: 一个用于科学论文中错误识别和定位的基准

Sarina Xi, Vishisht Rao, Justin Payan, Nihar B. Shah

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 FLAWS基准通过713篇论文错误对评估LLMs在识别和定位科学论文中关键主张错误的能力,GPT 5在k=10时达到39.1%的识别准确率。

Comments 30 pages, 12 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00202 2025-12-01 cs.LG 79%

RouterArena: An Open Platform for Comprehensive Comparison of LLM Routers

RouterArena: 一个用于全面比较大语言模型路由器的开放平台

Yifan Lu, Rixin Liu, Jiayi Yuan, Xingqi Cui, Shenrun Zhang, Hongyi Liu, Jiarong Xing

机构 * Rice University(里士大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.LG

AI总结 RouterArena是一个开放平台,用于全面比较大语言模型路由器,提供广泛的数据集、可区分的难度级别、广泛的评估指标和自动化的排行榜更新框架。

Comments 22 pages, 13 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26347 2025-12-01 cs.AI 79%

Uncovering Zero-Shot Generalization Gaps in Time-Series Foundation Models Using Real-World Videos

通过真实世界视频揭示时间序列基础模型的零样本泛化差距

Lujun Li, Lama Sleem, Yiqun Wang, Yangjie Xu, Niccolò Gentile, Radu State

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI

AI总结 本文提出REAL-V-TSFM数据集,通过真实世界视频提取时间序列,揭示现有时间序列基础模型在零样本预测中的泛化能力不足问题。

Comments This paper has been accepted by Artificial Intelligence for Time Series Analysis (AI4TS) Workshop @ AAAI 2026: Theory, Algorithms, and Applications

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22448 2025-12-01 cs.AI cs.IR 79%

Structured Extraction from Business Process Diagrams Using Vision-Language Models

使用视觉-语言模型从业务流程图中提取结构

Pritam Deka, Barry Devereux

机构 * Queen's University Belfast(女王大学贝尔法斯特)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 本文提出使用视觉-语言模型和OCR技术从BPMN图像中提取结构化数据,无需源文件或文本注释。

Comments To appear in the Proceedings of the 2026 ACM Symposium on Applied Computing (SAC '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22312 2025-12-01 cs.CL 79%

Token-Level Marginalization for Multi-Label LLM Classifiers

标记级边际化用于多标签LLM分类器

Anjaneya Praharaj, Jaykumar Kasundra

机构 * ServiceNow

专题命中 评测与基准 :LLM(title);language model(abstract);分类 cs.CL

AI总结 本文提出三种标记级概率估计方法,提升生成模型在多标签内容安全分类中的可解释性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22131 2025-12-01 cs.CV cs.LG physics.med-ph 79%

Autonomous labeling of surgical resection margins using a foundation model

利用基础模型实现手术切除边缘的自主标注

Xilin Yang, Musa Aydin, Yuhong Lu, Sahan Yoruc Selcuk, Bijie Bai, Yijie Zhang, Andrew Birkeland, Katjana Ehrlich, Julien Bec, Laura Marcu, Nir Pillar, Aydogan Ozcan

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 本文提出了一种基于基础模型的虚拟勾画网络,用于自主标注手术切除边缘,提升了病理分析的准确性和可重复性。

Comments 20 Pages, 5 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21982 2025-12-01 cs.CV cs.AI 79%

DialBench: Towards Accurate Reading Recognition of Pointer Meter using Large Foundation Models

DialBench: 通过大基础模型实现指针表盘读数的准确识别

Futian Wang, Chaoliu Weng, Xiao Wang, Zhen Chen, Zhicheng Zhao, Jin Tang

机构 * School of Computer Science and Technology, Anhui University, Hefei 230601, China(安徽大学计算机科学与技术学院) School of Artificial Intelligence, Anhui University, Hefei 230601, China(安徽大学人工智能学院) Department of Computer Science and Information Technology, La Trobe University, Bendigo, Australia(拉筹伯大学计算机科学与信息技术系)

专题命中 评测与基准 :foundation model(title);language model(abstract);分类 cs.AI

AI总结 本文提出DialBench基准数据集和MRLM模型,通过物理关系注入提升指针表盘读数识别的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23101 2025-12-01 cs.CL cs.AI 79%

Mind Reading or Misreading? LLMs on the Big Five Personality Test

心念识读还是误读?LLMs在Big Five人格测试中的表现

Francesco Di Cursi, Chiara Boldrini, Marco Conti, Andrea Passarella

机构 * IIT-CNR(意大利理工学院-国家研究委员会)

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 研究评估了LLMs在Big Five人格测试中的表现,发现增强提示虽能提升性能但引入系统偏见,不同特质检测难度差异显著,需协调提示设计与评估指标以获得可解释结果。

Comments Funding: SoBigDatait (IR0000013), FAIR (PE00000013), ICSC (CN00000013)

详情

展开后加载摘要…

URL PDF HTML 收藏