arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32335 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32335 篇

2603.04033 2026-03-05 cs.CL 87%

Who Judges the Judge? Evaluating LLM-as-a-Judge for French Medical open-ended QA

谁评判法官?评估LLM作为法官在法语医学开放性问答中的表现

Ikram Belmadani, Oumaima El Khettari, Pacôme Constant dit Beaufils, Richard Dufour, Benoit Favre

机构 * Aix-Marseille Univ., CNRS, LIS UMR 7020(艾克斯-马赛大学,法国国家科学研究中心,LIS UMR 7020) Nantes Univ., École Centrale Nantes, CNRS, LS2N, UMR 6004(南特大学,中央理工学院南特校区,法国国家科学研究中心,LS2N,UMR 6004) Nantes Université, CHU Nantes, PHU 11: Santé Publique, Clinique des données, INSERM, CIC 1413(南特大学,南特大学医院,PHU 11:公共卫生,数据诊所,法国国家卫生与医学研究院,CIC 1413) Nantes Université, CNRS, INSERM, L’institut du thorax(南特大学,法国国家科学研究中心,法国国家卫生与医学研究院,胸科研究所) Université Grenoble Alpes, CNRS, INRIA, Grenoble INP, LIG UMR 5217(格勒诺布尔阿尔卑斯大学,法国国家科学研究中心,INRIA,格勒诺布尔INP,LIG UMR 5217)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 本研究评估了LLM在法语医学开放性问答中作为评判者的有效性,发现领域适应模型在与专家注释一致方面表现最佳,并通过微调和GRPO提升了性能。

Comments Accepted in HeaLing Workshop - EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01778 2026-03-03 cs.CL 87%

LLM-as-an-Annotator: Training Lightweight Models with LLM-Annotated Examples for Aspect Sentiment Tuple Prediction

LLM-as-Annotator: 利用LLM标注示例训练轻量模型进行方面情感元组预测

Nils Constantin Hellwig, Jakob Fehle, Udo Kruschwitz, Christian Wolff

机构 * Media Informatics Group, University of Regensburg, Regensburg, Germany(莱茵河畔大学媒体信息学组) Information Science Group, University of Regensburg, Regensburg, Germany(莱茵河畔大学信息科学组)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出LA-ABSA方法,利用LLM生成的标注示例训练轻量模型,以高效完成复杂的情感分析任务。

Comments Accepted for publication at LREC 2026. Final version will appear in the ACL Anthology

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14970 2026-02-17 cs.CL 87%

Counterfactual Fairness Evaluation of LLM-Based Contact Center Agent Quality Assurance System

基于大语言模型的客服代理质量保障系统的反事实公平性评估

Kawin Mayilvaghanan, Siddhant Gupta, Ayush Kumar

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文研究了基于大语言模型的客服代理质量保障系统在公平性方面的表现,发现系统性偏见问题,指出需标准化的公平性审计流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14081 2026-02-17 cs.CL 87%

CCiV: A Benchmark for Structure, Rhythm and Quality in LLM-Generated Chinese \textit{Ci} Poetry

CCiV: 一个用于评估LLM生成中文词诗结构、节奏和质量的基准

Shangqing Zhao, Yupei Ren, Yuhao Zhou, Xiaopeng Bai, Man Lan

机构 * School of Computer Science and Technology, East China Normal University, China(东华师范大学计算机科学与技术学院) Shanghai Institute of Artificial Intelligence for Education, East China Normal University, China(东华师范大学教育人工智能研究所) Department of Chinese Language and Literature, East China Normal University, China(东华师范大学中文语言文学系)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 CCiV基准通过评估LLM生成中文词诗的结构、节奏和质量,揭示了模型在生成词派变体时的挑战,并强调了需要更全面的受约束创造性生成方法。

Comments ARR 2025 May and Icassp 2026 submission. Working in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02076 2026-02-11 cs.AI cs.MA 87%

Leveraging LLM Agents and Digital Twins for Fault Handling in Process Plants

利用大语言模型代理和数字孪生进行过程厂故障处理

Milapji Singh Gill, Javal Vyas, Artan Markaj, Felix Gehlhoff, Mehmet Mercangöz

机构 * Institute of Automation Technology Helmut Schmidt University Hamburg(海因里希·施密特大学汉堡自动化技术研究所) Autonomous Industrial Systems Lab, Imperial College London(伦敦帝国理工学院自主工业系统实验室)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出利用大语言模型代理和数字孪生技术,实现过程厂故障的自动处理与纠正,通过模拟验证有效缓解管道堵塞问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01474 2026-02-10 cs.AI 87%

AIReg-Bench: Benchmarking Language Models That Assess AI Regulation Compliance

AIReg-Bench: 用于评估AI监管合规性的语言模型基准测试

Bill Marino, Rosco Hunter, Christoph Schnabl, Zubair Jamali, Marinos Emmanouil Kalpakos, Mudra Kashyap, Isaiah Hinton, Alexa Hanson, Maahum Nazir, Felix Steffek, Hongkai Wen, Nicholas D. Lane

机构 * University of Cambridge(剑桥大学) University of Warwick(沃里克大学) University of Luxembourg(卢森堡大学)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);prompting(abstract)

AI总结 AIReg-Bench是一个用于评估语言模型在AI监管合规性评估方面性能的基准数据集,通过生成虚构AI系统样本并由法律专家标注,为LLM的合规性评估提供测试基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10415 2026-02-04 cs.SE cs.AI 87%

How to Trick Your AI TA: A Systematic Study of Academic Jailbreaking in LLM Code Evaluation

如何欺骗你的AI助教:对LLM代码评估中学术劫持的系统研究

Devanshu Sahoo, Vasudev Majhi, Arjun Neekhra, Yash Sinha, Murari Mandal, Dhruv Kumar

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文研究了学术情境中针对LLM代码评估器的劫持攻击,提出了一种新的攻击类型,并通过实验揭示了LLM在面对此类攻击时的脆弱性。

Comments This manuscript has been withdrawn by the authors because the methodology and results have been superseded by a more rigorous framework (SPACI and AST-ASIP). The corrected and expanded findings are now available in arXiv:2601.21360. Please cite the new manuscript instead

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18949 2026-01-28 cs.SE cs.AI 87%

Tricky$^2$: Towards a Benchmark for Evaluating Human and LLM Error Interactions

Tricky$^2$:面向评估人类与LLM错误交互的基准

Cole Granger, Dipin Khati, Daniel Rodriguez-Cardenas, Denys Poshyvanyk

机构 * William and Mary(威廉玛丽学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 Tricky$^2$是一个混合数据集,用于评估人类和LLM错误交互,包含人类和LLM生成的错误,支持混合错误行为分析和修复鲁棒性研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09905 2026-01-16 cs.SE cs.CL 87%

Self-reflection in Automated Qualitative Coding: Improving Text Annotation through Secondary LLM Critique

在自动化定性编码中的自我反思:通过二次LLM批评提升文本标注

Zackary Okun Dunivin, Mobina Noori, Seth Frey, Curtis Atkinson

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 通过二次LLM批评提升文本标注精度,减少错误率并提高分类器性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02757 2026-01-08 cs.AI 87%

LLM Agent Framework for Intelligent Change Analysis in Urban Environment using Remote Sensing Imagery

基于遥感影像的城市环境智能变化分析LLM代理框架

Zixuan Xiao, Jun Ma

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本文提出基于LLM和视觉基础模型的ChangeGPT框架,通过分层结构提升变化检测的智能与适应性,实现在城市环境中的高效变化分析。

Journal ref Automation in Construction 177 (2025) 106341

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01862 2026-01-06 cs.CL cs.IR 87%

Judging with Personality and Confidence: A Study on Personality-Conditioned LLM Relevance Assessment

带个性与自信的判断:关于基于个性的LLM相关性评估的研究

Nuo Chen, Hanpei Fang, Piaohong Wang, Jiqun Liu, Tetsuya Sakai, Xiao-Ming Wu

机构 * The Hong Kong Polytechnic University(香港理工大学) Waseda University(早稻田大学) City University of Hong Kong(香港城市大学) The University of Oklahoma(俄克拉荷马大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本研究探讨了基于人格的LLM相关性评估,发现不同人格特质影响置信度和相关性判断,通过随机森林分类器提升评估性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00930 2026-01-06 cs.IR cs.AI 87%

AlignUSER: Human-Aligned LLM Agents via World Models for Recommender System Evaluation

AlignUSER: 通过世界模型对齐LLM代理以评估推荐系统

Nicolas Bougie, Gian Maria Marconi, Tony Yip, Narimasa Watanabe

机构 * Woven by Toyota(丰田织物)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 AlignUSER通过世界模型驱动的代理学习,利用人类交互数据提升推荐系统评估的准确性与真实用户行为的对齐程度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02761 2026-01-01 cs.AI 87%

Plan Verification for LLM-Based Embodied Task Completion Agents

基于大语言模型的体感任务完成代理的计划验证

Ananth Hariharan, Vardhan Dongre, Dilek Hakkani-Tür, Gokhan Tur

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出基于自然语言提示的体感任务代理计划验证框架,通过迭代修正提升动作序列质量,实现高召回率和精确度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23572 2025-12-30 cs.CL cs.CV 87%

Instruction-Following Evaluation of Large Vision-Language Models

大视觉-语言模型的指令遵循评估

Daiki Shiono, Shumpei Miyawaki, Ryota Tanaka, Jun Suzuki

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);instruction tuning(abstract)

AI总结 本研究评估了大视觉-语言模型在微调后的指令遵循能力,发现其能力下降并分析了原因,提出通过包含输出格式指示的训练数据集可缓解此问题。

Comments 21 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12382 2025-12-30 cs.CL 87%

LLM-as-a-Judge: Rapid Evaluation of Legal Document Recommendation for Retrieval-Augmented Generation

LLM-as-a-Judge: 快速评估法律文档推荐用于检索增强生成

Anu Pradhan, Alexandra Ortan, Apurv Verma, Madhavan Seshadri

机构 * Bloomberg(彭博)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract,comments);language model(abstract,comments);分类 cs.CL

AI总结 本文提出LLM-as-a-Judge方法,通过改进评估指标和统计检验,实现法律文档推荐系统的自动化评估,提高评估效率和准确性。

Comments Accepted in EARL 25: The 2nd Workshop on Evaluating and Applying Recommender Systems with Large Language Models at RecSys 2025

Journal ref Proceedings of the 2nd Workshop on Evaluating and Applying Recommender Systems with Large Language Models (EARL), RecSys 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20159 2025-12-24 cs.SE cs.AI 87%

AXIOM: Benchmarking LLM-as-a-Judge for Code via Rule-Based Perturbation and Multisource Quality Calibration

AXIOM:通过基于规则的扰动和多源质量校准构建LLM-as-a-Judge代码评估基准

Ruiqi Wang, Xinchen Wang, Cuiyun Gao, Chun Yong Chong, Xin Xia, Qing Liao

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Monash University Malaysia(墨尔本大学马来西亚分校) Zhejiang University(浙江大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 AXIOM通过基于规则的扰动和多源质量校准构建代码评估基准,以实现高质量代码评分的平衡分布和可靠评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16022 2025-12-19 cs.AI 87%

Conversational Time Series Foundation Models: Towards Explainable and Effective Forecasting

对话式时间序列基础模型:迈向可解释且有效的预测

Defu Cao, Michael Gee, Jinbo Liu, Hengxuan Wang, Wei Yang, Rui Wang, Yan Liu

机构 * University of Southern California(南加州大学) Amazon AWS(亚马逊AWS)

专题命中 评测与基准 :foundation model(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出了一种对话式时间序列基础模型,通过智能法官机制协调集成模型,提升预测的可解释性和效果。

Comments 31Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14233 2025-12-17 cs.SE cs.AI cs.CR 87%

PentestEval: Benchmarking LLM-based Penetration Testing with Modular and Stage-Level Design

PentestEval: 一种基于模块化和阶段级设计的LLM渗透测试基准测试

Ruozhao Yang, Mingfei Cheng, Gelei Deng, Tianwei Zhang, Junjie Wang, Xiaofei Xie

机构 * School of Computing and Information Systems, Singapore Management University(计算与信息系统学院,新加坡国立管理大学) School of Computer Science and Engineering, Nanyang Technological University(计算机科学与工程学院,南洋理工大学) School of Cyber Security, Tianjin University(网络安全学院,天津大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 PentestEval通过模块化和阶段级设计,评估LLM在渗透测试各阶段的性能,揭示其在自动化测试中的局限性。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14051 2025-12-17 cs.AI 87%

OpenDataArena: A Fair and Open Arena for Benchmarking Post-Training Dataset Value

OpenDataArena: 一个公平且开放的基准测试平台,用于评估训练后数据集的价值

Mengzhang Cai, Xin Gao, Yu Li, Honglin Lin, Zheng Liu, Zhuoshi Pan, Qizhi Pei, Xiaoran Shang, Mengyuan Sun, Zinan Tang, Xiaoyang Wang, Zhanping Zhong, Yun Zhu, Dahua Lin, Conghui He, Lijun Wu

机构 * Shanghai Artificial Intelligence Laboratory, OpenDataLab(上海人工智能实验室,OpenDataLab)

专题命中 评测与基准 :post-training(title,abstract);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 OpenDataArena通过开放平台评估训练后数据集的价值,揭示数据复杂性与性能的权衡,并推动数据为中心的AI研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18538 2025-12-09 cs.SE cs.CL 87%

From Code Foundation Models to Agents and Applications: A Comprehensive Survey and Practical Guide to Code Intelligence

从代码基础模型到代理与应用:全面综述与代码智能的实用指南

Jian Yang, Xianglong Liu, Weifeng Lv, Ken Deng, Shawn Guo, Lin Jing, Yizhi Li, Shark Liu, Xianzhen Luo, Yuyu Luo, Changzai Pan, Ensheng Shi, Yingshui Tan, Renshuai Tao, Jiajun Wu, Xianjie Wu, Zhenhe Wu, Daoguang Zan, Chenchen Zhang, Wei Zhang, He Zhu, Terry Yue Zhuo, Kerui Cao, Xianfu Cheng, Jun Dong, Shengjie Fang, Zhiwei Fei, Xiangyuan Guan, Qipeng Guo, Zhiguang Han, Joseph James, Tianqi Luo, Renyuan Li, Yuhang Li, Yiming Liang, Congnan Liu, Jiaheng Liu, Qian Liu, Ruitong Liu, Tyler Loakman, Xiangxin Meng, Chuang Peng, Tianhao Peng, Jiajun Shi, Mingjie Tang, Boyang Wang, Haowen Wang, Yunli Wang, Fanglin Xu, Zihan Xu, Fei Yuan, Ge Zhang, Jiayi Zhang, Xinhao Zhang, Wangchunshu Zhou, Hualei Zhu, King Zhu, Bryan Dai, Aishan Liu, Zhoujun Li, Chenghua Lin, Tianyu Liu, Chao Peng, Kai Shen, Libo Qin, Shuangyong Song, Zizheng Zhan, Jiajun Zhang, Jie Zhang, Zhaoxiang Zhang, Bo Zheng

专题命中 评测与基准 :foundation model(title);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文综述了代码基础模型到代理的应用,分析了代码LLM的完整生命周期,并通过实验探讨了其性能优化与实际应用中的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05537 2025-12-08 cs.CL 87%

Automated Identification of Incidentalomas Requiring Follow-Up: A Multi-Anatomy Evaluation of LLM-Based and Supervised Approaches

自动识别需要随访的偶发瘤:基于LLM和监督方法的多解剖评估

Namu Park, Farzad Ahmed, Zhaoyi Sun, Kevin Lybarger, Ethan Breinhorst, Julie Hu, Ozlem Uzuner, Martin Gunn, Meliha Yetisgen

机构 * Department of Biomedical Informatics and Medical Education, University of Washington, Seattle, WA, USA(生物医学信息学与医学教育系,华盛顿大学,西雅图,华盛顿州,美国) Department of Information Sciences and Technology, George Mason University, Fairfax, VA, USA(信息科学与技术系,乔治·马歇尔大学,弗吉尼亚州,美国) Department of Radiology, Te Whatu Ora Health New Zealand, Te Toka Tumai Auckland, Auckland, New Zealand(放射学系,新西兰Te Whatu Ora健康机构,奥克兰,新西兰) Department of Radiology, School of Medicine, University of Washington, Seattle, WA, USA(放射学系,医学院,华盛顿大学,西雅图,华盛顿州,美国)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出了一种基于LLM和监督方法的多解剖评估,通过结构化病变标记和解剖学上下文提升偶发瘤检测性能,达到与人类专家相当的水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21761 2025-12-01 cs.CL cs.CY 87%

LLMs for Low-Resource Dialect Translation Using Context-Aware Prompting: A Case Study on Sylheti

基于上下文感知提示的低资源方言翻译中的大语言模型:斯利赫蒂方言案例研究

Tabia Tanzin Prama, Christopher M. Danforth, Peter Sheridan Dodds

专题命中 评测与基准 :prompting(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本研究提出斯利赫蒂-CAP框架,通过上下文感知提示提升低资源方言翻译质量,验证了其在方言特定词汇处理上的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19830 2025-11-26 cs.DB cs.AI 87%

Beyond Relational: Semantic-Aware Multi-Modal Analytics with LLM-Native Query Optimization

超越关系:基于语义的多模态分析与LLM原生查询优化

Junhao Zhu, Lu Chen, Xiangyu Ke, Ziquan Fang, Tianyi Li, Yunjun Gao, Christian S. Jensen

机构 * Zhejiang University(浙江大学) Aalborg University(奥胡斯大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 Nirvana通过结合可编程语义运算符和LLM原生查询优化,实现多模态数据分析,显著提升效率和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08764 2025-11-21 cs.IR cs.CL 87%

Evaluation of the phi-3-mini SLM for identification of texts related to medicine, health, and sports injuries

对phi-3-mini SLM在识别医学、健康和运动损伤相关文本中的评估

Chris Brogly, Saif Rjaibi, Charlotte Liang, Erica Lam, Edward Wang, Adam Levitan, Sarah Paleczny, Michael Cusimano

专题命中 评测与基准 :SLM(title,abstract);large language model(abstract);language model(abstract);small language model(abstract)

AI总结 本文评估了phi-3-mini SLM在识别医学、健康和运动损伤相关文本中的表现,发现其在不同过滤条件下与人类评估者评分的相关性存在显著差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11252 2025-11-17 cs.AI 87%

UAVBench: An Open Benchmark Dataset for Autonomous and Agentic AI UAV Systems via LLM-Generated Flight Scenarios

Mohamed Amine Ferrag, Abderrahmane Lakas, Merouane Debbah

机构 * Department of Computer and Network Engineering, College of Information Technology, United Arab Emirates University(计算机与网络工程系,信息科技学院,阿联酋大学) Khalifa University of Science and Technology(科技大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments 18 pages, 5 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03048 2025-11-06 cs.CL 87%

ROBoto2: An Interactive System and Dataset for LLM-assisted Clinical Trial Risk of Bias Assessment

Anthony Hevia, Sanjana Chintalapati, Veronica Ka Wai Lai, Thanh Tam Nguyen, Wai-Tat Wong, Terry Klassen, Lucy Lu Wang

机构 * University of Washington(华盛顿大学) The Hospital for Sick Children(圣马可医院) University of Bologna(博洛尼亚大学) The Chinese University of Hong Kong(香港中文大学) University of Saskatchewan(萨斯喀彻温大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments EMNLP 2025 System Demonstration

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26238 2025-10-31 cs.AI 87%

Questionnaire meets LLM: A Benchmark and Empirical Study of Structural Skills for Understanding Questions and Responses

Duc-Hai Nguyen, Vijayakumar Nanjappan, Barry O'Sullivan, Hoang D. Nguyen

机构 * University College Cork(科克大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments 14 pages, 3 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23358 2025-10-28 cs.CL 87%

How AI Forecasts AI Jobs: Benchmarking LLM Predictions of Labor Market Changes

Sheri Osborn, Rohit Valecha, H. Raghav Rao, Dan Sass, Anthony Rios

机构 * The University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments 8 pages + Limitations + References

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18454 2025-10-22 cs.CL 87%

Engagement Undermines Safety: How Stereotypes and Toxicity Shape Humor in Language Models

Atharvan Dogra, Soumya Suvra Ghosal, Ameet Deshpande, Ashwin Kalyan, Dinesh Manocha

机构 * Centre for Responsible AI, IIT Madras(负责任人工智能中心,印度理工学院马德拉斯分校) University of Maryland, College Park(马里兰大学 College Park 分校) Princeton University(普林斯顿大学)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.14845 2025-10-17 cs.CL 87%

AAVENUE: Detecting LLM Biases on NLU Tasks in AAVE via a Novel Benchmark

Abhay Gupta, Philip Meng, Ece Yurtseven, Sean O'Brien, Kevin Zhu

机构 * Algoverse AI Research(Algoverse AI 研究所)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments Published at NLP4PI @ EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏