arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-08-12 至 2025-08-12 共收录 282 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 69 篇

2508.07273 2025-08-12 cs.CL cs.AI eess.AS 84%

Incorporating Contextual Paralinguistic Understanding in Large Speech-Language Models

Qiongqiong Wang, Hardik B. Sailor, Jeremy H. M. Wong, Tianchi Liu, Shuo Sun, Wenyu Zhang, Muhammad Huzaifah, Nancy Chen, Ai Ti Aw

机构 * Institute for Infocomm Research (I 2 R), Agency for Science, Technology

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments Accepted at (ASRU 2025) 2025 IEEE Automatic Speech Recognition and Understanding Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09373 2025-08-12 cs.CL 83%

QUDsim: Quantifying Discourse Similarities in LLM-Generated Text

Ramya Namuduri, Yating Wu, Anshun Asher Zheng, Manya Wadhwa, Greg Durrett, Junyi Jessy Li

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

Comments COLM 2025 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06530 2025-08-12 cs.CV cs.LG 83%

What Makes "Good" Distractors for Object Hallucination Evaluation in Large Vision-Language Models?

Ming-Kun Xie, Jia-Hao Xiao, Gang Niu, Lei Feng, Zhiqiang Kou, Min-Ling Zhang, Masashi Sugiyama

机构 * Center for Advanced Intelligence Project, RIKEN(先进智能项目中心,日本理化学研究所) Southeast University(东南大学) The University of Tokyo(东京大学)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05228 2025-08-12 cs.CL 83%

NoveltyBench: Evaluating Language Models for Humanlike Diversity

Yiming Zhang, Harshita Diddee, Susan Holm, Hanchen Liu, Xinyue Liu, Vinay Samuel, Barry Wang, Daphne Ippolito

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :language model(title,abstract);prompting(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07179 2025-08-12 cs.CL cs.AI cs.DB 82%

Schema Lineage Extraction at Scale: Multilingual Pipelines, Composite Evaluation, and Language-Model Benchmarks

Jiaqi Yin, Yi-Wei Chen, Meng-Lung Lee, Xiya Liu

机构 * Microsoft Redmond, WA(微软红木城) Antra. Inc.(Antra公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract);small language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07918 2025-08-12 cs.CV 82%

RSVLM-QA: A Benchmark Dataset for Remote Sensing Vision Language Model-based Question Answering

Xing Zi, Jinghao Xiao, Yunxiao Shi, Xian Tao, Jun Li, Ali Braytee, Mukesh Prasad

机构 * School of Computer Science, University of Technology Sydney(技术悉尼大学计算机科学学院) SEDE, University of Technology Sydney(技术悉尼大学SEDE) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract)

Comments This paper has been accepted to the proceedings of the 33rd ACM International Multimedia Conference (ACM Multimedia 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07421 2025-08-12 cs.RO 82%

Triple-S: A Collaborative Multi-LLM Framework for Solving Long-Horizon Implicative Tasks in Robotics

Zixi Jia, Hongbin Gao, Fashe Li, Jiqiang Liu, Hexiao Li, Qinghua Liu

机构 * Faculty of Robot Science and Engineering, Northeastern University(机器人科学与工程学院,东北大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract)

Comments Accepted to IROS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06641 2025-08-12 cs.LG cs.AI cs.NA math.NA q-bio.QM 81%

Fractal Language Modelling by Universal Sequence Maps (USM)

Jonas S Almeida, Daniel E Russ, Susana Vinga, Ines Duarte, Lee Mason, Praphulla Bhawsar, Aaron Ge, Arlindo Oliveira, Jeya Balaji Balasubramanian

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI、cs.LG

Comments 16 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07432 2025-08-12 cs.CV cs.AI 79%

Freeze and Reveal: Exposing Modality Bias in Vision-Language Models

Vivek Hruday Kavuri, Vysishtya Karanam, Venkata Jahnavi Venkamsetty, Kriti Madumadukala, Lakshmipathi Balaji Darur, Ponnurangam Kumaraguru

机构 * IIIT Hyderabad

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10808 2025-08-12 cs.CV cs.HC cs.LG 79%

TFMPathy: Tabular Foundation Model for Privacy-Aware, Generalisable Empathy Detection from Videos

Md Rakibul Hasan, Md Zakir Hossain, Aneesh Krishna, Shafin Rahman, Tom Gedeon

机构 * School of Electrical Engineering, Computing and Mathematical Sciences, Curtin University(Curtin大学电气工程、计算与数学科学学院) The Australian National University(澳大利亚国立大学) North South University(北南大学) University of ÓBuda(奥布达大学)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06387 2025-08-12 cs.LG cs.AI 79%

End-to-End Text-to-SQL with Dataset Selection: Leveraging LLMs for Adaptive Query Generation

Anurag Tripathi, Vaibhav Patle, Abhinav Jain, Ayush Pundir, Sairam Menon, Ajeet Kumar Singh, Dorien Herremans

机构 * Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments Accepted in IJCNN25

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18501 2025-08-12 cs.CL cs.AI 79%

Comparative Evaluation of ChatGPT and DeepSeek Across Key NLP Tasks: Strengths, Weaknesses, and Domain-Specific Performance

Wael Etaiwi, Bushra Alhijawi

机构 * Princess Sumaya University for Technology(普里incess苏玛亚技术大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06760 2025-08-12 cs.CY 78%

Understanding Privacy Norms Around LLM-Based Chatbots: A Contextual Integrity Perspective

Sarah Tran, Hongfan Lu, Isaac Slaughter, Bernease Herman, Aayushi Dangol, Yue Fu, Lufei Chen, Biniyam Gebreyohannes, Bill Howe, Alexis Hiniker, Nicholas Weber, Robert Wolfe

专题命中 评测与基准 :LLM(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06665 2025-08-12 cs.CL 77%

Testing the Limits of Machine Translation from One Book

Jonathan Shaw, Dillon Mee, Timothy Khouw, Zackary Leech, Daniel Wilson

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07596 2025-08-12 cs.CV 75%

From Prediction to Explanation: Multimodal, Explainable, and Interactive Deepfake Detection Framework for Non-Expert Users

Shahroz Tariq, Simon S. Woo, Priyanka Singh, Irena Irmalasari, Saakshi Gupta, Dev Gupta

机构 * Sungkyunkwan University, S. Korea(顺天大学) University of Queensland, Australia(昆士兰大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

Comments 11 pages, 3 tables, 5 figures, accepted for publicaiton in the 33rd ACM International Conference on Multimedia (MM '25), October 27-31, 2025, Dublin, Ireland

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07401 2025-08-12 cs.CV 75%

LET-US: Long Event-Text Understanding of Scenes

Rui Chen, Xingyu Chen, Shaoan Wang, Shihan Kong, Junzhi Yu

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07308 2025-08-12 cs.CL cs.AI cs.IR cs.LG 75%

HealthBranches: Synthesizing Clinically-Grounded Question Answering Datasets via Decision Pathways

Cristian Cosentino, Annamaria Defilippo, Marco Dossena, Christopher Irwin, Sara Joubbi, Pietro Liò

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07069 2025-08-12 cs.CL cs.AI 73%

SEADialogues: A Multilingual Culturally Grounded Multi-turn Dialogue Dataset on Southeast Asian Languages

Muhammad Dehan Al Kautsar, Aswin Candra, Muhammad Alif Al Hakim, Maxalmina Satria Kahfi, Fajri Koto, Alham Fikri Aji, Peerat Limkonchotiwat, Ekapol Chuangsuwanich, Genta Indra Winata

机构 * MBZUAI Mekari Universitas Indonesia(印度尼西亚大学) Detik Network(Detik网络) AI Singapore(新加坡AI) Chulalongkorn University(朱拉隆功大学) Capital One

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06960 2025-08-12 cs.AI cs.CL 73%

DatasetResearch: Benchmarking Agent Systems for Demand-Driven Dataset Discovery

Keyu Li, Mohan Jiang, Dayuan Fu, Yunze Wu, Xiangkun Hu, Dequan Wang, Pengfei Liu

机构 * Shanghai Jiao Tong University(上海交通大学) SII GAIR

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07646 2025-08-12 cs.LG 70%

Multi-Turn Jailbreaks Are Simpler Than They Seem

Xiaoxue Yang, Jaeha Lee, Anna-Katharina Dick, Jasper Timm, Fei Xie, Diogo Cruz

机构 * Imperial College London(伦敦帝国学院) California Institute of Technology(加州理工学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

Comments 25 pages, 15 figures. Accepted at COLM 2025 SoLaR Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07516 2025-08-12 cs.CL 70%

Augmenting Bias Detection in LLMs Using Topological Data Analysis

Keshav Varadarajan, Tananun Songdechakraiwut

机构 * Duke University(杜克大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

Comments 15 pages, 9 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07390 2025-08-12 cs.HC cs.AI 70%

Urbanite: A Dataflow-Based Framework for Human-AI Interactive Alignment in Urban Visual Analytics

Gustavo Moreira, Leonardo Ferreira, Carolina Veiga, Maryam Hosseini, Fabio Miranda

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of California, Berkeley(加州大学伯克利分校)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

Comments Accepted at IEEE VIS 2025. Urbanite is available at https://urbantk.org/urbanite

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17810 2025-08-12 cs.CL eess.AS 70%

URO-Bench: Towards Comprehensive Evaluation for End-to-End Spoken Dialogue Models

Ruiqi Yan, Xiquan Li, Wenxi Chen, Zhikang Niu, Chen Yang, Ziyang Ma, Kai Yu, Xie Chen

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06886 2025-08-12 cs.CL 70%

Score Before You Speak: Improving Persona Consistency in Dialogue Generation using Response Quality Scores

Arpita Saggar, Jonathan C. Darling, Vania Dimitrova, Duygu Sarikaya, David C. Hogg

机构 * School of Computer Science, University of Leeds(计算机科学学院,利兹大学) Leeds Institute of Medical Education, School of Medicine, University of Leeds(利兹医学教育研究所,医学院,利兹大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

Comments Camera-Ready version for ECAI 2025. 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06810 2025-08-12 cs.CL 70%

Annotating Errors in English Learners' Written Language Production: Advancing Automated Written Feedback Systems

Steven Coyne, Diana Galvan-Sosa, Ryan Spring, Camélia Guerraoui, Michael Zock, Keisuke Sakaguchi, Kentaro Inui

机构 * Tohoku University, Sendai, Japan(东京东京大学) RIKEN, Wako, Japan(日本理化学研究所) ALTA Institute, Computer Laboratory, University of Cambridge, U.K(剑桥大学计算机实验室ALTA研究所) INSA Lyon, Villeurbanne, France(里昂国立应用科学学院) CNRS, LIS, Aix-Marseille University, Marseille, France(国家科学研究中心(CNRS)) MBZUAI, Abu Dhabi, United Arab Emirates(阿布扎赫德人工智能研究所)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

Comments Pre-review version of DOI 10.1007/978-3-031-98459-4_21, presented at AIED 2025. All content is as of submission time except for de-anonymization, ensuing layout fixes, use of the current code repository link, and BibTeX fixes. Readers are encouraged to refer to the published version

Journal ref AIED LNCS 15880 (2025) 292-306

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06600 2025-08-12 cs.CL cs.IR 70%

BrowseComp-Plus: A More Fair and Transparent Evaluation Benchmark of Deep-Research Agent

Zijian Chen, Xueguang Ma, Shengyao Zhuang, Ping Nie, Kai Zou, Andrew Liu, Joshua Green, Kshama Patel, Ruoxi Meng, Mingyi Su, Sahel Sharifymoghaddam, Yanxi Li, Haoran Hong, Xinyu Shi, Xuye Liu, Nandan Thakur, Crystina Zhang, Luyu Gao, Wenhu Chen, Jimmy Lin

机构 * University of Waterloo(滑铁卢大学) CSIRO(澳大利亚联邦科学与工业研究组织) Independent(独立研究者) Carnegie Mellon University(卡内基梅隆大学) The University of Queensland(昆士兰大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17590 2025-08-12 cs.CV cs.AI cs.RO 70%

DRAMA-X: A Fine-grained Intent Prediction and Risk Reasoning Benchmark For Driving

Mihir Godbole, Xiangbo Gao, Zhengzhong Tu

机构 * Texas A&M University(德克萨斯A&M大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

Comments 19 pages, 5 figures, Preprint under review. Code available at: https://github.com/taco-group/DRAMA-X

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00964 2025-08-12 cs.CL 70%

ACCESS DENIED INC: The First Benchmark Environment for Sensitivity Awareness

Dren Fazlija, Arkadij Orlov, Sandipan Sikdar

机构 * L3S Research Center, Leibniz University Hannover(莱比锡大学汉诺威分校L3S研究中心) E.ON Grid Solutions(E.ON电网解决方案)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

Comments 20 pages, 4 figures, 8 tables, ACL 2025 (Findings), Figure 3 was corrected and is now aligned with the values of Table 2, Project Page: https://drenfazlija.github.io/AccessDeniedInc/

Journal ref Findings of the Association for Computational Linguistics: ACL 2025, pages 13221-13240, Vienna, Austria, Association for Computational Linguistics, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.08035 2025-08-12 cs.CV cs.AI 70%

LVBench: An Extreme Long Video Understanding Benchmark

Weihan Wang, Zehai He, Wenyi Hong, Yean Cheng, Xiaohan Zhang, Ji Qi, Xiaotao Gu, Shiyu Huang, Bin Xu, Yuxiao Dong, Ming Ding, Jie Tang

机构 * Zhipu AI(智谱AI) Tsinghua University(清华大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07560 2025-08-12 cs.RO cs.CV 67%

Progressive Bird's Eye View Perception for Safety-Critical Autonomous Driving: A Comprehensive Survey

Yan Gong, Naibang Wang, Jianli Lu, Xinyu Zhang, Yongsheng Gao, Jie Zhao, Zifan Huang, Haozhi Bai, Nanxin Zeng, Nayu Su, Lei Yang, Ziying Song, Xiaoxi Hu, Xinmin Jiang, Xiaojuan Zhang, Susanto Rahardja

机构 * State Key Laboratory of Robotics and System(机器人系统国家重点实验室) Harbin Institute of Technology(哈尔滨工业大学) State Key Laboratory of Intelligent Green Vehicle and Mobility(智能绿色车辆与移动性国家重点实验室) Tsinghua University(清华大学) the School of Mechanical and Aerospace Engineering(机械与航空航天工程学院) Nanyang Technological University(南洋理工大学) Beijing Key Laboratory of Traffic Data Mining and Embodied Intelligence(北京交通数据挖掘与具身智能重点实验室) Beijing Jiaotong University(北京交通大学) the Institute for Infocomm Research(信息通信研究所) A*STAR the Engineering Cluster(工程集群) the Singapore Institute of Technology(新加坡理工学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏