arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-08-29 至 2025-08-29 共收录 27 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 27 篇

2508.21061 2025-08-29 cs.HC cs.AI cs.LG 91%

OnGoal: Tracking and Visualizing Conversational Goals in Multi-Turn Dialogue with Large Language Models

Adam Coscia, Shunan Guo, Eunyee Koh, Alex Endert

机构 * Georgia Institute of Technology(佐治亚理工学院) Adobe Research(Adobe研究)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments Accepted to UIST 2025. 18 pages, 9 figures, 2 tables. For a demo video, see https://youtu.be/uobhmxo6EIE

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18638 2025-08-29 cs.HC cs.AI 90%

Prompt Engineering and the Effectiveness of Large Language Models in Enhancing Human Productivity

Rizal Khoirul Anam

机构 * Department of Computer Science(计算机科学系)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments 38 pages, 15 tables, 5 figures. Submitted as a research paper draft for arXiv. Based on survey data collected in 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.00182 2025-08-29 cs.CL cs.AI 90%

Zero-Shot Classification of Crisis Tweets Using Instruction-Finetuned Large Language Models

Emma McDaniel, Samuel Scheele, Jeff Liu

机构 * Computer Science Department Georgia State University(计算机科学系乔治亚州立大学) Disaster Relief Systems MIT Lincoln Laboratory(灾难救援系统麻省理工学院林肯实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20385 2025-08-29 cs.CL 89%

CAPE: Context-Aware Personality Evaluation Framework for Large Language Models

Jivnesh Sandhan, Fei Cheng, Tushar Sandhan, Yugo Murawaki

机构 * Kyoto University(京都大学) IIT Kanpur(印度理工学院坎浦尔)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments Accepted at EMNLP25 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20583 2025-08-29 cs.CL cs.AI 86%

A Graph Talks, But Who's Listening? Rethinking Evaluations for Graph-Language Models

Soham Petkar, Hari Aakash K, Anirudh Vempati, Akshit Sinha, Ponnurangam Kumarauguru, Chirag Agarwal

机构 * plaksha.edu.in(普拉克斯哈大学) research.iiit.ac.in(IIIT研究机构)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.15165 2025-08-29 cs.CL cs.AI cs.SE 86%

SoAy: A Solution-based LLM API-using Methodology for Academic Information Seeking

Yuanchun Wang, Jifan Yu, Zijun Yao, Jing Zhang, Yuyang Xie, Shangqing Tu, Yiyang Fu, Youhe Feng, Jinkai Zhang, Jingyao Zhang, Bowen Huang, Yuanyao Li, Huihui Yuan, Lei Hou, Juanzi Li, Jie Tang

机构 * Renmin University of China(中国人民大学) Key Laboratory of Data Engineering and Knowledge Engineering, MOE(数据工程与知识工程重点实验室) Tsinghua University(清华大学) Institute of Education(教育学院) Department of Computer Science and Technology(计算机科学与技术系) Engineering Research Center of Database and Business Intelligence, MOE(数据库与商务智能工程研究中心) School of Information(信息学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments KDD 2025; 22 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20818 2025-08-29 cs.LG cs.MA 85%

cMALC-D: Contextual Multi-Agent LLM-Guided Curriculum Learning with Diversity-Based Context Blending

Anirudh Satheesh, Keenan Powell, Hua Wei

机构 * Department of Computer Science, University of Maryland, College Park, Maryland, USA(美国马里兰大学计算机科学系) School of Computing and Augmented Intelligence, Arizona State University, Tempe, Arizona, USA(亚利桑那州立大学计算与增强智能学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

Comments A shorter version has been accepted to the 2025 Conference on Information and Knowledge Management

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20420 2025-08-29 cs.CL 85%

CAMB: A comprehensive industrial LLM benchmark on civil aviation maintenance

Feng Zhang, Chengjie Pang, Yuehan Zhang, Chenyu Luo

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20750 2025-08-29 cs.CL 83%

Specializing General-purpose LLM Embeddings for Implicit Hate Speech Detection across Datasets

Vassiliy Cheremetiev, Quang Long Ho Ngo, Chau Ying Kot, Alina Elena Baia, Andrea Cavallaro

机构 * EPFL(苏黎世联邦理工学院) Idiap Research Institute(Idiap研究机构)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

Comments Paper accepted at the DHOW Workshop at ACM Multimedia 2025. Code available at https://github.com/idiap/implicit-hsd

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10583 2025-08-29 cs.CV cs.CL 83%

Relative Drawing Identification Complexity is Invariant to Modality in Vision-Language Models

Diogo Freitas, Brigt Håvardstun, Cèsar Ferri, Darío Garigliotti, Jan Arne Telle, José Hernández-Orallo

机构 * Interactive Technologies Institute and NOVA LINCS Faculty of Exact Sciences and Engineering University of Madeira Portugal(互动技术研究所和NOVA LINCS精确科学与工程学院马德拉大学) Department of Informatics University of Bergen Norway(信息学院卑尔根大学挪威) Valencian Research Institute for Artificial Intelligence Universitat Politècnica de València Spain(瓦伦西亚人工智能研究机构瓦伦西亚理工大学西班牙) Leverhulme Centre for the Future of Intelligence and Valencian Research Institute for Artificial Intelligence Spain(未来智能中心和瓦伦西亚人工智能研究机构西班牙)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.CL

Comments 54 pages (42 pages of appendix). Accepted for publication at the ECAI 2025 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20227 2025-08-29 cs.CV cs.AI cs.CL cs.LG 82%

A Novel Framework for Automated Explain Vision Model Using Vision-Language Models

Phu-Vinh Nguyen, Tan-Hanh Pham, Chris Ngo, Truong Son Hy

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20976 2025-08-29 cs.SD cs.AI eess.AS 79%

WoW-Bench: Evaluating Fine-Grained Acoustic Perception in Audio-Language Models via Marine Mammal Vocalizations

Jaeyeon Kim, Heeseung Yun, Sang Hoon Woo, Chao-Han Huck Yang, Gunhee Kim

机构 * Carnegie Mellon University(卡内基梅隆大学) Seoul National University(首尔国立大学) NVIDIA(NVIDIA公司)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

Comments Preprint. Project page: https://jaeyeonkim99.github.io/wow_bench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07249 2025-08-29 cs.CL 79%

Bias Attribution in Filipino Language Models: Extending a Bias Interpretability Metric for Application on Agglutinative Languages

Lance Calvin Lim Gamboa, Yue Feng, Mark Lee

机构 * School of Computer Science, University of Birmingham(英国伯明翰大学计算机科学学院) Department of Information Systems and Computer Science, Ateneo de Manila University(马尼拉大学信息系统与计算机科学系)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

Comments Accepted into the Gender Bias in NLP Workshop at ACL 2025 (GeBNLP@ACL2025)

Journal ref https://aclanthology.org/2025.gebnlp-1.19/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20813 2025-08-29 cs.CV 78%

Adapting Foundation Model for Dental Caries Detection with Dual-View Co-Training

Tao Luo, Han Wu, Tong Yang, Dinggang Shen, Zhiming Cui

机构 * School of Biomedical Engineering \& State Key Laboratory of Advanced Medical Materials Devices, ShanghaiTech University, Shanghai, China Lingang Laboratory, Shanghai, China Shanghai United Imaging Intelligence Co. Ltd., Shanghai, China Shanghai Clinical Research Trial Center, Shanghai, China Shanghai Linkedcare Information Technology Co., Ltd., Shanghai, China

专题命中 评测与基准 :foundation model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20707 2025-08-29 cs.CE 78%

Can News Predict the Direction of Oil Price Volatility? A Language Model Approach with SHAP Explanations

Romina Hashami, Felipe Maldonado

专题命中 评测与基准 :language model(title,abstract)

Comments 9 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20973 2025-08-29 cs.CL cs.AI cs.HC 73%

ProactiveEval: A Unified Evaluation Framework for Proactive Dialogue Agents

Tianjian Liu, Fanqi Wan, Jiajian Guo, Xiaojun Quan

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 21 pages, 6 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17232 2025-08-29 cs.MM cs.AI cs.CL 73%

A Highly Clean Recipe Dataset with Ingredient States Annotation for State Probing Task

Mashiro Toyooka, Kiyoharu Aizawa, Yoko Yamakata

机构 * The University of Tokyo(东京大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Accepted to ACM Multimedia 2025. The dataset are publicly available at: https://huggingface.co/datasets/mashi6n/nhkrecipe-100-anno-1

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.08952 2025-08-29 cs.CL cs.AI 73%

Detect, Investigate, Judge and Determine: A Knowledge-guided Framework for Few-shot Fake News Detection

Ye Liu, Jiajun Zhu, Xukai Liu, Haoyu Tang, Yanghai Zhang, Kai Zhang, Xiaofang Zhou, Enhong Chen

机构 * University of Science and Technology of China(中国科学技术大学) State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20816 2025-08-29 cs.CR cs.AI 70%

Multi-Agent Penetration Testing AI for the Web

Isaac David, Arthur Gervais

机构 * University College London(伦敦大学学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07999 2025-08-29 cs.CL 70%

WideSearch: Benchmarking Agentic Broad Info-Seeking

Ryan Wong, Jiawei Wang, Junjie Zhao, Li Chen, Yan Gao, Long Zhang, Xuan Zhou, Zuo Wang, Kai Xiang, Ge Zhang, Wenhao Huang, Yang Wang, Ke Wang

机构 * ByteDance Seed(字节跳动种子)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18076 2025-08-29 cs.CL 70%

Neither Valid nor Reliable? Investigating the Use of LLMs as Judges

Khaoula Chehbouni, Mohammed Haddou, Jackie Chi Kit Cheung, Golnoosh Farnadi

机构 * McGill University(麦吉尔大学) Mila - Quebec AI Institute(魁北克AI研究所) Statistics Canada(加拿大统计局)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

Comments Prepared for conference submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20660 2025-08-29 eess.AS cs.SD 67%

CodecBench: A Comprehensive Benchmark for Acoustic and Semantic Evaluation

Ruifan Deng, Yitian Gong, Qinghui Gao, Luozhijie Jin, Qinyuan Cheng, Zhaoye Fei, Shimin Li, Xipeng Qiu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20736 2025-08-29 cs.CL 57%

Leveraging Semantic Triples for Private Document Generation with Local Differential Privacy Guarantees

Stephen Meisenbacher, Maulik Chevli, Florian Matthes

机构 * Technical University of Munich School of Computation, Information and Technology Department of Computer Science(慕尼黑技术大学计算、信息与技术学院计算机科学系)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

Comments 17 pages, 2 figures, 11 tables. Accepted to EMNLP 2025 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10175 2025-08-29 cs.CL 57%

Estimating Machine Translation Difficulty

Lorenzo Proietti, Stefano Perrella, Vilém Zouhar, Roberto Navigli, Tom Kocmi

机构 * Sapienza NLP Group, Sapienza University of Rome(Sapienza 大学自然语言处理小组,Sapienza 罗马大学) ETH Zurich(苏黎世联邦理工学院) Cohere

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20530 2025-08-29 cs.CV 50%

Enhancing Pseudo-Boxes via Data-Level LiDAR-Camera Fusion for Unsupervised 3D Object Detection

Mingqian Ji, Jian Yang, Shanshan Zhang

机构 * PCA Lab, School of Computer Science and Engineering, Nanjing University of Science and Technology(PCA实验室,计算机科学与工程学院,南京理工大学)

专题命中 评测与基准 :foundation model(abstract)

Comments Accepted by ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14511 2025-08-29 cs.SE 50%

What You See Is What It Does: A Structural Pattern for Legible Software

Eagon Meng, Daniel Jackson

专题命中 评测与基准 :LLM(abstract)

Comments 16 pages. Appearing in Onward! at SPLASH 2025; added DOI, updated references/formatting

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00626 2025-08-29 cs.CV 50%

ZIM: Zero-Shot Image Matting for Anything

Beomyoung Kim, Chanyong Shin, Joonhyun Jeong, Hyungsik Jung, Se-Yun Lee, Sewhan Chun, Dong-Hyun Hwang, Joonsang Yu

机构 * NAVER Cloud, ImageVision(NAVER云,ImageVision)

专题命中 评测与基准 :foundation model(abstract)

Comments ICCV 2025 (Highlight)

详情

展开后加载摘要…

URL PDF HTML 收藏