arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-08-07 至 2025-08-07 共收录 51 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 51 篇

2508.04219 2025-08-07 cs.CL cs.LG 90%

Hierarchical Text Classification Using Black Box Large Language Models

Kosuke Yoshimura, Hisashi Kashima

机构 * Kyoto University, Kyoto, Japan(京都大学) Anonymous Institute(匿名机构)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.LG

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03970 2025-08-07 cs.CL cs.AI 90%

Data and AI governance: Promoting equity, ethics, and fairness in large language models

Alok Abhishek, Lisa Erickson, Tushar Bandopadhyay

机构 * Independent Researcher(独立研究者)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments Published in MIT Science Policy Review 6, 139-146 (2025)

Journal ref MIT Science Policy Review, 6. (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12772 2025-08-07 cs.CV cs.AI cs.RO 89%

NuPlanQA: A Large-Scale Dataset and Benchmark for Multi-View Driving Scene Understanding in Multi-Modal Large Language Models

Sung-Yeon Park, Can Cui, Yunsheng Ma, Ahmadreza Moradipari, Rohit Gupta, Kyungtae Han, Ziran Wang

机构 * Purdue University(普渡大学) Toyota InfoTech Labs(丰田信息技术实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04448 2025-08-07 cs.SE 88%

Large Language Models Versus Static Code Analysis Tools: A Systematic Benchmark for Vulnerability Detection

Damian Gnieciak, Tomasz Szandala

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04059 2025-08-07 cs.CV 88%

Beyond the Visible: Benchmarking Occlusion Perception in Multimodal Large Language Models

Zhaochen Liu, Kaiwen Gao, Shuyi Liang, Bin Xiao, Limeng Qiao, Lin Ma, Tingting Jiang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02096 2025-08-07 cs.IR cs.AI cs.HC 85%

Evaluating User Experience in Conversational Recommender Systems: A Systematic Review Across Classical and LLM-Powered Approaches

Raj Mahmud, Yufeng Wu, Abdullah Bin Sawad, Shlomo Berkovsky, Mukesh Prasad, A. Baki Kocaballi

机构 * School of Computer Science, University of Technology Sydney(技术科技大学计算机科学学院) The Applied College, King Abdulaziz University(国王阿卜杜勒阿齐兹大学应用学院) Australian Institute of Health Innovation, Macquarie University(麦考瑞大学健康创新研究所)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments Accepted at OzCHI 2025. 23 pages, 1 figure, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23989 2025-08-07 cs.SE cs.AI 85%

Rubric Is All You Need: Enhancing LLM-based Code Evaluation With Question-Specific Rubrics

Aditya Pathak, Rachit Gandhi, Vaibhav Uttam, Arnav Ramamoorthy, Pratyush Ghosh, Aaryan Raj Jindal, Shreyash Verma, Aditya Mittal, Aashna Ased, Chirag Khatri, Yashwanth Nakka, Devansh, Jagat Sesh Challa, Dhruv Kumar

机构 * BITS Pilani(比特斯理工学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments Accepted in ICER 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03990 2025-08-07 cs.CL cs.AI cs.HC 85%

Are Today's LLMs Ready to Explain Well-Being Concepts?

Bohan Jiang, Dawei Li, Zhen Tan, Chengshuai Zhao, Huan Liu

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)

Comments 9 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.00873 2025-08-07 cs.HC 85%

Aligning Human and LLM Judgments: Insights from EvalAssist on Task-Specific Evaluations and AI-assisted Assessment Strategy Preferences

Zahra Ashktorab, Michael Desmond, Qian Pan, James M. Johnson, Martin Santillan Cooper, Elizabeth M. Daly, Rahul Nair, Tejaswini Pedapati, Hyo Jin Do, Werner Geyer

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04307 2025-08-07 cs.CE cs.AI 84%

Compressing Large Language Models with PCA Without Performance Loss

Magnus Bengtsson

机构 * Department of Engineering, University of Borås, Sweden(工程系,博里亚斯大学,瑞典)

专题命中 评测与基准 :large language model(title);language model(title);分类 cs.AI

Comments 23 pages. 4 figures, submitted to journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04482 2025-08-07 cs.AI cs.CL cs.CV cs.LG 83%

OS Agents: A Survey on MLLM-based Agents for General Computing Devices Use

Xueyu Hu, Tao Xiong, Biao Yi, Zishu Wei, Ruixuan Xiao, Yurun Chen, Jiasheng Ye, Meiling Tao, Xiangxin Zhou, Ziyu Zhao, Yuhuai Li, Shengze Xu, Shenzhi Wang, Xinchen Xu, Shuofei Qiao, Zhaokai Wang, Kun Kuang, Tieyong Zeng, Liang Wang, Jiwei Li, Yuchen Eleanor Jiang, Wangchunshu Zhou, Guoyin Wang, Keting Yin, Zhou Zhao, Hongxia Yang, Fan Wu, Shengyu Zhang, Fei Wu

机构 * Zhejiang University(浙江大学) Fudan University(复旦大学) OPPO AI Center(OPPO AI中心) University of Chinese Academy of Sciences(中国科学院大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) The Chinese University of Hong Kong(香港中文大学) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);foundation model(abstract)

Comments ACL 2025 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03725 2025-08-07 cs.CV 83%

A Large Language Model Powered Integrated Circuit Footprint Geometry Understanding

Yida Wang, Taiting Lu, Runze Liu, Lanqing Yang, Yifan Yang, Zhe Chen, Yuehai Wang, Yixin Liu, Kaiyuan Lin, Xiaomeng Chen, Dian Ding, Yijie Li, Yi-Chao Chen, Yincheng Jin, Mahanth Gowda

机构 * Shanghai Jiao Tong University(上海交通大学) Pennsylvania State University(宾夕法尼亚州立大学) Microsoft Research(微软研究院) National University of Singapore(新加坡国立大学) Binghamton University(布ingham顿大学)

专题命中 评测与基准 :large language model(title);language model(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04353 2025-08-07 cs.MM cs.AI 83%

LUST: A Multi-Modal Framework with Hierarchical LLM-based Scoring for Learned Thematic Significance Tracking in Multimedia Content

Anderson de Lima Luiz

机构 * AImotion Bavaria Technische Hochschule Ingolstadt(巴伐利亚AImotion技术大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

Comments 5 pages and 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04125 2025-08-07 cs.SE cs.AI 81%

Experimental Analysis of Productive Interaction Strategy with ChatGPT: User Study on Function and Project-level Code Generation Tasks

Sangwon Hyun, Hyunjun Kim, Jinhyuk Jang, Hyojin Choi, M. Ali Babar

机构 * Adelaide University(阿德莱德大学) Korea Advanced Institute of Science(韩国科学技术院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments The benchmark repository has not been publicly released yet due to the IP policy in our institutions. If you would like to use the benchmark or collaborate on extension, please contact "dr.sangwon.hyun@gmail.com"

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04248 2025-08-07 cs.CL cs.AI 81%

TalkDep: Clinically Grounded LLM Personas for Conversation-Centric Depression Screening

Xi Wang, Anxo Perez, Javier Parapar, Fabio Crestani

机构 * University of Sheffield(谢菲尔德大学) University of A Coruña(阿罗纳大学)

专题命中 评测与基准 :LLM(title);language model(abstract);分类 cs.CL、cs.AI

Comments Paper accepted at CIKM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05683 2025-08-07 cs.LG cs.AI cs.CR cs.MM 81%

Multi-Modal Multi-Task Federated Foundation Models for Next-Generation Extended Reality Systems: Towards Privacy-Preserving Distributed Intelligence in AR/VR/MR

Fardis Nadimi, Payam Abdisarabshali, Kasra Borazjani, Jacob Chakareski, Seyyedali Hosseinalipour

机构 * University at Buffalo–SUNY(布法罗大学-纽约州立大学) Department of Electrical Engineering(电气工程系) New Jersey Institute of Technology (NJIT)(新泽西理工学院)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG

Comments 16 pages, 4 Figures, 8 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06280 2025-08-07 cs.CV 80%

Show or Tell? A Benchmark To Evaluate Visual and Textual Prompts in Semantic Segmentation

Gabriele Rosi, Fabio Cermelli

专题命中 评测与基准 :large language model(abstract);language model(abstract);foundation model(abstract);prompting(abstract)

Comments Accepted to PixFoundation workshop at CVPR2025. Code: https://github.com/FocoosAI/ShowOrTell

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01083 2025-08-07 cs.LG cs.AI cs.CL 80%

Tool Unlearning for Tool-Augmented LLMs

Jiali Cheng, Hadi Amiri

机构 * University of Massachusetts Lowell(马萨诸塞大学洛厄尔分校)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments ICML 2025 https://clu-uml.github.io/MU-Bench-Project-Page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03728 2025-08-07 cs.CL 79%

WINELL: Wikipedia Never-Ending Updating with LLM Agents

Revanth Gangi Reddy, Tanay Dixit, Jiaxin Qin, Cheng Qian, Daniel Lee, Jiawei Han, Kevin Small, Xing Fan, Ruhi Sarikaya, Heng Ji

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04206 2025-08-07 cs.IR 78%

ViLLA-MMBench: A Unified Benchmark Suite for LLM-Augmented Multimodal Movie Recommendation

Fatemeh Nazary, Ali Tourani, Yashar Deldjoo, Tommaso Di Noia

专题命中 评测与基准 :LLM(title,abstract)

Comments 17 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04028 2025-08-07 cs.CV cs.IR 78%

Dual Prompt Learning for Adapting Vision-Language Models to Downstream Image-Text Retrieval

Yifan Wang, Tao Wang, Chenwei Tang, Caiyang Yu, Zhengqing Zang, Mengmi Zhang, Shudong Huang, Jiancheng Lv

机构 * College of Computer Science, Sichuan University(四川大学计算机学院) Engineering Research Center of Machine Learning and Industry Intelligence, Ministry of Education, Chengdu, China(教育部机器学习与产业智能工程研究中心) Deep NeuroCognition Lab, I2R and CFAR, Agency for Science, Technology and Research, Singapore(深度神经认知实验室,I2R和CFAR,科技研究局,新加坡)

专题命中 评测与基准 :language model(title,abstract)

Comments 10 pages, 7figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03734 2025-08-07 eess.IV cs.AI cs.CV 77%

A Survey of Multimodal Ophthalmic Diagnostics: From Task-Specific Approaches to Foundational Models

Xiaoling Luo, Ruli Zheng, Qiaojian Zheng, Zibo Du, Shuo Yang, Meidan Ding, Qihao Xu, Chengliang Liu, Linlin Shen

机构 * College of Computer Science and Software Engineering, Shenzhen University, Shenzhen, China(深圳大学计算机科学与软件工程学院) Shenzhen Key Laboratory of Visual Object Detection and Recognition, Harbin Institute of Technology, Shenzhen, 518055, China(视觉对象检测与识别深圳重点实验室) Laboratory for Artificial Intelligence in Design, Hong Kong(人工智能设计实验室) School of Artificial Intelligence, Shenzhen University, Shenzhen, China(深圳大学人工智能学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06043 2025-08-07 cs.CR cs.AI 77%

CAVGAN: Unifying Jailbreak and Defense of LLMs via Generative Adversarial Attacks on their Internal Representations

Xiaohu Li, Yunfeng Ning, Zepeng Bao, Mayi Xu, Jianhao Chen, Tieyun Qian

机构 * School of Computer Science, Wuhan University, China(武汉大学计算机学院) Zhongguancun Academy, Beijing, China(中关村学院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments Accepted to ACL 2025 (Findings), camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04240 2025-08-07 eess.SP 75%

ChineseEEG-2: An EEG Dataset for Multimodal Semantic Alignment and Neural Decoding during Reading and Listening

Sitong Chen, Beiqianyi Li, Cuilin He, Dongyang Li, Mingyang Wu, Xinke Shen, Song Wang, Xuetao Wei, Xindi Wang, Haiyan Wu, Quanying Liu

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03966 2025-08-07 cs.NE 75%

GP and LLMs for Program Synthesis: No Clear Winners

Jose Guadalupe Hernandez, Anil Kumar Saini, Gabriel Ketron, Jason H. Moore

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03732 2025-08-07 cs.CV 75%

What is Beneath Misogyny: Misogynous Memes Classification and Explanation

Kushal Kanwar, Dushyant Singh Chauhan, Gopendra Vikram Singh, Asif Ekbal

机构 * Jaypee University of Information Technology(杰伊佩大学信息科技学院) CortexTor Labs(CortexTor实验室) Amity Center for Artificial Intelligence(阿米蒂人工智能中心) Indian Institute of Technology Jodhpur(印度理工学院朱道尔)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.08617 2025-08-07 cs.PL cs.AR 75%

RTLCoder: Outperforming GPT-3.5 in Design RTL Generation with Our Open-Source Dataset and Lightweight Solution

Shang Liu, Wenji Fang, Yao Lu, Qijun Zhang, Hongce Zhang, Zhiyao Xie

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

Comments This is the LAD Conference version of RTLCoder, for the TCAD extension version, please refer to: arXiv:2312.08617v4

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04576 2025-08-07 cs.AI 70%

ConfProBench: A Confidence Evaluation Benchmark for MLLM-Based Process Judges

Yue Zhou, Yi Chang, Yuan Wu

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21167 2025-08-07 cs.CV cs.AI 70%

ChartM$^3$: Benchmarking Chart Editing with Multimodal Instructions

Donglu Yang, Liang Zhang, Zihao Yue, Liangyu Chen, Yichen Xu, Wenxuan Wang, Qin Jin

机构 * independent researcher(独立研究者)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05727 2025-08-07 eess.AS cs.CL cs.SD 70%

ContextASR-Bench: A Massive Contextual Speech Recognition Benchmark

He Wang, Linhan Ma, Dake Guo, Xiong Wang, Lei Xie, Jin Xu, Junyang Lin

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

Comments 16 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏