arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-08-25 至 2025-08-25 共收录 138 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 34 篇

2508.15798 2025-08-25 cs.CL cs.AI 88%

Persuasiveness and Bias in LLM: Investigating the Impact of Persuasiveness and Reinforcement of Bias in Language Models

Saumya Roy

机构 * Department of Mathematics and Computer Science(数学与计算机科学系) Data and Artificial Intelligence Research Group(数据与人工智能研究组)

专题命中 评测与基准 :language model(title,abstract);LLM(title);large language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16074 2025-08-25 cs.NI 88%

Congestion Control System Optimization with Large Language Models

Zhiyuan He, Aashish Gottipati, Lili Qiu, Yuqing Yang, Francis Y. Yan

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15822 2025-08-25 cs.CL cs.AI cs.ET cs.IR 86%

An Auditable Pipeline for Fuzzy Full-Text Screening in Systematic Reviews: Integrating Contrastive Semantic Highlighting and LLM Judgment

Pouria Mortezaagha, Arya Rahgozar

机构 * Ottawa Hospital Research Institute(渥太华医院研究机构) University of Ottawa(渥太华大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16835 2025-08-25 eess.AS cs.CL 85%

Evaluating Speech-to-Text x LLM x Text-to-Speech Combinations for AI Interview Systems

Rumi Allbert, Nima Yazdani, Ali Ansari, Aruj Mahajan, Amirhossein Afsharrad, Seyed Shahabeddin Mousavi

机构 * University of Southern California(南加州大学) Stanford University(斯坦福大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15855 2025-08-25 cs.CL cs.CY cs.SI 83%

Counterspeech for Mitigating the Influence of Media Bias: Comparing Human and LLM-Generated Responses

Luyang Lin, Zijin Feng, Lingzhi Wang, Kam-Fai Wong

机构 * The Chinese University of Hong Kong, Hong Kong, China(香港中文大学) MoE Key Laboratory of High Confidence Software Technologies(高可信软件技术国家重点实验室) Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳))

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15429 2025-08-25 cs.SD 82%

AudioSet-R: A Refined AudioSet with Multi-Stage LLM Label Reannotation

Yulin Sun, Qisheng Xu, Yi Su, Qian Zhu, Yong Dou, Xinwang Liu, Kele Xu

机构 * College of Computer Science and Technology, National University of Defense Technology(计算机科学与技术学院,国防科技大学)

专题命中 评测与基准 :LLM(title);foundation model(abstract);prompting(abstract)

Comments 8 pages, 5 figures, accepted in ACM MM 2025 dataset track

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20807 2025-08-25 cs.LG cs.AI cs.PF cs.SE 82%

GPU Kernel Scientist: An LLM-Driven Framework for Iterative Kernel Optimization

Martin Andrews, Sam Witteveen

机构 * LLM-Driven Framework for Iterative Kernel Optimization(LLM驱动的迭代核优化框架)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI、cs.LG;foundation model(comments)

Comments 4+1 page paper plus Appendices and Supplementary zip file. Presented at the ES-FoMo "Efficient Systems for Foundation Models" workshop at ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04310 2025-08-25 cs.CL cs.AI 81%

CO-Bench: Benchmarking Language Model Agents in Algorithm Search for Combinatorial Optimization

Weiwei Sun, Shengyu Feng, Shanda Li, Yiming Yang

专题命中 评测与基准 :language model(title);LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07767 2025-08-25 cs.CY 80%

Structured Prompts, Better Outcomes? Exploring the Effects of a Structured Interface with ChatGPT in a Graduate Robotics Course

Jerome Brender, Laila El-Hamamsy, Kim Uittenhove, Francesco Mondada, Engin Bumbacher

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments Accepted, to appear in the proceedings of the EC-TEL 2025 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15910 2025-08-25 cs.CL cs.AI cs.IR 80%

Evaluating Structured Decoding for Text-to-Table Generation: Evidence from Three Datasets

Julian Oestreich, Lydia Müller

机构 * Institute for Applied Informatics (InfAI) at Leipzig University(应用信息学院(InfAI))

专题命中 评测与基准 :language model(abstract,comments);large language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

Comments to be published in the workshop proceedings of the "From Rules to Language Models: Comparative Performance Evaluation" workshop, held alongside RANLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16569 2025-08-25 eess.IV cs.AI cs.CV 79%

A Disease-Centric Vision-Language Foundation Model for Precision Oncology in Kidney Cancer

Yuhui Tao, Zhongwei Zhao, Zilong Wang, Xufang Luo, Feng Chen, Kang Wang, Chuanfu Wu, Xue Zhang, Shaoting Zhang, Jiaxi Yao, Xingwei Jin, Xinyang Jiang, Yifan Yang, Dongsheng Li, Lili Qiu, Zhiqiang Shao, Jianming Guo, Nengwang Yu, Shuo Wang, Ying Xiong

机构 * Digital Medical Research Center, School of Basic Medical Sciences, Fudan University, Shanghai, 200032, China(复旦大学基础医学学院数字医学研究中心) Shanghai Key Laboratory of Medical Imaging Computing and Computer Assisted Intervention, Shanghai, 200032, China(上海市医疗影像计算与计算机辅助干预重点实验室) Department of Urology, Qilu Hospital of Shandong University, Jinan, Shandong, 250012, China(山东大学齐鲁医院泌尿科) Microsoft Research Asia, Shanghai, 200232, China(微软亚洲研究院) Department of Radiology, The First Affiliated Hospital, Zhejiang University School of Medicine, Hangzhou, 310006, China(浙江大学医学院附属第一医院放射科) Center of Health data science, Linyi People’s Hospital, Shandong, 276003, China(临沂人民医院健康数据科学中心) Shandong Open Laboratory of Data Innovation Application, Shandong, 276003, China(山东省数据创新应用开放实验室) Department of Radiology, the First People’s Hospital of Lianyungang, Lianyungang, 222002, China(连云港第一人民医院放射科) Department of Urology, Zhangye People’s Hospital affiliated to Hexi University, Zhangye, 734000, China(张掖人民医院(河西大学附属)泌尿科) Department of Urology, Ruijin Hospital, Shanghai Jiao Tong University School of Medicine, Shanghai, 200025, China(上海交通大学附属瑞金医院泌尿科) Department of Urology, Linyi People’s Hospital, Shandong, 276003, China(临沂人民医院泌尿科) Department of Urology, Zhongshan Hospital, Fudan University, Shanghai, 200032, China(复旦大学中山医院泌尿科)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11695 2025-08-25 cs.CV cs.CL cs.MM 79%

Interpreting the linear structure of vision-language model embedding spaces

Isabel Papadimitriou, Huangyuan Su, Thomas Fel, Sham Kakade, Stephanie Gil

机构 * Kempner Institute for the Study of Natural and Artificial Intelligence at Harvard University(哈佛大学自然与人工智能研究所) Department of Computer Science, Harvard University(哈佛大学计算机科学系)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

Comments COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15904 2025-08-25 cs.CV 78%

Boosting Pathology Foundation Models via Few-shot Prompt-tuning for Rare Cancer Subtyping

Dexuan He, Xiao Zhou, Wenbin Guan, Liyuan Zhang, Xiaoman Zhang, Sinuo Xu, Ge Wang, Lifeng Wang, Xiaojun Yuan, Xin Sun, Yanfeng Wang, Kun Sun, Ya Zhang, Weidi Xie

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) Department of Biomedical Informatics, Harvard Medical School(哈佛医学院生物医学信息学系) Department of Oral Pathology, Shanghai Ninth People’s Hospital, Shanghai Jiao Tong University School of Medicine(上海交通大学医学院第九人民医院口腔病学部) Department of Pathology, Xinhua Hospital Affiliated to Shanghai Jiao Tong University School of Medicine(上海交通大学医学院新华医院病理科) Department of Pediatric Hematology/Oncology, Xinhua Hospital Affiliated to Shanghai Jiao Tong University School of Medicine(上海交通大学医学院新华医院儿童血液肿瘤科) Clinical Research and Innovation Unit, Xinhua Hospital Affiliated to Shanghai Jiao Tong University School of Medicine(上海交通大学医学院新华医院临床研究与创新单元) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 评测与基准 :foundation model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16402 2025-08-25 cs.SE cs.CL 77%

AetherCode: Evaluating LLMs' Ability to Win In Premier Programming Competitions

Zihan Wang, Jiaze Chen, Zhicheng Liu, Markus Mak, Yidi Du, Geonsik Moon, Luoqi Xu, Aaron Tua, Kunshuo Peng, Jiayi Lu, Mingfei Xia, Boqian Zou, Chenyang Ran, Guang Tian, Shoutai Zhu, Yeheng Duan, Zhenghui Kang, Zhenxing Lin, Shangshu Li, Qiang Luo, Qingshen Long, Zhiyong Chen, Yihan Xiao, Yurong Wu, Daoguang Zan, Yuyi Fu, Mingxuan Wang, Ming Ding

机构 * ByteDance M-A-P(字节跳动 M-A-P)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15940 2025-08-25 cs.AR cs.AI cs.CL cs.DC cs.MA 74%

ASIC-Agent: An Autonomous Multi-Agent System for ASIC Design with Benchmark Evaluation

Ahmed Allam, Youssef Mansour, Mohamed Shalan

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI;LLM(comments)

Comments 2025 IEEE International Conference on LLM-Aided Design (ICLAD)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16431 2025-08-25 cs.CL cs.AI 73%

Cetvel: A Unified Benchmark for Evaluating Language Understanding, Generation and Cultural Capacity of LLMs for Turkish

Yakup Abrek Er, Ilker Kesen, Gözde Gül Şahin, Aykut Erdem

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 31 pages, 2 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15804 2025-08-25 cs.CL cs.AI 73%

ReportBench: Evaluating Deep Research Agents via Academic Survey Tasks

Minghao Li, Ying Zeng, Zhihao Cheng, Cong Ma, Kai Jia

机构 * ByteDance BandAI(字节跳动BandAI)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11244 2025-08-25 cs.CL cs.AI 73%

Soteria: Language-Specific Functional Parameter Steering for Multilingual Safety Alignment

Somnath Banerjee, Sayan Layek, Pratyush Chatterjee, Animesh Mukherjee, Rima Hazra

机构 * Indian Institute of Technology Kharagpur(印度理工学院卡里格普尔分校) Eindhoven University of Technology(埃因霍温理工大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Accepted at EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16527 2025-08-25 cs.CV cs.AI 70%

Towards Open World Detection: A Survey

Andrei-Stefan Bulzan, Cosmin Cernazanu-Glavan

机构 * Department of Computer and Information Technology(计算机与信息技术系)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

Comments 30 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16484 2025-08-25 cs.CL 70%

HAMSA: Hijacking Aligned Compact Models via Stealthy Automation

Alexey Krylov, Iskander Vagizov, Dmitrii Korzh, Maryam Douiba, Azidine Guezzaz, Vladimir Kokh, Sergey D. Erokhin, Elena V. Tutubalina, Oleg Y. Rogov

机构 * MIPT(莫斯科国立信息安全学院) Sberbank(俄罗斯储蓄银行) AIRI(人工智能研究机构) MTUCI(莫斯科联邦大学) ISP RAS(俄罗斯科学院信息与通信技术研究所) Cadi Ayyad University(卡迪·艾亚德大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

Comments 9 pages, 1 figure; article under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16139 2025-08-25 cs.CL 70%

XLQA: A Benchmark for Locale-Aware Multilingual Open-Domain Question Answering

Keon-Woo Roh, Yeong-Joon Ju, Seong-Whan Lee

机构 * Department of Artificial Intelligence, Korea University(人工智能系,韩国大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

Comments Accepted to EMNLP 2025 main conference. 12 pages, 4 figures, 7 tables. Code is available at https://github.com/ro-ko/XLQA

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17032 2025-08-25 cs.CL 70%

MINTQA: A Multi-Hop Question Answering Benchmark for Evaluating LLMs on New and Tail Knowledge

Jie He, Nan Hu, Wanqiu Long, Jiaoyan Chen, Jeff Z. Pan

机构 * School of Informatics, University of Edinburgh, UK(爱丁堡大学信息学院) Southeast University, Nanjing, Jiangsu, China(东南大学) University of Manchester, UK(曼彻斯特大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07495 2025-08-25 cs.CL 70%

PublicHearingBR: A Brazilian Portuguese Dataset of Public Hearing Transcripts for Summarization of Long Documents

Leandro Carísio Fernandes, Guilherme Zeferino Rodrigues Dobins, Roberto Lotufo, Jayr Alencar Pereira

机构 * Câmara dos Deputados(国会) Universidade Estadual de Campinas (Unicamp)(campinas州立大学) Universidade Federal do Cariri (UFCA)(Cariri联邦大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16109 2025-08-25 cs.CL cs.LG 62%

From Indirect Object Identification to Syllogisms: Exploring Binary Mechanisms in Transformer Circuits

Karim Saraipour, Shichang Zhang

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Harvard University(哈佛大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06827 2025-08-25 cs.LG cs.AI cs.CR 62%

Who's the Evil Twin? Differential Auditing for Undesired Behavior

Ishwar Balappanawar, Venkata Hasith Vattikuti, Greta Kintzley, Ronan Azimi-Mancel, Satvik Golechha

专题命中 评测与基准 :LLM(abstract);分类 cs.AI、cs.LG

Comments main section: 8 pages, 4 figures, 1 table total: 34 pages, 44 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11427 2025-08-25 cs.LG cs.AI cs.NE 62%

Mergenetic: a Simple Evolutionary Model Merging Library

Adrian Robert Minut, Tommaso Mencattini, Andrea Santilli, Donato Crisostomi, Emanuele Rodolà

机构 * First Author Affiliation(第一作者机构)

专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG

Comments Link: https://github.com/tommasomncttn/mergenetic

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16265 2025-08-25 cs.CL 57%

M3TQA: Massively Multilingual Multitask Table Question Answering

Daixin Shu, Jian Yang, Zhenhe Wu, Xianjie Wu, Xianfu Cheng, Xiangyuan Guan, Yanghai Wang, Pengfei Wu, Tingyang Yang, Hualei Zhu, Wei Zhang, Ge Zhang, Jiaheng Liu, Zhoujun Li

机构 * CCSE, Beihang University(计算机科学与工程学院,北京航空航天大学) M-A-P(M-A-P研究所) Nanjing University(南京大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15986 2025-08-25 cs.CV cs.AI 57%

Automated Multi-label Classification of Eleven Retinal Diseases: A Benchmark of Modern Architectures and a Meta-Ensemble on a Large Synthetic Dataset

Jerry Cao-Xue, Tien Comlekoglu, Keyi Xue, Guanliang Wang, Jiang Li, Gordon Laurie

机构 * Department of Cell Biology, University of Virginia, Charlottesville, VA, USA(细胞生物学系,弗吉尼亚大学) Department of Ophthalmology, University of Virginia, Charlottesville, VA, USA(眼科学系,弗吉尼亚大学) Department of Biomedical Engineering, University of Virginia, Charlottesville, VA, USA(生物医学工程系,弗吉尼亚大学) Department of Biostatistics, University of North Carolina at Chapel Hill, Chapel Hill, NC, USA(生物统计学系,北卡罗来纳大学教堂山分校) Department of Oncology, People’s Hospital of Chongqing, Hechuan, Chongqing, China(肿瘤科,重庆人民医院) Department of Electrical and Computer Engineering, Old Dominion University, Norfolk, VA, USA(电气与计算机工程系,旧 Dominion 大学)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI

Comments 25 pages, 6 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16158 2025-08-25 cs.CV 50%

RAGSR: Regional Attention Guided Diffusion for Image Super-Resolution

Haodong He, Yancheng Bai, Rui Lan, Xu Duan, Lei Sun, Xiangxiang Chu, Gui-Song Xia

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) Amap, Alibaba Group(阿里巴巴集团阿里的)

专题命中 评测与基准 :language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15930 2025-08-25 cs.CV 50%

Semantic-Aware Ship Detection with Vision-Language Integration

Jiahao Li, Jiancheng Pan, Yuze Sun, Xiaomeng Huang

机构 * Department of Earth System Science, Tsinghua University 100084 Beijing, China(地球系统科学系,清华大学)

专题命中 评测与基准 :language model(abstract)

Comments 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏