arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-09-03 至 2025-09-03 共收录 358 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 72 篇

2502.08869 2025-09-03 cs.LG cs.AI cs.CV 73%

Harnessing Vision Models for Time Series Analysis: A Survey

Jingchao Ni, Ziming Zhao, ChengAo Shen, Hanghang Tong, Dongjin Song, Wei Cheng, Dongsheng Luo, Haifeng Chen

机构 * University of Houston(德克萨斯大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Connecticut(康涅狄格大学) NEC Laboratories America(日本 NEC 美国实验室) Florida International University(佛罗里达国际大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15907 2025-09-03 cs.CL cs.AI 73%

Development of a Large-scale Dataset of Chest Computed Tomography Reports in Japanese and a High-performance Finding Classification Model

Yosuke Yamagishi, Yuta Nakamura, Tomohiro Kikuchi, Yuki Sonoda, Hiroshi Hirakawa, Shintaro Kano, Satoshi Nakamura, Shouhei Hanaoka, Takeharu Yoshikawa, Osamu Abe

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Dataset available at https://huggingface.co/datasets/YYama0/CT-RATE-JPN

Journal ref JMIR Med Inform 2025;13:e71137

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03612 2025-09-03 cs.CL 72%

AIR: A Systematic Analysis of Annotations, Instructions, and Response Pairs in Preference Dataset

Bingxiang He, Wenbin Zhang, Jiaxi Song, Cheng Qian, Zixuan Fu, Bowen Sun, Ning Ding, Haiwen Hong, Longtao Huang, Hui Xue, Ganqu Cui, Wanxiang Che, Zhiyuan Liu, Maosong Sun

机构 * Tsinghua University(清华大学) Harbin Institute of Technology(哈尔滨工业大学) Shanghai AI Lab(上海人工智能实验室) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Alibaba Group(阿里巴巴集团)

专题命中 评测与基准 :language model(abstract,comments);large language model(abstract);分类 cs.CL

Comments Accept at the Conference On Language Modeling (COLM) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21496 2025-09-03 cs.CV cs.AI 70%

ELV-Halluc: Benchmarking Semantic Aggregation Hallucinations in Long Video Understanding

Hao Lu, Jiahao Wang, Yaolun Zhang, Ruohui Wang, Xuanyu Zheng, Yepeng Tang, Dahua Lin, Lewei Lu

机构 * Sensetime(秒氏科技)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02007 2025-09-03 cs.AI 70%

mFARM: Towards Multi-Faceted Fairness Assessment based on HARMs in Clinical Decision Support

Shreyash Adappanavar, Krithi Shailya, Gokul S Krishnan, Sriraam Natarajan, Balaraman Ravindran

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18906 2025-09-03 cs.CL cs.IR 70%

Federated Retrieval-Augmented Generation: A Systematic Mapping Study

Abhijit Chakraborty, Chahana Dahal, Vivek Gupta

机构 * Arizona State University(亚利桑那州立大学) University of Nevada, Las Vegas(内华达大学拉斯维加斯分校)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00629 2025-09-03 cs.CL 70%

Can Multi-turn Self-refined Single Agent LMs with Retrieval Solve Hard Coding Problems?

Md Tanzib Hosain, Md Kishor Morol

机构 * American International University-Bangladesh(美国国际大学(Bangladesh)) Cornell University(康奈尔大学) ELITE Research Lab(ELITE研究实验室)

专题命中 评测与基准 :language model(abstract);prompting(abstract);分类 cs.CL

Comments Accepted in Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Student Research Workshop), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07612 2025-09-03 cs.CL 70%

SaRoHead: Detecting Satire in a Multi-Domain Romanian News Headline Dataset

Mihnea-Alexandru Vîrlan, Răzvan-Alexandru Smădu, Dumitru-Clementin Cercel, Florin Pop, Mihaela-Claudia Cercel

机构 * National University of Science and Technology POLITEHNICA Bucharest, Faculty of Automatic Control and Computers(波兰技术大学布加勒斯特分校国家科学技术大学) National Institute for Research & Development in Informatics - ICI Bucharest(布加勒斯特信息与计算研究所) Paris 1 Panthéon-Sorbonne University(巴黎一大学) University of Bucharest(布加勒斯特大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

Comments 13 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02359 2025-09-03 cs.CV 67%

Why Do MLLMs Struggle with Spatial Understanding? A Systematic Analysis from Data to Architecture

Wanyue Zhang, Yibin Huang, Yangbin Xu, JingJing Huang, Helu Zhi, Shuo Ren, Wang Xu, Jiajun Zhang

专题命中 评测与基准 :large language model(abstract);language model(abstract)

Comments The benchmark MulSeT is available at https://huggingface.co/datasets/WanyueZhang/MulSeT

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02164 2025-09-03 cs.CV 67%

Omnidirectional Spatial Modeling from Correlated Panoramas

Xinshen Zhang, Tongxi Fu, Xu Zheng

机构 * The Hong Kong Polytechnic University(香港理工大学) Zhejiang Sci-Tech University(浙江科技学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01259 2025-09-03 cs.CV 67%

ReCap: Event-Aware Image Captioning with Article Retrieval and Semantic Gaussian Normalization

Thinh-Phuc Nguyen, Thanh-Hai Nguyen, Gia-Huy Dinh, Lam-Huy Nguyen, Minh-Triet Tran, Trung-Nghia Le

机构 * University of Science, VNU-HCM(越南胡志明市科学大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

Comments ACM Multimedia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16318 2025-09-03 cs.SE 67%

SATORI: Static Test Oracle Generation for REST APIs

Juan C. Alonso, Alberto Martin-Lopez, Sergio Segura, Gabriele Bavota, Antonio Ruiz-Cortés

专题命中 评测与基准 :large language model(abstract);language model(abstract)

Comments Accepted for publication at 40th IEEE/ACM International Conference on Automated Software Engineering, ASE 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16988 2025-09-03 cs.IR 67%

RAGentA: Multi-Agent Retrieval-Augmented Generation for Attributed Question Answering

Ines Besrour, Jingbo He, Tobias Schreieder, Michael Färber

专题命中 评测与基准 :large language model(abstract);language model(abstract)

Comments Accepted at SIGIR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09146 2025-09-03 cs.CV cs.MM 67%

Generative Frame Sampler for Long Video Understanding

Linli Yao, Haoning Wu, Kun Ouyang, Yuanxing Zhang, Caiming Xiong, Bei Chen, Xu Sun, Junnan Li

机构 * National Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(国家多媒体信息处理重点实验室,计算机学院,北京大学) Peking University(北京大学) Salesforce Research(Salesforce 研究) Independent Researcher(独立研究者)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

Comments ACL 2025 Findings. Code: https://github.com/yaolinli/GenS

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16680 2025-09-03 cs.CV 67%

AeroReformer: Aerial Referring Transformer for UAV-based Referring Image Segmentation

Rui Li, Xiaowei Zhao

机构 * Intelligent Control \& Smart Energy (ICSE) Research Group, School of Engineering, University of Warwick, Coventry, CV4 7AL, UK

专题命中 评测与基准 :large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00576 2025-09-03 cs.RO cs.CV 67%

Galaxea Open-World Dataset and G0 Dual-System VLA Model

Tao Jiang, Tianyuan Yuan, Yicheng Liu, Chenhao Lu, Jianning Cui, Xiao Liu, Shuiqi Cheng, Jiyang Gao, Huazhe Xu, Hang Zhao

机构 * Galaxea Team(Galaxea 团队)

专题命中 评测与基准 :language model(abstract);post-training(abstract)

Comments https://opengalaxea.github.io/G0/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13602 2025-09-03 cs.CV 67%

PersonaVlog: Personalized Multimodal Vlog Generation with Multi-Agent Collaboration and Iterative Self-Correction

Xiaolu Hou, Bing Ma, Jiaxiang Cheng, Xuhua Ren, Kai Yu, Wenyue Li, Tianxiang Zheng, Qinglin Lu

专题命中 评测与基准 :large language model(abstract);language model(abstract)

Comments Project Page: https://personavlog-paper.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.02592 2025-09-03 cs.CV 67%

OCR Hinders RAG: Evaluating the Cascading Impact of OCR on Retrieval-Augmented Generation

Junyuan Zhang, Qintong Zhang, Bin Wang, Linke Ouyang, Zichen Wen, Ying Li, Ka-Ho Chow, Conghui He, Wentao Zhang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Peking University(北京大学) The University of HongKong(香港大学) Shanghai Jiaotong University(上海交通大学) Beihang University(北京航空航天大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20760 2025-09-03 cs.CV cs.AI 57%

Occlusion Robustness of CLIP for Military Vehicle Classification

Jan Erik van Woerden, Gertjan Burghouts, Lotte Nijskens, Alma M. Liezenga, Sabina van Rooij, Frank Ruis, Hugo J. Kuijf

专题命中 评测与基准 :language model(abstract);分类 cs.AI

Comments To be presented at SPIE: Sensors + Imaging, Artificial Intelligence for Security and Defence Applications II

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15748 2025-09-03 cs.AI 57%

AI Chaperones Are (Really) All You Need to Prevent Parasocial Relationships with Chatbots

Emma Rath, Stuart Armstrong, Rebecca Gorman

专题命中 评测与基准 :language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00484 2025-09-03 cs.CV cs.AI 57%

VideoRewardBench: Comprehensive Evaluation of Multimodal Reward Models for Video Understanding

Zhihong Zhang, Xiaojian Huang, Jin Xu, Zhuodong Luo, Xinzhi Wang, Jiansheng Wei, Xuejin Chen

机构 * University of Science and Technology of China(中国科学技术大学) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

Comments https://videorewardbench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00029 2025-09-03 cs.SD cs.AI cs.MM eess.AS 57%

From Sound to Sight: Towards AI-authored Music Videos

Leo Vitasovic, Stella Graßhof, Agnes Mercedes Kloft, Ville V. Lehtola, Martin Cunneen, Justyna Starostka, Glenn McGarry, Kun Li, Sami S. Brandt

机构 * IT University of Copenhagen(哥本哈根IT大学) Aalto University(艾尔沃斯大学) University of Twente(特文特大学) University of Limerick(利默里克大学) University of Nottingham(诺丁汉大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

Comments 1st Workshop on Generative AI for Storytelling (AISTORY), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20778 2025-09-03 cs.IR cs.LG 57%

SEAL: Structure and Element Aware Learning to Improve Long Structured Document Retrieval

Xinhao Huang, Zhibo Ren, Yipeng Yu, Ying Zhou, Zulong Chen, Zeyi Wen

机构 * HKUST (Guangzhou)(香港科技大学(广州)) HKUST(香港科技大学) Alibaba Group(阿里巴巴集团) Zhejiang Lab(浙江实验室)

专题命中 评测与基准 :language model(abstract);分类 cs.LG

Comments Accepted at EMNLP 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19944 2025-09-03 cs.CV cs.CL 57%

KRETA: A Benchmark for Korean Reading and Reasoning in Text-Rich VQA Attuned to Diverse Visual Contexts

Taebaek Hwang, Minseo Kim, Gisang Lee, Seonuk Kim, Hyunjun Eun

机构 * Waddle Seoul National University(首尔国立大学) Krafton UNIST(全南大学) SK Telecom(SK电信)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

Comments Accepted to EMNLP 2025 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01755 2025-09-03 physics.med-ph 50%

A comprehensive study on the characterization of lyzed blood samples using dual-wavelength photoacoustics

Subhadip Paul, Hari Shankar Patel, Vatsala Misra, Ravi Rani, Amaresh K. Sahoo, Ratan K. Saha

专题命中 评测与基准 :prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01419 2025-09-03 eess.AS 50%

Characterization of Speech Similarity Between Australian Aboriginal and High-Resource Languages: A Case Study on Dharawal

Ting Dang, Trini Manoj Jeyaseelan, Eliathamby Ambikairajah, Vidhyasaharan Sethu

专题命中 评测与基准 :foundation model(abstract)

Comments Accepted at APSIPA ASC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01209 2025-09-03 cs.CV 50%

Measuring Image-Relation Alignment: Reference-Free Evaluation of VLMs and Synthetic Pre-training for Open-Vocabulary Scene Graph Generation

Maëlic Neau, Zoe Falomir, Cédric Buche, Akihiro Sugimoto

机构 * Computing Science Department, Umeå University(乌梅大学计算科学系) CNRS IRL 2010 CROSSING(法国CNRS IRL 2010 CROSSING) IMT Atlantique(IMT阿蒂昂大学) National Institute of Informatics(日本信息机构)

专题命中 评测与基准 :language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00226 2025-09-03 cs.CV astro-ph.GA 50%

GraViT: Transfer Learning with Vision Transformers and MLP-Mixer for Strong Gravitational Lens Discovery

René Parlange, Juan C. Cuevas-Tello, Octavio Valenzuela, Omar de J. Cabrera-Rosas, Tomás Verdugo, Anupreeta More, Anton T. Jaelani

机构 * Facultad de Ingeniería, Universidad Autónoma de San Luis Potosí(圣路易斯波托西自治大学工程学院) Universidad Nacional Autónoma de México. Instituto de Astronomía(墨西哥国家自治大学天文研究所) Inter-University Centre for Astronomy and Astrophysics (IUCAA)(天文学与天体物理学跨大学研究中心) Kavli IPMU (WPI), UTIAS, The University of Tokyo(Kavli IPMU(WPI),东京大学UTIAS) Astronomy Research Group and Bosscha Observatory, FMIPA, Institut Teknologi Bandung(天文学研究组和博斯卡天文台,万隆理工学院) U-CoE AI-VLB, Institut Teknologi Bandung(人工智能与视觉学习卓越中心,万隆理工学院) University Center of Excellence for Space Science, Technology and Innovation, Institut Teknologi Bandung(空间科学、技术和创新卓越大学中心,万隆理工学院)

专题命中 评测与基准 :pretraining(abstract)

Comments Our publicly available fine-tuned models provide a scalable transfer learning solution for gravitational lens finding in LSST. Submitted to MNRAS. Comments welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00131 2025-09-03 cs.CV eess.IV q-bio.QM 50%

Self-supervised large-scale kidney abnormality detection in drug safety assessment studies

Ivan Slootweg, Natalia P. García-De-La-Puente, Geert Litjens, Salma Dammak

机构 * Department of Pathology, Radboud University Medical Center(拉德堡德大学医学中心病理科部) Instituto Universitario de Investigación en Tecnología Centrada en el Ser Humano, Universitat Politècnica de València(人类中心技术大学研究机构,巴塞罗那理工大学)

专题命中 评测与基准 :foundation model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 效率与部署 59 篇

2404.18311 2025-09-03 cs.LG cs.AI cs.CL 90%

Towards Incremental Learning in Large Language Models: A Critical Review

Mladjan Jovanovic, Peter Voss

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏