arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-09-30 至 2025-09-30 共收录 512 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 114 篇

2509.24570 2025-09-30 eess.AS 67%

ISSE: An Instruction-Guided Speech Style Editing Dataset And Benchmark

Yun Chen, Qi Chen, Zheqi Dai, Arshdeep Singh, Philip J. B. Jackson, Mark D. Plumbley

专题命中 评测与基准 :large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24498 2025-09-30 cs.SE 67%

JSProtect: A Scalable Obfuscation Framework for Mini-Games in WeChat

Zhihao Li, Chaozheng Wang, Zongjie Li, Xinyong Peng, Zelin Su, Qun Xia, Haochuan Lu, Ting Xiong, Man Ho Lam, Shuzheng Gao, Yuchong Xie, Cuiyun Gao, Shuai Wang, Yuetang Deng, Huafeng Ma

专题命中 评测与基准 :large language model(abstract);language model(abstract)

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24427 2025-09-30 cs.CV 67%

UI2V-Bench: An Understanding-based Image-to-video Generation Benchmark

Ailing Zhang, Lina Lei, Dehong Kong, Zhixin Wang, Jiaqi Xu, Fenglong Song, Chun-Le Guo, Chang Liu, Fan Li, Jie Chen

机构 * Peking University(北京大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Nankai University(南开大学) Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Tsinghua University(清华大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23713 2025-09-30 cs.CE 67%

Text-to-Code Generation for Modular Building Layouts in Building Information Modeling

Yinyi Wei, Xiao Li

专题命中 评测与基准 :large language model(abstract);language model(abstract)

Comments Accepted at NeurIPS 2025 Main Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22930 2025-09-30 cs.CV 67%

FishAI 2.0: Marine Fish Image Classification with Multi-modal Few-shot Learning

Chenghan Yang, Peng Zhou, Dong-Sheng Zhang, Yueyun Wang, Hong-Bin Shen, Xiaoyong Pan

专题命中 评测与基准 :large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20162 2025-09-30 cs.CE 67%

Modeling Insider Filing Delays in Financial Markets with an Interpretable XGBoost Framework

Cheng Huang, Yao Ma, Fan Gao, Yutong Liu, Yadi Liu, Xiaoli Ma, Ye Aung Moe, Yuhan Zhang, Weizheng Xie, Zeyu Han, Xiangxiang Wang, Hao Wang, Yongbin Yu

专题命中 评测与基准 :large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06554 2025-09-30 cs.IR 67%

SEARA: An Automated Approach for Obtaining Optimal Retrievers

Zou Yuheng, Wang Yiran, Tian Yuzhu, Zhu Min, Huang Yanhua

专题命中 评测与基准 :large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16550 2025-09-30 cs.CL 65%

PropXplain: Can LLMs Enable Explainable Propaganda Detection?

Maram Hasanain, Md Arid Hasan, Mohamed Bayan Kmainasi, Elisa Sartori, Ali Ezzat Shahroor, Giovanni Da San Martino, Firoj Alam

机构 * Qatar Computing Research Institute(卡塔尔计算研究 institute) University of Padova(帕多瓦大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL;large language model(comments);language model(comments)

Comments Large Language Models, Social Media, News Media, Specialized LLMs, Propagandistic content analysis, Fact-checking, Media Analysis, Arabic, English

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24638 2025-09-30 cs.CL cs.LG 62%

Hype or not? Formalizing Automatic Promotional Language Detection in Biomedical Research

Bojan Batalo, Erica K. Shimomoto, Neil Millar

机构 * National Institute of Advanced Industrial Science and Technology(国家工业科学与技术研究院) University of Tsukuba(筑波大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15017 2025-09-30 cs.CL cs.AI cs.SD eess.AS 62%

DM-Codec: Distilling Multimodal Representations for Speech Tokenization

Md Mubtasim Ahasan, Md Fahim, Tasnim Mohiuddin, A K M Mahbubur Rahman, Aman Chadha, Tariq Iqbal, M Ashraful Amin, Md Mofijul Islam, Amin Ahsan Ali

机构 * Center for Computational & Data Sciences, Independent University, Bangladesh(计算与数据科学中心,独立大学,孟加拉国) Amazon GenAI(亚马逊生成人工智能) Qatar Computing Research Institute(卡塔尔计算研究所) University of Virginia(弗吉尼亚大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

Comments Accepted at EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23957 2025-09-30 cs.CL cs.AI 62%

Vision-Grounded Machine Interpreting: Improving the Translation Process through Visual Cues

Claudio Fantinuoli

机构 * University of Mainz(马尔堡大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

Comments Paper presented at AMTA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23938 2025-09-30 cs.CL cs.AI 62%

Easy Turn: Integrating Acoustic and Linguistic Modalities for Robust Turn-Taking in Full-Duplex Spoken Dialogue Systems

Guojian Li, Chengyou Wang, Hongfei Xue, Shuiyuan Wang, Dehui Gao, Zihan Zhang, Yuke Lin, Wenjie Li, Longshuai Xiao, Zhonghua Fu, Lei Xie

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23487 2025-09-30 cs.LG cs.CL cs.CV 62%

Temporal Generalization: A Reality Check

Divyam Madaan, Sumit Chopra, Kyunghyun Cho

机构 * New York University(纽约大学) New York University Grossman School of Medicine(纽约大学格罗斯曼医学院) GenentechCIFAR(基因泰克CIFAR)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23486 2025-09-30 cs.CL cs.AI 62%

Text-Based Approaches to Item Difficulty Modeling in Large-Scale Assessments: A Systematic Review

Sydney Peters, Nan Zhang, Hong Jiao, Ming Li, Tianyi Zhou, Robert Lissitz

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

Comments 45 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22729 2025-09-30 cs.CL cs.AI 62%

Multi-Modal Sentiment Analysis with Dynamic Attention Fusion

Sadia Abdulhalim, Muaz Albaghdadi, Moshiur Farazi

机构 * University of Doha for Science and Technology(多哈科学技术大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

Comments Paper accepted for presentation at the ACS/IEEE 22nd International Conference on Computer Systems and Applications (AICCSA 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24875 2025-09-30 cs.CV cs.LG 57%

Environment-Aware Satellite Image Generation with Diffusion Models

Nikos Kostagiolas, Pantelis Georgiades, Yannis Panagakis, Mihalis A. Nicolaou

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24792 2025-09-30 cs.CL 57%

Evaluating Spatiotemporal Consistency in Automatically Generated Sewing Instructions

Luisa Geiger, Mareike Hartmann, Michael Sullivan, Alexander Koller

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

Comments 18 pages, 14 figures; to be published in EMNLP 2025 proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24640 2025-09-30 cs.CV cs.AI 57%

Can you SPLICE it together? A Human Curated Benchmark for Probing Visual Reasoning in VLMs

Mohamad Ballout, Okajevo Wilfred, Seyedalireza Yaghoubi, Nohayr Muhammad Abdelmoneim, Julius Mayer, Elia Bruni

机构 * Institute of Cognitive Science, Osnabrück University(认知科学研究所,奥斯纳布吕克大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24192 2025-09-30 cs.CV cs.AI 57%

Talk in Pieces, See in Whole: Disentangling and Hierarchical Aggregating Representations for Language-based Object Detection

Sojung An, Kwanyong Park, Yong Jae Lee, Donghyun Kim

机构 * Korea University(韩国大学) University of Seoul(首尔大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

Comments 23 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24133 2025-09-30 cs.CV cs.CL 57%

Generalist Scanner Meets Specialist Locator: A Synergistic Coarse-to-Fine Framework for Robust GUI Grounding

Zhecheng Li, Guoxian Song, Yiwei Wang, Zhen Xiong, Junsong Yuan, Yujun Cai

机构 * University of California, San Diego(加州大学圣地亚哥分校) ByteDance(字节跳动) University of California, Merced(加州大学默塞德分校) University of Southern California(南加州大学) University at Buffalo(布法罗大学) The University of Queensland(昆士兰大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13359 2025-09-30 cs.CY cs.AI 57%

Evaluating undergraduate mathematics examinations in the era of generative AI: a curriculum-level case study

Benjamin J. Walker, Nikoleta Kalaydzhieva, Beatriz Navarro Lameda, Ruth A. Reynolds

机构 * Department of Mathematics(数学系) University College London(伦敦大学学院)

专题命中 评测与基准 :prompting(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11303 2025-09-30 cs.CL 57%

Ko-PIQA: A Korean Physical Commonsense Reasoning Dataset with Cultural Context

Dasol Choi, Jungwhan Kim, Guijin Son

专题命中 评测与基准 :language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11104 2025-09-30 cs.LG 57%

BIGNet: Pretrained Graph Neural Network for Embedding Semantic, Spatial, and Topological Data in BIM Models

Jin Han, Xin-Zheng Lu, Jia-Rui Lin

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

Journal ref Computer-Aided Civil and Infrastructure Engineering, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04361 2025-09-30 cs.AI 57%

OmniPlay: Benchmarking Omni-Modal Models on Omni-Modal Game Playing

Fuqing Bie, Shiyu Huang, Xijia Tao, Zhiqin Fang, Leyi Pan, Junzhe Chen, Min Ren, Liuyu Xiang, Zhaofeng He

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) XPENG The University of Hong Kong(香港大学) Tsinghua University(清华大学)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19203 2025-09-30 cs.SD cs.AI eess.AS 57%

EnvSDD: Benchmarking Environmental Sound Deepfake Detection

Han Yin, Yang Xiao, Rohan Kumar Das, Jisheng Bai, Haohe Liu, Wenwu Wang, Mark D Plumbley

机构 * Speech Lab(语音实验室) Centre for Vision, Speech and Signal Processing (CVSSP)(视觉、语音和信号处理中心)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI

Comments Proceedings of Interspeech 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15402 2025-09-30 cs.SD cs.AI eess.AS 57%

Prosody-Adaptable Audio Codecs for Zero-Shot Voice Conversion via In-Context Learning

Junchuan Zhao, Xintong Wang, Ye Wang

机构 * School of Computing(计算学院)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

Comments 5 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23779 2025-09-30 cs.LG 57%

Trained Mamba Emulates Online Gradient Descent in In-Context Linear Regression

Jiarui Jiang, Wei Huang, Miao Zhang, Taiji Suzuki, Liqiang Nie

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) RIKEN AIP(日本理化学研究所AIP) University of Tokyo(东京大学)

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23504 2025-09-30 cs.CL 57%

AraS2P: Arabic Speech-to-Phonemes System

Bassam Matar, Mohamed Fayed, Ayman Khalafallah

专题命中 评测与基准 :pretraining(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22908 2025-09-30 cs.SE cs.LG cs.PL 57%

A benchmark for vericoding: formally verified program synthesis

Sergiu Bursuc, Theodore Ehrenborg, Shaowei Lin, Lacramioara Astefanoaei, Ionel Emilian Chiosa, Jure Kukovec, Alok Singh, Oliver Butterley, Adem Bizid, Quinn Dougherty, Miranda Zhao, Max Tan, Max Tegmark

专题命中 评测与基准 :LLM(abstract);分类 cs.LG

Comments 25 pages, 1 figure; data available at https://github.com/Beneficial-AI-Foundation/vericoding-benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01565 2025-09-30 cs.CL cs.CV 57%

Hanfu-Bench: A Multimodal Benchmark on Cross-Temporal Cultural Understanding and Transcreation

Li Zhou, Lutong Yu, Dongchu Xie, Shaohuan Cheng, Wenyan Li, Haizhou Li

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shenzhen Research Institute of Big Data(深圳大数据研究院) Chengdu Technological University(成都理工大学) University of Copenhagen(哥本哈根大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

Comments Cultural Analysis, Cultural Visual Understanding, Cultural Image Transcreation. Accepted by EMNLP 2025 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏