arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-09-12 至 2025-09-12 共收录 116 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 36 篇

2508.20655 2025-09-12 cs.CV cs.CL 77%

Improving Alignment in LVLMs with Debiased Self-Judgment

Sihan Yang, Chenhang Cui, Zihao Zhao, Yiyang Zhou, Weilong Yan, Ying Wei, Huaxiu Yao

机构 * Nanyang Technological University(南洋理工大学) National University of Singapore(新加坡国立大学) UNC-Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 评测与基准 :large language model(abstract);language model(abstract);instruction tuning(abstract);分类 cs.CL

Comments EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09321 2025-09-12 cs.AI 77%

Towards Adaptive ML Benchmarks: Web-Agent-Driven Construction, Domain Expansion, and Metric Optimization

Hangyi Jia, Yuxi Qian, Hanwen Tong, Xinhui Wu, Lin Chen, Feng Wei

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09234 2025-09-12 cs.CL 77%

Agentic LLMs for Question Answering over Tabular Data

Rishit Tyagi, Mohit Gupta, Rahul Bouri

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments Accepted at ACL workshop SemEval 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09101 2025-09-12 cs.CL 77%

TigerCoder: A Novel Suite of LLMs for Code Generation in Bangla

Nishat Raihan, Antonios Anastasopoulos, Marcos Zampieri

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08960 2025-09-12 cs.CL 77%

BRoverbs -- Measuring how much LLMs understand Portuguese proverbs

Thales Sales Almeida, Giovana Kerche Bonás, João Guilherme Alves Santos

机构 * Institute of Computing, University of Campinas(计算研究所,坎皮纳斯大学) Maritaca AI University of Campinas(坎皮纳斯大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04077 2025-09-12 cs.CL cs.SD eess.AS 77%

A Novel Data Augmentation Approach for Automatic Speaking Assessment on Opinion Expressions

Chung-Chun Wang, Jhen-Ke Lin, Hao-Chien Lu, Hong-Yun Lin, Berlin Chen

机构 * National Taiwan Normal University(台湾国立台湾师范大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments submitted to the ISCA SLaTE-2025 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08847 2025-09-12 cs.AI cs.CL cs.LG cs.SE 75%

Automated Unity Game Template Generation from GDDs via NLP and Multi-Modal LLMs

Amna Hassan

机构 * UET Taxila(塔希尔大学工程学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.13591 2025-09-12 cs.CV cs.AI cs.CL 73%

Improved GUI Grounding via Iterative Narrowing

Anthony Nguyen

机构 * Algoma University(阿尔戈马大学)

专题命中 评测与基准 :language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

Comments Code available at https://github.com/ant-8/GUI-Grounding-via-Iterative-Narrowing

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09014 2025-09-12 cs.CV cs.CL 70%

COCO-Urdu: A Large-Scale Urdu Image-Caption Dataset with Multimodal Quality Estimation

Umair Hassan

机构 * Independent Researcher(独立研究者)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

Comments 17 pages, 3 figures, 3 tables. Dataset available at https://huggingface.co/datasets/umairhassan02/urdu-translated-coco-captions-subset. Scripts and notebooks to reproduce results available at https://github.com/umair-hassan2/COCO-Urdu

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08538 2025-09-12 cs.CV cs.AI 70%

MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models

Garry Yang, Zizhe Chen, Man Hon Wong, Haoyu Lei, Yongqiang Chen, Zhenguo Li, Kaiwen Zhou, James Cheng

机构 * The Chinese University of Hong Kong(香港中文大学) Huawei Noah's Ark Lab(华为诺亚实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05710 2025-09-12 cs.SE cs.AI 70%

Klear-CodeTest: Scalable Test Case Generation for Code Reinforcement Learning

Jia Fu, Xinyu Yang, Hongzhi Zhang, Yahui Liu, Jingyuan Zhang, Qi Wang, Fuzheng Zhang, Guorui Zhou

机构 * Kuaishou Technology(快手科技)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

Comments 21 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01523 2025-09-12 cs.CL 70%

CondAmbigQA: A Benchmark and Dataset for Conditional Ambiguous Question Answering

Zongxi Li, Yang Li, Haoran Xie, S. Joe Qin

机构 * School of Data Science, Lingnan University(数据科学学院) School of Science and Technology, Hong Kong Metropolitan University(科技学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

Comments Accepted by EMNLP 2025 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09396 2025-09-12 cs.LG cs.AI cs.CL 67%

LLMs Don't Know Their Own Decision Boundaries: The Unreliability of Self-Generated Counterfactual Explanations

Harry Mayne, Ryan Othniel Kearns, Yushi Yang, Andrew M. Bean, Eoin Delaney, Chris Russell, Adam Mahdi

机构 * University of Oxford(牛津大学) Trinity College Dublin(都柏林三一学院)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to EMNLP 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09254 2025-09-12 cs.CV cs.MM 67%

Towards Better Dental AI: A Multimodal Benchmark and Instruction Dataset for Panoramic X-ray Analysis

Jing Hao, Yuxuan Fan, Yanpeng Sun, Kaixin Guo, Lizhuo Lin, Jinrong Yang, Qi Yong H. Ai, Lun M. Wong, Hao Tang, Kuo Feng Hung

机构 * Faculty of Dentistry, The University of Hong Kong(香港大学牙科学院) The Hong Kong University of Science and Technology (GZ)(香港科学与技术大学) National University of Singapore(新加坡国立大学) CVTE Sun Yat-sen University(孙中山大学) Department of Diagnostic Radiology, The University of Hong Kong(香港大学放射科) Imaging and Interventional Radiology, Faculty of Medicine, The Chinese University of Hong Kong(香港中文大学医学院影像与介入放射科) School of Computer Science, Peking University(北京大学计算机科学系)

专题命中 评测与基准 :language model(abstract);SFT(abstract)

Comments 40 pages, 26 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09160 2025-09-12 cs.CL cs.AI 62%

Target-oriented Multimodal Sentiment Classification with Counterfactual-enhanced Debiasing

Zhiyue Liu, Fanrong Ma, Xin Ling

机构 * School of Computer, Electronics and Information(计算机、电子与信息学院) Guangxi University(广西大学) Guangxi Key Laboratory of Multimedia Communications(广西多媒体通信与网络技术重点实验室) School of Sociology and Anthropology(社会学与人类学学院) Sun Yat-sen University(中山大学)

专题命中 评测与基准 :prompting(abstract);分类 cs.CL、cs.AI

Comments Accepted by the IEEE International Conference on Multimedia and Expo (ICME 2025). © 2025 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09680 2025-09-12 cs.CV cs.CL 57%

FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark

Rongyao Fang, Aldrich Yu, Chengqi Duan, Linjiang Huang, Shuai Bai, Yuxuan Cai, Kun Wang, Si Liu, Xihui Liu, Hongsheng Li

机构 * CUHK(香港中文大学) HKU(香港大学) BUAA(北京航空航天大学) Alibaba(阿里巴巴)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

Comments Project page: https://flux-reason-6m.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08907 2025-09-12 cs.CL 57%

Automated Evidence Extraction and Scoring for Corporate Climate Policy Engagement: A Multilingual RAG Approach

Imene Kolli, Ario Saeid Vaghefi, Chiara Colesanti Senni, Shantam Raj, Markus Leippold

机构 * University of Zurich, Department of Finance(苏黎世大学金融系) University of Zurich, Department of Informatics(苏黎世大学信息学系) Swiss Finance Institute(瑞士金融研究所)

专题命中 评测与基准 :prompting(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04493 2025-09-12 cs.CV cs.CL 57%

ReceiptSense: Beyond Traditional OCR -- A Dataset for Receipt Understanding

Abdelrahman Abdallah, Mohamed Mounis, Mahmoud Abdalla, Mahmoud SalahEldin Kasem, Mohamed Mahmoud, Ibrahim Abdelhalim, Mohamed Elkasaby, Yasser ElBendary, Adam Jatowt

机构 * Innsbruck University(因斯布鲁克大学) High Institute for Computers(计算机与管理信息高级学院) Chungbuk National University(Chungbuk国立大学) Louisville University(路易斯维尔大学) University of Innsbruck(因斯布鲁克大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09311 2025-09-12 cs.CV 50%

Image Recognition with Vision and Language Embeddings of VLMs

Illia Volkov, Nikita Kisel, Klara Janouskova, Jiri Matas

机构 * Visual Recognition Group, Faculty of Electrical Engineering, Czech Technical University in Prague(视觉识别组,电气工程学院,布拉格捷克技术大学)

专题命中 评测与基准 :language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09172 2025-09-12 cs.CV 50%

Bridging the Gap Between Ideal and Real-world Evaluation: Benchmarking AI-Generated Image Detection in Challenging Scenarios

Chunxiao Li, Xiaoxiao Wang, Meiling Li, Boming Miao, Peng Sun, Yunjian Zhang, Xiangyang Ji, Yao Zhu

机构 * Beijing Normal University(北京师范大学) University of Chinese Academy of Sciences(中国科学院大学) Fudan University(复旦大学) Central University of Finance and Economics(中央财经大学) Tsinghua University(清华大学)

专题命中 评测与基准 :language model(abstract)

Comments ICCV2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08940 2025-09-12 cs.CV 50%

Discovering Divergent Representations between Text-to-Image Models

Lisa Dunlap, Joseph E. Gonzalez, Trevor Darrell, Fabian Caba Heilbron, Josef Sivic, Bryan Russell

专题命中 评测与基准 :LLM(abstract)

Comments Accepted to ICCV 2025. Code available at https://github.com/adobe-research/CompCon

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08935 2025-09-12 cs.CV 50%

Live(r) Die: Predicting Survival in Colorectal Liver Metastasis

Muhammad Alberb, Helen Cheung, Anne Martel

机构 * Department of Medical Biophysics, University of Toronto, Toronto, ON, Canada(多伦多大学医学生物物理学系) Department of Medical Imaging, University of Toronto, Toronto, ON, Canada(多伦多大学医学影像学系) Sunnybrook Research Institute, Toronto, ON, Canada(辛普森研究学院)

专题命中 评测与基准 :foundation model(abstract)

Comments Thesis at Erasmus Mundus Joint Master's Degree in Medical Imaging and Applications

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05019 2025-09-12 cs.CE 50%

FinMultiTime: A Four-Modal Bilingual Dataset for Financial Time-Series Analysis

Wenyan Xu, Dawei Xiang, Yue Liu, Xiyu Wang, Yanxiang Ma, Liang Zhang, Shu Hu, Chang Xu, Jiaheng Zhang

专题命中 评测与基准 :language model(abstract)

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.03486 2025-09-12 cs.CR cs.CV cs.SI 50%

UnsafeBench: Benchmarking Image Safety Classifiers on Real-World and AI-Generated Images

Yiting Qu, Xinyue Shen, Yixin Wu, Michael Backes, Savvas Zannettou, Yang Zhang

机构 * CISPA Helmholtz Center for Information Security(CISPA赫尔姆霍茨信息安全中心) TU Delft(代尔夫特理工大学)

专题命中 评测与基准 :language model(abstract)

Comments To Appear in the ACM Conference on Computer and Communications Security (CCS), October 13, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 效率与部署 13 篇

2509.09675 2025-09-12 cs.CL cs.AI cs.LG 90%

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models

Runpeng Dai, Linfeng Song, Haolin Liu, Zhenwen Liang, Dian Yu, Haitao Mi, Zhaopeng Tu, Rui Liu, Tong Zheng, Hongtu Zhu, Dong Yu

机构 * Tencent AI Lab(腾讯AI实验室) Tencent Multimodal Department(腾讯多模态部门) University of North Carolina at Chapel Hill(北卡罗来纳大学夏洛特分校) University of Virginia(弗吉尼亚大学) University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09424 2025-09-12 cs.CR cs.AI 89%

ENSI: Efficient Non-Interactive Secure Inference for Large Language Models

Zhiyu He, Maojiang Wang, Xinwen Gao, Yuchuan Luo, Lin Liu, Shaojing Fu

机构 * College of Computer Science and Technology(计算机科学与技术学院) National University of Defense Technology(国防科技大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14032 2025-09-12 cs.AI 89%

KROMA: Ontology Matching with Knowledge Retrieval and Large Language Models

Lam Nguyen, Erika Barcelos, Roger French, Yinghui Wu

机构 * Case Western Reserve University(凯斯西储大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

Comments Accepted to the 24th International Semantic Web Conference Research Track (ISWC 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08867 2025-09-12 cs.SE cs.AI 89%

Benchmarking Energy Efficiency of Large Language Models Using vLLM

K. Pronk, Q. Zhao

机构 * Allumni Master Applied IT Fontys University of Applied Sciences Eindhoven, The Netherlands Sustainable Data \& AI Group Fontys University of Applied Sciences Eindhoven, The Netherlands

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

Comments 6 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08853 2025-09-12 cs.CY 89%

POW: Political Overton Windows of Large Language Models

Leif Azzopardi, Yashar Moshfeghi

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

Comments Accepted in EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09091 2025-09-12 cs.CR cs.AI 85%

Towards Confidential and Efficient LLM Inference with Dual Privacy Protection

Honglan Yu, Yibin Wang, Feifei Dai, Dong Liu, Haihui Fan, Xiaoyan Gu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) State Key Laboratory of Cyberspace Security Defense(网络空间安全防御国家重点实验室)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments Accepted by DASFAA2025

详情

展开后加载摘要…

URL PDF HTML 收藏