arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-08-04 至 2025-08-04 共收录 26 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 26 篇

2508.00673 2025-08-04 cs.CL 89%

MELAC: Massive Evaluation of Large Language Models with Alignment of Culture in Persian Language

Farhan Farsi, Farnaz Aghababaloo, Shahriar Shariati Motlagh, Parsa Ghofrani, MohammadAli SadraeiJavaheri, Shayan Bali, Amirhossein Shabani, Farbod Bijary, Ghazal Zamaninejad, AmirMohammad Salehoof, Saeedeh Momtazi

机构 * Amirkabir University of Technology(阿姆irkabir技术大学) Part AI Research Center(Part人工智能研究中心) University of Mazandaran(马赞德兰大学) King’s College London(伦敦国王学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments Preprint. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00321 2025-08-04 cs.HC 89%

Evaluating the Efficacy of Large Language Models for Generating Fine-Grained Visual Privacy Policies in Homes

Shuning Zhang, Ying Ma, Xin Yi, Hewu Li

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00788 2025-08-04 cs.CL cs.AI 88%

Do They Understand Them? An Updated Evaluation on Nonbinary Pronoun Handling in Large Language Models

Xushuo Tang, Yi Ding, Zhengyi Yang, Yin Chen, Yongrui Gu, Wenke Yang, Mingchen Ju, Xin Cao, Yongfei Liu, Wenjie Zhang

机构 * The University of New South Wales(新南威尔士大学) University of Technology Sydney(技术大学悉尼分校) Euler AI

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00726 2025-08-04 cs.CV 88%

MIHBench: Benchmarking and Mitigating Multi-Image Hallucinations in Multimodal Large Language Models

Jiale Li, Mingrui Wu, Zixiang Jin, Hao Chen, Jiayi Ji, Xiaoshuai Sun, Liujuan Cao, Rongrong Ji

机构 * Xiamen University(厦门大学) Zhongguancun Academy(中关村学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

Comments ACM MM25 has accepted this paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00435 2025-08-04 cs.CL 87%

AILS-NTUA at SemEval-2025 Task 8: Language-to-Code prompting and Error Fixing for Tabular Question Answering

Andreas Evangelatos, Giorgos Filandrianos, Maria Lymperaiou, Athanasios Voulodimos, Giorgos Stamou

机构 * National Technical University of Athens(希腊国家技术大学)

专题命中 评测与基准 :prompting(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

Journal ref The 19th International Workshop on Semantic Evaluation (SemEval 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18203 2025-08-04 cs.HC cs.AI cs.CL cs.LG 87%

Policy Maps: Tools for Guiding the Unbounded Space of LLM Behaviors

Michelle S. Lam, Fred Hohman, Dominik Moritz, Jeffrey P. Bigham, Kenneth Holstein, Mary Beth Kery

机构 * Stanford University(斯坦福大学) Apple(苹果公司) Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments UIST 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00422 2025-08-04 cs.PL cs.LG 86%

Automated Type Annotation in Python Using Large Language Models

Varun Bharti, Shashwat Jha, Dhruv Kumar, Pankaj Jalote

机构 * IIIT Delhi(印度德里理工学院) BITS Pilani(比尔兹-帕利尼理工学院)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.LG

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00700 2025-08-04 cs.SE 85%

Is LLM-Generated Code More Maintainable \& Reliable than Human-Written Code?

Alfred Santa Molison, Marcia Moraes, Glaucia Melo, Fabio Santos, Wesley K. G. Assuncao

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

Comments Accepted ESEM2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15170 2025-08-04 cs.CR 85%

From LLMs to MLLMs to Agents: A Survey of Emerging Paradigms in Jailbreak Attacks and Defenses within LLM Ecosystem

Yanxu Mao, Tiehan Cui, Peipei Liu, Datao You, Hongsong Zhu

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11849 2025-08-04 cs.CV 82%

Towards a Unified Copernicus Foundation Model for Earth Vision

Yi Wang, Zhitong Xiong, Chenying Liu, Adam J. Stewart, Thomas Dujardin, Nikolaos Ioannis Bountos, Angelos Zavras, Franziska Gerken, Ioannis Papoutsis, Laura Leal-Taixé, Xiao Xiang Zhu

机构 * Technical University of Munich(慕尼黑技术大学) Munich Center for Machine Learning(慕尼黑机器学习中心) National Technical University of Athens & National Observatory of Athens(雅典国家技术大学及雅典国家天文台) Harokopio University of Athens(雅典哈罗科波斯大学) NVIDIA(NVIDIA公司)

专题命中 评测与基准 :foundation model(title,abstract);pretraining(abstract)

Comments Accepted to ICCV 2025. 33 pages, 34 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00383 2025-08-04 cs.CV cs.AI cs.CE cs.LG 81%

$MV_{Hybrid}$: Improving Spatial Transcriptomics Prediction with Hybrid State Space-Vision Transformer Backbone in Pathology Vision Foundation Models

Won June Cho, Hongjun Yoon, Daeky Jeong, Hyeongyeol Lim, Yosep Chong

机构 * AI Research Team(人工智能研究团队) AI Research Lab, Deepnoid Seoul(Deepnoid首尔人工智能研究实验室) Department of Hospital Pathology, College of Medicine, The Catholic University of Korea(韩国天主大学医学院医院病理科)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG

Comments Accepted (Oral) in MICCAI 2025 COMPAYL Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00602 2025-08-04 cs.CR cs.AI cs.LG 79%

LeakSealer: A Semisupervised Defense for LLMs Against Prompt Injection and Leakage Attacks

Francesco Panebianco, Stefano Bonfanti, Francesco Trovò, Michele Carminati

机构 * Politecnico di Milano(米兰理工学院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments 22 pages, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00408 2025-08-04 cs.SE cs.CL 77%

Benchmarking LLMs for Unit Test Generation from Real-World Functions

Dong Huang, Jie M. Zhang, Mark Harman, Qianru Zhang, Mingzhe Du, See-Kiong Ng

机构 * National University of Singapore(新加坡国立大学) King's College London(伦敦国王学院) University College London(伦敦大学学院) The University of Cambridge(剑桥大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23276 2025-08-04 cs.AI 77%

How Far Are AI Scientists from Changing the World?

Qiujie Xie, Yixuan Weng, Minjun Zhu, Fuchen Shen, Shulin Huang, Zhen Lin, Jiahui Zhou, Zilan Mao, Zijie Yang, Linyi Yang, Jian Wu, Yue Zhang

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18348 2025-08-04 cs.AI 77%

Dynamic Knowledge Exchange and Dual-diversity Review: Concisely Unleashing the Potential of a Multi-Agent Research Team

Weilun Yu, Shixiang Tang, Yonggui Huang, Nanqing Dong, Li Fan, Honggang Qi, Wei Liu, Xiaoli Diao, Xi Chen, Wanli Ouyang

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00217 2025-08-04 cs.CL cs.DB cs.LG 73%

Tabular Data Understanding with LLMs: A Survey of Recent Advances and Challenges

Xiaofeng Wu, Alan Ritter, Wei Xu

机构 * College of Computing, Georgia Institute of Technology(计算学院、佐治亚理工学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00659 2025-08-04 cs.CR cs.CL 70%

Demo: TOSense -- What Did You Just Agree to?

Xinzhang Chen, Hassan Ali, Arash Shaghaghi, Salil S. Kanhere, Sanjay Jha

机构 * School of Computer Science and Engineering, The University of New South Wales(计算机科学与工程学院,新南威尔士大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

Comments Accepted as a demonstration paper at IEEE LCN 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22462 2025-08-04 cs.CL 70%

IFEvalCode: Controlled Code Generation

Jian Yang, Wei Zhang, Shukai Liu, Linzheng Chai, Yingshui Tan, Jiaheng Liu, Ge Zhang, Wangchunshu Zhou, Guanglin Niu, Zhoujun Li, Binyuan Hui, Junyang Lin

机构 * Beihang University(北京航空航天大学) M-A-P OPPO

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00391 2025-08-04 cs.CV eess.AS 67%

Cued-Agent: A Collaborative Multi-Agent System for Automatic Cued Speech Recognition

Guanjie Huang, Danny H. K. Tsang, Shan Yang, Guangzhi Lei, Li Liu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Tencent AI Lab(腾讯AI实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00675 2025-08-04 cs.CL 57%

Team "better_call_claude": Style Change Detection using a Sequential Sentence Pair Classifier

Gleb Schmidt, Johannes Römisch, Mariia Halchynska, Svetlana Gorovaia, Ivan P. Yamshchikov

机构 * Humanities Lab, Faculaty of Arts, Radboud University, Houtlaan 4, 6525 XZ, Nijmegen, Netherlands(人文实验室,艺术学院,拉德堡德大学) Center for Artificial Intelligence, Technical University of Applied Sciences Würzburg-Schweinfurt, Münzstraße 12, 97070, Würzburg, Germany(人工智能中心,应用技术大学Würzburg-Schweinfurt) LEYA Lab, School of Computer Science, Physics and Technology, HSE University, 6, 25th Liniya, Vasilievsky Ostrov, 199004, St Petersburg, Russia(LEYA实验室,计算机科学、物理与技术学院,俄罗斯高等经济大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00081 2025-08-04 cs.AI 57%

Rethinking Evidence Hierarchies in Medical Language Benchmarks: A Critical Evaluation of HealthBench

Fred Mutisya, Shikoh Gitau, Nasubo Ongoma, Keith Mbae, Elizabeth Wamicha

专题命中 评测与基准 :language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00428 2025-08-04 cs.GR cs.HC 50%

Sel3DCraft: Interactive Visual Prompts for User-Friendly Text-to-3D Generation

Nan Xiang, Tianyi Liang, Haiwen Huang, Shiqi Jiang, Hao Huang, Yifei Huang, Liangyu Chen, Changbo Wang, Chenhui Li

专题命中 评测与基准 :prompting(abstract)

Comments IEEE VIS VAST 2025 ACM 2012 CCS - Human-centered computing, Visualization, Visualization design and evaluation methods

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00400 2025-08-04 cs.CV 50%

Sari Sandbox: A Virtual Retail Store Environment for Embodied AI Agents

Janika Deborah Gajo, Gerarld Paul Merales, Jerome Escarcha, Brenden Ashley Molina, Gian Nartea, Emmanuel G. Maminta, Juan Carlos Roldan, Rowel O. Atienza

机构 * EEEI, University of the Philippines(电子工程学院,菲律宾大学) AI Graduate Program, University of the Philippines(人工智能研究生项目,菲律宾大学)

专题命中 评测与基准 :language model(abstract)

Comments 14 pages, accepted in ICCV 2025 Workshop on RetailVision

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00328 2025-08-04 cs.HC 50%

From Patient Burdens to User Agency: Designing for Real-Time Protection Support in Online Health Consultations

Shuning Zhang, Ying Ma, Yongquan `Owen' Hu, Ting Dang, Hong Jia, Xin Yi, Hewu Li

专题命中 评测与基准 :LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06854 2025-08-04 cs.CV 50%

DONUT: A Decoder-Only Model for Trajectory Prediction

Markus Knoche, Daan de Geus, Bastian Leibe

机构 * RWTH Aachen University(亚琛工业大学) Eindhoven University of Technology(埃因霍温理工大学)

专题命中 评测与基准 :language model(abstract)

Comments ICCV 2025. Project page at https://vision.rwth-aachen.de/donut

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11172 2025-08-04 cs.CV 50%

TerraMesh: A Planetary Mosaic of Multimodal Earth Observation Data

Benedikt Blumenstiel, Paolo Fraccaro, Valerio Marsocci, Johannes Jakubik, Stefano Maurogiovanni, Mikolaj Czerkawski, Rocco Sedona, Gabriele Cavallaro, Thomas Brunschwiler, Juan Bernabe-Moreno, Nicolas Longépé

机构 * IBM Research – Europe(IBM欧洲研究院) European Space Agency(欧洲航天局) roman_Φ -Lab(Φ实验室) Forschungszentrum Jülich(尤利奇研究中心) University of Iceland(冰岛大学)

专题命中 评测与基准 :foundation model(abstract)

Comments Proceedings of the Computer Vision and Pattern Recognition Conference (CVPR) Workshops

详情

展开后加载摘要…

URL PDF HTML 收藏