arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-08-01 至 2025-08-01 共收录 27 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 27 篇

2507.22947 2025-08-01 cs.CY cs.CL cs.LG 90%

ELMES: An Automated Framework for Evaluating Large Language Models in Educational Scenarios

Shou'ang Wei, Xinyun Wang, Shuzhen Bi, Jian Chen, Ruijia Li, Bo Jiang, Xin Lin, Min Zhang, Yu Song, BingDong Li, Aimin Zhou, Hao Hao

机构 * Shanghai Innavation Institute(上海创新研究院) Shanghai Institute of AI for Education(上海人工智能教育研究院) Department of Educational Information Technology(教育信息技术系) School of Computer Science and Technology(计算机科学与技术学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18199 2025-08-01 cs.CL cs.AI cs.CY cs.HC 90%

Prompt Engineering Techniques for Mitigating Cultural Bias Against Arabs and Muslims in Large Language Models: A Systematic Review

Bushra Asseri, Estabrag Abdelaziz, Areej Al-Wabil

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

Comments Research is incomplete

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23370 2025-08-01 cs.SE cs.AI 87%

Trae Agent: An LLM-based Agent for Software Engineering with Test-time Scaling

Trae Research Team, Pengfei Gao, Zhao Tian, Xiangxin Meng, Xinchen Wang, Ruida Hu, Yuanan Xiao, Yizhou Liu, Zhao Zhang, Junjie Chen, Cuiyun Gao, Yun Lin, Yingfei Xiong, Chao Peng, Xia Liu

机构 * Trae Research(Trae研究)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments Pengfei Gao and Zhao Tian contributed equally to this technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22937 2025-08-01 cs.CL cs.AI 86%

CoE-Ops: Collaboration of LLM-based Experts for AIOps Question-Answering

Jinkun Zhao, Yuanshuai Wang, Xingjian Zhang, Ruibo Chen, Xingchuang Liao, Junle Wang, Lei Huang, Kui Zhang, Wenjun Wu

机构 * SKLCCSE, Institute of Artificial Intelligence, Beihang University(SKLCCSE,人工智能学院,北航) Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing, Beihang University(未来区块链与隐私计算先进创新中心,北航)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23087 2025-08-01 cs.SE cs.AI 85%

On LLM-Assisted Generation of Smart Contracts from Business Processes

Fabian Stiehle, Hans Weytjens, Ingo Weber

机构 * Technical University of Munich, School of CIT, Germany(慕尼黑技术大学计算机信息学院) Fraunhofer Gesellschaft, Munich, Germany(弗劳恩霍夫协会)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments Accepted at the Workshop on Distributed Ledger Technologies in Business Process Management, At the International Conference for Business Process Management (BPM), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23694 2025-08-01 cs.MA cs.AI 83%

A survey of multi-agent geosimulation methodologies: from ABM to LLM

Virginia Padilla, Jacinto Dávila

机构 * Departamento de Ciencia y Tecnología, Universidad Nacional Experimental de Guayana(科学与技术系,圭亚那国家实验大学) CeSiMo, Facultad de Ingeniería, Universidad de los Andes(CeSiMo,工程学院,安第斯大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

Comments 20 pages, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23740 2025-08-01 cs.CL cs.AI cs.LG 80%

Rule2Text: Natural Language Explanation of Logical Rules in Knowledge Graphs

Nasim Shirvani-Mahdavi, Devin Wingfield, Amin Ghasemi, Chengkai Li

机构 * University of Texas at Arlington(德克萨斯理工大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22956 2025-08-01 cs.LG cs.HC 79%

LLM-Assisted Cheating Detection in Korean Language via Keystrokes

Dong Hyun Roh, Rajesh Kumar, An Ngo

机构 * Bucknell University(布克内尔大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.LG

Comments This paper has 11 pages, 6 figures, 2 tables, and has been accepted for publication at IEEE-IJCB 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16060 2025-08-01 cs.CL 79%

Vision-Language Models Are Not Pragmatically Competent in Referring Expression Generation

Ziqiao Ma, Jing Ding, Xuejun Zhang, Dezhi Luo, Jiahe Ding, Sihan Xu, Yuchen Huang, Run Peng, Joyce Chai

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

Comments COLM 2025 & CVinW @ CVPR 2025 (Spotlight). Homepage: https://vlm-reg.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23248 2025-08-01 cs.CL cs.LG 79%

Evaluating LLMs' Multilingual Capabilities for Bengali: Benchmark Creation and Performance Analysis

Shimanto Bhowmik, Tawsif Tashwar Dipto, Md Sazzad Islam, Sheryl Hsu, Tahsin Reasat

机构 * Rochester Institute of Technology(罗切斯特技术研究院) Islamic University of Technology(伊斯兰技术大学) Stanford University(斯坦福大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22902 2025-08-01 cs.HC cs.AI cs.CL cs.MA 79%

Toward the Autonomous AI Doctor: Quantitative Benchmarking of an Autonomous Agentic AI Versus Board-Certified Clinicians in a Real World Setting

Hashim Hayat, Maksim Kudrautsau, Evgeniy Makarov, Vlad Melnichenko, Tim Tsykunou, Piotr Varaksin, Matt Pavelle, Adam Z. Oskowitz

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22927 2025-08-01 cs.CL 77%

PRGB Benchmark: A Robust Placeholder-Assisted Algorithm for Benchmarking Retrieval-Augmented Generation

Zhehao Tan, Yihan Jiao, Dan Yang, Lei Liu, Jie Feng, Duolin Sun, Yue Shen, Jian Wang, Peng Wei, Jinjie Gu

机构 * Zhehao Tan(未知) Yihan Jiao(未知) Dan Yang(未知) Lei Liu(未知) Jie Feng(未知) Duolin Sun(未知) Yue Shen(未知) Jian Wang(未知) Peng Wei(未知) Jinjie Gu(未知)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22938 2025-08-01 cs.CL cs.AI 76%

A Graph-based Approach for Multi-Modal Question Answering from Flowcharts in Telecom Documents

Sumit Soman, H. G. Ranjani, Sujoy Roychowdhury, Venkata Dharma Surya Narayana Sastry, Akshat Jain, Pranav Gangrade, Ayaaz Khan

机构 * Ericsson R&D Bangalore Karnataka India(爱立信研发部班加罗尔卡纳塔克邦印度)

专题命中 评测与基准 :large language model(abstract,comments);language model(abstract,comments);分类 cs.CL、cs.AI

Comments Accepted for publication at the KDD 2025 Workshop on Structured Knowledge for Large Language Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19219 2025-08-01 cs.AI cs.LG cs.MA math.CO 73%

Where Paths Collide: A Comprehensive Survey of Classic and Learning-Based Multi-Agent Pathfinding

Shiyue Wang, Haozheng Xu, Yuhan Zhang, Jingran Lin, Changhong Lu, Xiangfeng Wang, Wenhao Li

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments 112 pages, 21 figures, 20 tables. The project website is: https://wangsh1yue.github.io/Where-Paths-Collide

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22917 2025-08-01 cs.CL cs.AI cs.IR 73%

Reading Between the Timelines: RAG for Answering Diachronic Questions

Kwun Hang Lau, Ruiyuan Zhang, Weijie Shi, Xiaofang Zhou, Xiaojun Cheng

机构 * Hong Kong University of Science and Technology(香港科技大学) China Unicom (Hong Kong) Operation Ltd(中国移动(香港)运营有限公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23400 2025-08-01 cs.CL cs.IR 70%

MRGSEM-Sum: An Unsupervised Multi-document Summarization Framework based on Multi-Relational Graphs and Structural Entropy Minimization

Yongbing Zhang, Fang Nan, Shengxiang Gao, Yuxin Huang, Kaiwen Tan, Zhengtao Yu

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23319 2025-08-01 cs.CL 70%

What's Taboo for You? - An Empirical Evaluation of LLMs Behavior Toward Sensitive Content

Alfio Ferrara, Sergio Picascia, Laura Pinnavaia, Vojimir Ranitovic, Elisabetta Rocchetti, Alice Tuveri

机构 * Università degli Studi di Milano, Department of Computer Science(米兰大学计算机科学系) Università degli Studi di Milano, Department of Languages, Literatures, Cultures and Mediations(米兰大学语言、文学、文化与媒介系) Università degli Studi di Milano, Department of Historical Studies(米兰大学历史学系)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22932 2025-08-01 cs.CL q-fin.GN 70%

FinMarBa: A Market-Informed Dataset for Financial Sentiment Classification

Baptiste Lefort, Eric Benhamou, Beatrice Guez, Jean-Jacques Ohana, Ethan Setrouk, Alban Etienne

机构 * Ai For Alpha Centrale Supélec Paris Dauphine PSL(巴黎-法兰西大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19480 2025-08-01 cs.CV 67%

GenHancer: Imperfect Generative Models are Secretly Strong Vision-Centric Enhancers

Shijie Ma, Yuying Ge, Teng Wang, Yuxin Guo, Yixiao Ge, Ying Shan

机构 * ARC Lab, Tencent PCG(腾讯PCG ARC实验室) Institute of Automation, CAS(中国科学院自动化研究所)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

Comments ICCV 2025. Project released at: https://mashijie1028.github.io/GenHancer/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23194 2025-08-01 cs.CL cs.AI cs.LG 67%

Geak: Introducing Triton Kernel AI Agent & Evaluation Benchmarks

Jianghui Wang, Vinay Joshi, Saptarshi Majumder, Xu Chao, Bin Ding, Ziqiong Liu, Pratik Prabhanjan Brahma, Dong Li, Zicheng Liu, Emad Barsoum

机构 * Advanced Micro Devices, Inc.(先进微器件公司)

专题命中 评测与基准 :prompting(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11952 2025-08-01 cs.CL cs.AI cs.LG 67%

Robust and Fine-Grained Detection of AI Generated Texts

Ram Mohan Rao Kadiyala, Siddartha Pullakhandam, Kanwal Mehreen, Drishti Sharma, Siddhant Gupta, Jebish Purbey, Ashay Srivastava, Subhasya TippaReddy, Arvind Reddy Bobbili, Suraj Telugara Chandrashekhar, Modabbir Adeeb, Srinadh Vura, Suman Debnath, Hamza Farooq

机构 * Vantager Cohere for AI Community University of Maryland(马里兰大学) IIT Roorkee(印度理工学院罗尔基) Perplexity University of South Florida(佛罗里达州立大学) University of Houston(休斯顿大学) IISc Bangalore(班加罗尔印度理工学院) Stanford University(斯坦福大学) Amazon(亚马逊)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 18 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23404 2025-08-01 cs.CL 57%

Enhanced Arabic Text Retrieval with Attentive Relevance Scoring

Salah Eddine Bekhouche, Azeddine Benlamoudi, Yazid Bounab, Fadi Dornaika, Abdenour Hadid

机构 * University of the Basque Country UPV/EHU(巴斯克国家大学UPV/EHU) Lab. de Genie Electrique (LAGE), University of Ouargla(电气工程实验室(LAGE),奥尔加拉大学) Faculty of Pharmacy, Helsinki University(药学院,赫尔辛基大学) IKERBASQUE, Basque Foundation for Science(ikerbasque,巴斯克科学基金会) Sorbonne University Abu Dhabi(索邦大学阿布扎比)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23356 2025-08-01 cs.SE cs.AI 57%

Quality Evaluation of COBOL to Java Code Transformation

Shmulik Froimovich, Raviv Gal, Wesam Ibraheem, Avi Ziv

机构 * Quality Technologies Department(质量技术部门) IBM Research - Israel Haifa(IBM以色列海法研究所)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

Comments Submitted to ASE 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23272 2025-08-01 cs.CV cs.AI 57%

Towards Affordable Tumor Segmentation and Visualization for 3D Breast MRI Using SAM2

Solha Kang, Eugene Kim, Joris Vankerschaver, Utku Ozbulak

机构 * Center for Biosystems and Biotech Data Science, Ghent University Global Campus, Incheon, Republic of Korea(生物系统与生物技术数据科学中心,格罗宁根大学全球校园,韩国Incheon) Department of Mathematics, Computer Science and Statistics, Ghent University, Ghent, Belgium(数学、计算机科学与统计学系,格罗宁根大学,比利时Ghent) IDLab, Department of Electronics and Information Systems, Ghent University, Ghent, Belgium(IDLab,电子与信息系统系,格罗宁根大学,比利时Ghent)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI

Comments Accepted for publication in the 28th International Conference on Medical Image Computing and Computer Assisted Intervention (MICCAI), 2nd Deep Breast Workshop on AI and Imaging for Diagnostic and Treatment Challenges in Breast Care (DeepBreath), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23091 2025-08-01 cs.AI cs.SD eess.AS 57%

Moravec's Paradox: Towards an Auditory Turing Test

David Noever, Forrest McKee

专题命中 评测与基准 :language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22252 2025-08-01 cs.HC 50%

Multidimensional Assessment of Takeover Performance in Conditionally Automated Driving

Kexin Liang, Jan Luca Kästle, Bani Anvari, Simeon C. Calvert, J. W. C. van Lint

专题命中 评测与基准 :prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17761 2025-08-01 cs.CV 50%

Step1X-Edit: A Practical Framework for General Image Editing

Shiyu Liu, Yucheng Han, Peng Xing, Fukun Yin, Rui Wang, Wei Cheng, Jiaqi Liao, Yingming Wang, Honghao Fu, Chunrui Han, Guopeng Li, Yuang Peng, Quan Sun, Jingwei Wu, Yan Cai, Zheng Ge, Ranchen Ming, Lei Xia, Xianfang Zeng, Yibo Zhu, Binxing Jiao, Xiangyu Zhang, Gang Yu, Daxin Jiang

机构 * Step1X-Image Team(Step1X-图像团队)

专题命中 评测与基准 :LLM(abstract)

Comments code: https://github.com/stepfun-ai/Step1X-Edit

详情

展开后加载摘要…

URL PDF HTML 收藏