arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-09-16 至 2025-09-16 共收录 266 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 62 篇

2509.10790 2025-09-16 cs.LG cs.AI 79%

GoldenTransformer: A Modular Fault Injection Framework for Transformer Robustness Research

Luke Howard

机构 * Radnor High School(拉多尔高中)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments 4 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16990 2025-09-16 cs.CL cs.AI 79%

TeXpert: A Multi-Level Benchmark for Evaluating LaTeX Code Generation by LLMs

Sahil Kale, Vijaykant Nadadur

机构 * Knowledgeverse AI(知识verse AI)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Accepted to the SDProc Workshop @ ACL 2025

Journal ref Proceedings of the Fifth Workshop on Scholarly Document Processing (SDP 2025), pages 7-16, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11016 2025-09-16 cs.NE 78%

Deep Reinforcement Learning-Assisted Component Auto-Configuration of Differential Evolution Algorithm for Constrained Optimization: A Foundation Model

Xu Yang, Rui Wang, Kaiwen Li, Wenhua Li, Ling Wang

专题命中 评测与基准 :foundation model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12102 2025-09-16 cs.HC cs.AI 77%

Can LLMs Address Mental Health Questions? A Comparison with Human Therapists

Synthia Wang, Yuwei Cheng, Austin Song, Sarah Keedy, Marc Berman, Nick Feamster

机构 * University of Chicago(芝加哥大学) University of Virginia(弗吉尼亚大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11802 2025-09-16 cs.CL 77%

When Curiosity Signals Danger: Predicting Health Crises Through Online Medication Inquiries

Dvora Goncharok, Arbel Shifman, Alexander Apartsin, Yehudit Aperstein

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments 5 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16347 2025-09-16 cs.CR cs.AI 77%

Confusion is the Final Barrier: Rethinking Jailbreak Evaluation and Investigating the Real Misuse Threat of LLMs

Yu Yan, Sheng Sun, Zhe Wang, Yijun Lin, Zenghao Duan, zhifei zheng, Min Liu, Zhiyi yin, Jianping Zhang

机构 * State Key Lab of Processors, Institute of Computing Technology, CAS(中国科学院计算技术研究所状态关键实验室) University of Chinese Academy of Sciences(中国科学院大学) People’s Public Security University of China(中国人民公安大学) Chinese University of Hong Kong(香港大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12805 2025-09-16 cs.CL cs.CY cs.HC 77%

Assessing LLMs in Art Contexts: Critique Generation and Theory of Mind Evaluation

Takaya Arita, Wenxian Zheng, Reiji Suzuki, Fuminori Akiba

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

Comments Corrected a typo in the metadata title only ("Assesing"->"Assessing"). No changes were made to the PDF or source files

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06646 2025-09-16 econ.GN cs.CL q-fin.EC 77%

Evaluating and Aligning Human Economic Risk Preferences in LLMs

Jiaxin Liu, Yixuan Tang, Yi Yang, Kar Yan Tam

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.02006 2025-09-16 cs.AI 77%

Foundations and Recent Trends in Multimodal Mobile Agents: A Survey

Biao Wu, Yanda Li, Zhiwei Zhang, Yunchao Wei, Meng Fang, Ling Chen

机构 * Australian Artificial Intelligence Institute(澳大利亚人工智能研究所) The Pennsylvania State University(宾夕法尼亚州立大学) Beijing Jiaotong University(北京交通大学) University of Liverpool(利物浦大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.AI

Comments 8 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11126 2025-09-16 cs.SE 75%

AI Agentic Programming: A Survey of Techniques, Challenges, and Opportunities

Huanting Wang, Jingzhi Gong, Huawei Zhang, Jie Xu, Zheng Wang

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02040 2025-09-16 cs.CR cs.SE 75%

Beyond the Protocol: Unveiling Attack Vectors in the Model Context Protocol (MCP) Ecosystem

Hao Song, Yiming Shen, Wenxuan Luo, Leixin Guo, Ting Chen, Jiashui Wang, Beibei Li, Xiaosong Zhang, Jiachi Chen

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10660 2025-09-16 cs.AI cs.MA q-bio.CB 74%

ZapGPT: Free-form Language Prompting for Simulated Cellular Control

Nam H. Le, Patrick Erickson, Yanbo Zhang, Michael Levin, Josh Bongard

机构 * Department of Computer Science University of Vermont(计算机科学系大学弗吉尼亚大学) Department of Biology Tufts University(生物学系塔夫茨大学)

专题命中 评测与基准 :prompting(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11648 2025-09-16 cs.CL cs.AI cs.CY 73%

EthicsMH: A Pilot Benchmark for Ethical Reasoning in Mental Health AI

Sai Kartheek Reddy Kasu

机构 * IIIT Dharwad(德瓦德理工学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11118 2025-09-16 cs.CL cs.AI 73%

We Argue to Agree: Towards Personality-Driven Argumentation-Based Negotiation Dialogue Systems for Tourism

Priyanshu Priya, Saurav Dudhate, Desai Vishesh Yasheshbhai, Asif Ekbal

机构 * Department of Computer Science and Engineering, Indian Institute of Technology Patna(计算机科学与工程系,印度理工学院帕纳布)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Paper is accepted at EMNLP (Findings) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10886 2025-09-16 cs.CL cs.AI 73%

CultureSynth: A Hierarchical Taxonomy-Guided and Retrieval-Augmented Framework for Cultural Question-Answer Synthesis

Xinyu Zhang, Pei Zhang, Shuang Luo, Jialong Tang, Yu Wan, Baosong Yang, Fei Huang

机构 * Tongyi Lab, Alibaba Group Inc(通义实验室,阿里集团)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Accepted as a Findings paper at EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00115 2025-09-16 cs.AI cs.CL cs.MA 73%

Adaptive Monitoring and Real-World Evaluation of Agentic AI Systems

Manish Shukla

机构 * Independent Researcher(独立研究者)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21614 2025-09-16 cs.CL cs.AI 73%

LastingBench: Defend Benchmarks Against Knowledge Leakage

Yixiong Fang, Tianran Sun, Yuling Shi, Min Wang, Xiaodong Gu

机构 * Shanghai Jiao Tong University(上海交通大学) University of Pennsylvania(宾夕法尼亚大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23810 2025-09-16 cs.CL cs.AI 73%

MARS-Bench: A Multi-turn Athletic Real-world Scenario Benchmark for Dialogue Evaluation

Chenghao Yang, Yinbo Luo, Zhoufutu Wen, Qi Chu, Tao Gong, Longxiang Liu, Kaiyuan Zhang, Jianpeng Jiao, Ge Zhang, Wenhao Huang, Nenghai Yu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 29 pages, 13 figures, Accepted as EMNLP2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20022 2025-09-16 cs.CL cs.LG 73%

Better To Ask in English? Evaluating Factual Accuracy of Multilingual LLMs in English and Low-Resource Languages

Pritika Rohera, Chaitrali Ginimav, Gayatri Sawant, Raviraj Joshi

机构 * Pune Institute of Computer Technology(普纳计算机技术研究所) Indian Institute of Technology Madras(印度理工学院马德拉斯分校) L3Cube Labs, Pune(L3Cube实验室,普纳)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.01222 2025-09-16 cs.LG cs.AI 73%

Calibration in Deep Learning: A Survey of the State-of-the-Art

Cheng Wang

机构 * Amazon(亚马逊)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments 34 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11570 2025-09-16 cs.CL 70%

Bhaasha, Bhasa, Zaban: A Survey for Low-Resourced Languages in South Asia -- Current Stage and Challenges

Sampoorna Poria, Xiaolei Huang

机构 * Dept of Computer Science & Engineering, West Bengal University of Technology(计算机科学与工程系,西孟加拉理工大学) Department of Computer Science, University of Memphis(计算机科学系,孟菲斯大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01791 2025-09-16 cs.CR cs.AI 70%

E-PhishGen: Unlocking Novel Research in Phishing Email Detection

Luca Pajola, Eugenio Caripoti, Stefan Banzer, Simeone Pizzi, Mauro Conti, Giovanni Apruzzese

机构 * University of Padua(帕多瓦大学) University of Liechtenstein(列支敦士登大学) Orebro University(奥雷布罗大学) University of Reykjavik(雷克雅未克大学)

专题命中 评测与基准 :LLM(abstract);language model(abstract);分类 cs.AI

Comments Accepted to ACM AISec '25

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10074 2025-09-16 cs.SE cs.LG 70%

Next Edit Prediction: Learning to Predict Code Edits from Context and Interaction History

Ruofan Lu, Yintong Huo, Meng Zhang, Yichen Li, Michael R. Lyu

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11589 2025-09-16 cs.CV 67%

MVQA-68K: A Multi-dimensional and Causally-annotated Dataset with Quality Interpretability for Video Assessment

Yanyun Pu, Kehan Li, Zeyi Huang, Zhijie Zhong, Kaixiang Yang

机构 * Huawei Technologies Co.(华为技术有限公司) South China University of Technology(南方科技大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02879 2025-09-16 physics.soc-ph cond-mat.dis-nn math.PR stat.AP 67%

(Un)biased data and spin glasses reveal clustering for Turing phase transitions within human-transformer interactions

Jackson George, Zachariah Yusaf, Stephanie Zoltick, Linh Huynh

专题命中 评测与基准 :large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11413 2025-09-16 cs.LG cs.AI 62%

Framing AI System Benchmarking as a Learning Task: FlexBench and the Open MLPerf Dataset

Grigori Fursin, Daniel Altunay

机构 * Head of FCS Labs, FlexAI Founder, cTuning (AI Systems R&D)(FCS实验室负责人,FlexAI创始人,cTuning(人工智能系统研发)) Machine Learning Engineer, FlexAI(机器学习工程师,FlexAI)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11942 2025-09-16 cs.SE cs.AI cs.HC 57%

VisDocSketcher: Towards Scalable Visual Documentation with Agentic Systems

Luís F. Gomes, Xin Zhou, David Lo, Rui Abreu

机构 * Carnegie Mellon University(卡内基梅隆大学) Singapore Management University(新加坡管理学院) Faculty of Engineering, University of Porto(葡萄牙波尔图大学工程学院)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10129 2025-09-16 cs.CL cs.IR 57%

Towards Reliable and Interpretable Document Question Answering via VLMs

Alessio Chen, Simone Giovannini, Andrea Gemelli, Fabio Coppini, Simone Marinai

机构 * Università degli Studi di Firenze(佛罗伦萨大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10565 2025-09-16 physics.chem-ph cs.LG physics.comp-ph 57%

Assessing the Limits of Graph Neural Networks for Vapor-Liquid Equilibrium Prediction: A Cryogenic Mixture Case Study

Aryan Gupta

专题命中 评测与基准 :pretraining(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11885 2025-09-16 cs.CV 50%

BREA-Depth: Bronchoscopy Realistic Airway-geometric Depth Estimation

Francis Xiatian Zhang, Emile Mackute, Mohammadreza Kasaei, Kevin Dhaliwal, Robert Thomson, Mohsen Khadem

机构 * Baillie Gifford Pandemic Science Hub(巴利尔·吉福德疫情科学中心) Institute of Regeneration and Repair(再生与修复研究所) Heriot-Watt University(赫罗特-瓦特大学) Institute of Photonics and Quantum Science(光子与量子科学研究所)

专题命中 评测与基准 :foundation model(abstract)

Comments The paper has been accepted to MICCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏