arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-08-05 至 2025-08-05 共收录 291 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 84 篇

2508.01432 2025-08-05 cs.AI 77%

TripTailor: A Real-World Benchmark for Personalized Travel Planning

Yuanzhe Shen, Kaimin Wang, Changze Lv, Xiaoqing Zheng, Xuanjing Huang

机构 * School of Computer Science, Fudan University(复旦大学计算机科学学院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments Accepted to ACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02574 2025-08-05 cs.CL cs.AI cs.LG cs.SI 75%

EHSAN: Leveraging ChatGPT in a Hybrid Framework for Arabic Aspect-Based Sentiment Analysis in Healthcare

Eman Alamoudi, Ellis Solaiman

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19378 2025-08-05 cs.CV cs.AI cs.CL cs.LG 75%

Libra: Leveraging Temporal Images for Biomedical Radiology Analysis

Xi Zhang, Zaiqiao Meng, Jake Lever, Edmond S. L. Ho

机构 * Information Retrieval Group(信息检索组) AI4BioMed Lab(AI4BioMed实验室) School of Computing Science(计算科学学院) University of Glasgow(格拉斯哥大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 30 pages, 5 figures, Adding Appendix

Journal ref Association for Computational Linguistics, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00828 2025-08-05 cs.CE 75%

Finance Agent Benchmark: Benchmarking LLMs on Real-world Financial Research Tasks

Antoine Bigeard, Langston Nashold, Rayan Krishnan, Shirley Wu

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02279 2025-08-05 cs.SE cs.AI cs.CL 73%

Dialogue Systems Engineering: A Survey and Future Directions

Mikio Nakano, Hironori Takeuchi, Sadahiro Yoshikawa, Yoichi Matsuyama, Kazunori Komatani

机构 * SANKEN, University of Osaka(大阪大学SANKEN研究所) C4A Research Institute, Inc.(C4A研究机构) Musashi University(Musashi大学) Equmenopolis, Inc.(Equmenopolis公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 18 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00961 2025-08-05 cs.LG cs.AI 73%

FinKario: Event-Enhanced Automated Construction of Financial Knowledge Graph

Xiang Li, Penglei Sun, Wanyun Zhou, Zikai Wei, Yongqi Zhang, Xiaowen Chu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) International Digital Economy Academy(国际数字经济学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21562 2025-08-05 cs.CL cs.AI cs.AR 73%

FloorPlan-DeepSeek (FPDS): A multimodal approach to floorplan generation using vector-based next room prediction

Jun Yin, Pengyu Zeng, Jing Zhong, Peilin Li, Miao Zhang, Ran Luo, Shuai Lu

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00893 2025-08-05 cs.CL cs.AI 73%

Affordance Benchmark for MLLMs

Junying Wang, Wenzhe Li, Yalun Wu, Yingji Liang, Yijin Guo, Chunyi Li, Haodong Duan, Zicheng Zhang, Guangtao Zhai

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17242 2025-08-05 cs.AI cs.CL 73%

On the Generalization and Adaptation Ability of Machine-Generated Text Detectors in Academic Writing

Yule Liu, Zhiyuan Zhong, Yifan Liao, Zhen Sun, Jingyi Zheng, Jiaheng Wei, Qingyuan Gong, Fenghua Tong, Yang Chen, Yang Zhang, Xinlei He

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Southern University of Science and Technology(南方科技大学) National University of Singapore (Chongqing Research Institute)(新加坡国立大学(重庆研究机构)) Fudan University(复旦大学) Qilu University of Technology(齐鲁大学) CISPA Helmholtz Center for Information Security(CISPA 欧洲信息安全研究所)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01016 2025-08-05 eess.IV cs.CV 71%

Diagnostic Accuracy of Open-Source Vision-Language Models on Diverse Medical Imaging Tasks

Gustav Müller-Franzes, Debora Jutz, Jakob Nikolas Kather, Christiane Kuhl, Sven Nebelung, Daniel Truhn

专题命中 评测与基准 :language model(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02490 2025-08-05 cs.AI 70%

PHM-Bench: A Domain-Specific Benchmarking Framework for Systematic Evaluation of Large Models in Prognostics and Health Management

Puyu Yang, Laifa Tao, Zijian Huang, Haifei Liu, Wenyan Cao, Hao Ji, Jianan Qiu, Qixuan Huang, Xuanyuan Su, Yuhang Xie, Jun Zhang, Shangyu Li, Chen Lu, Zhixuan Lian

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02222 2025-08-05 cs.IR cs.AI cs.CE 70%

FinCPRG: A Bidirectional Generation Pipeline for Hierarchical Queries and Rich Relevance in Financial Chinese Passage Retrieval

Xuan Xu, Beilin Chu, Qinhong Lin, Yixiao Zhong, Fufang Wen, Jiaqi Liu, Binjie Fei, Yu Li, Zhongliang Yang, Linna Zhou

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Beijing Value Simplex Technology Co. Ltd(北京价值简单科技有限公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20243 2025-08-05 cs.CL cs.IR 70%

It's High Time: A Survey of Temporal Question Answering

Bhawna Piryani, Abdelrahman Abdallah, Jamshid Mozafari, Avishek Anand, Adam Jatowt

机构 * University of Innsbruck(因斯布鲁克大学) Delft University of Technology(代尔夫特理工大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.06690 2025-08-05 cs.SD cs.AI cs.MM 70%

Benchmarking Sub-Genre Classification For Mainstage Dance Music

Hongzhi Shu, Xinglin Li, Hongyu Jiang, Minghao Fu, Xinyu Li

机构 * Johns Hopkins University(约翰霍普金斯大学) Southeast University(东南大学) National University of Defense Technology(国防科技大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

Comments WASPAA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02132 2025-08-05 cs.AI 70%

All Stories Are One Story: Emotional Arc Guided Procedural Game Level Generation

Yunge Wen, Chenliang Huang, Hangyu Zhou, Zhuo Zeng, Chun Ming Louis Po, Julian Togelius, Timothy Merino, Sam Earle

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01871 2025-08-05 cs.AI cs.DB 70%

Multi-turn Natural Language to Graph Query Language Translation

Yuanyuan Liang, Lei Pan, Tingyu Xie, Yunshi Lan, Weining Qian

机构 * East China Normal University(东华师范大学) AISpeech Zhejiang University(浙江大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01746 2025-08-05 cs.AI 70%

Bayes-Entropy Collaborative Driven Agents for Research Hypotheses Generation and Optimization

Shiyang Duan, Yuan Tian, Qi Bing, Xiaowei Shao

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

Comments Corresponding author: Xiaowei Shao. 12 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01411 2025-08-05 cs.CL 70%

ArzEn-MultiGenre: An aligned parallel dataset of Egyptian Arabic song lyrics, novels, and subtitles, with English translations

Rania Al-Sabbagh

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

Journal ref Data in Brief, 54

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01186 2025-08-05 cs.AI cs.HC 70%

A Survey on Agent Workflow -- Status and Future

Chaojia Yu, Zihan Cheng, Hanwen Cui, Yishuo Gao, Zexu Luo, Yijin Wang, Hangbin Zheng, Yong Zhao

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

Comments 12 pages, 3 figures, accepted to IEEE Conference, ICAIBD(International Conference of Artificial Intelligence and Big Data) 2025. This is the author's version, not the publisher's. See https://ieeexplore.ieee.org/document/11082076

Journal ref IEEE ICAIBD 2025, pp. 770-781

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21453 2025-08-05 cs.AI 70%

Validating Pharmacogenomics Generative Artificial Intelligence Query Prompts Using Retrieval-Augmented Generation (RAG)

Ashley Rector, Keaton Minor, Kamden Minor, Jeff McCormack, Beth Breeden, Ryan Nowers, Jay Dorris

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11935 2025-08-05 cs.CL 70%

ChartEdit: How Far Are MLLMs From Automating Chart Analysis? Evaluating MLLMs' Capability via Chart Editing

Xuanle Zhao, Xuexin Liu, Haoyue Yang, Xianzhen Luo, Fanhu Zeng, Jianling Li, Qi Shi, Chi Chen

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Harbin Institute of Technology(哈尔滨工业大学) Tianjin University(天津大学) Tsinghua University(清华大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

Comments Accepted by ACL2025 Findings, camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01990 2025-08-05 cs.AI 70%

Advances and Challenges in Foundation Agents: From Brain-Inspired Intelligence to Evolutionary, Collaborative, and Safe Systems

Bang Liu, Xinfeng Li, Jiayi Zhang, Jinlin Wang, Tanjin He, Sirui Hong, Hongzhang Liu, Shaokun Zhang, Kaitao Song, Kunlun Zhu, Yuheng Cheng, Suyuchen Wang, Xiaoqiang Wang, Yuyu Luo, Haibo Jin, Peiyan Zhang, Ollie Liu, Jiaqi Chen, Huan Zhang, Zhaoyang Yu, Haochen Shi, Boyan Li, Dekun Wu, Fengwei Teng, Xiaojun Jia, Jiawei Xu, Jinyu Xiang, Yizhang Lin, Tianming Liu, Tongliang Liu, Yu Su, Huan Sun, Glen Berseth, Jianyun Nie, Ian Foster, Logan Ward, Qingyun Wu, Yu Gu, Mingchen Zhuge, Xinbing Liang, Xiangru Tang, Haohan Wang, Jiaxuan You, Chi Wang, Jian Pei, Qiang Yang, Xiaoliang Qi, Chenglin Wu

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02645 2025-08-05 cs.CV 67%

Evaluating Variance in Visual Question Answering Benchmarks

Nikitha SR

机构 * Media and Data Science Research Lab, Adobe(媒体与数据科学研究实验室,Adobe)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

Comments Accepted in ICCV 2025 Workshop on What's Next in Multimodal Foundational Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01074 2025-08-05 cs.CV cs.CR 67%

Evading Data Provenance in Deep Neural Networks

Hongyu Zhu, Sichu Liang, Wenwen Wang, Zhuomeng Zhang, Fangqi Li, Shi-Lin Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Southeast University(东南大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

Comments ICCV 2025 Highlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.05313 2025-08-05 cs.RO cs.AI cs.LG 62%

λ: A Benchmark for Data-Efficiency in Long-Horizon Indoor Mobile Manipulation Robotics

Ahmed Jaafar, Shreyas Sundara Raman, Sudarshan Harithas, Yichen Wei, Sofia Juliani, Anneke Wernerfelt, Benedict Quartey, Ifrah Idrees, Jason Xinyu Liu, Stefanie Tellex

机构 * Brown University(布朗大学) Rutgers University(罗格斯大学) University of Pennsylvania(宾夕法尼亚大学)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI、cs.LG

Comments Accepted to IROS 2025. Sudarshan Harithas and Yichen Wei contributed equally. 8 pages. 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02427 2025-08-05 cs.AI cs.SE 57%

CABENCH: Benchmarking Composable AI for Solving Complex Tasks through Composing Ready-to-Use Models

Tung-Thuy Pham, Duy-Quan Luong, Minh-Quan Duong, Trung-Hieu Nguyen, Thu-Trang Nguyen, Son Nguyen, Hieu Dinh Vo

机构 * Faculty of Information Technology(信息技术学院) University of Engineering and Technology(工程大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02374 2025-08-05 cs.CV cs.IR cs.LG 57%

Uni-Layout: Integrating Human Feedback in Unified Layout Generation and Evaluation

Shuo Lu, Yanyin Chen, Wei Feng, Jiahao Fan, Fengheng Li, Zheng Zhang, Jingjing Lv, Junjie Shen, Ching Law, Jian Liang

机构 * School of AI, UCAS(人工智能学院,中国科学院自动化研究所)

专题命中 评测与基准 :preference optimization(abstract);分类 cs.LG

Comments Accepted to ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10857 2025-08-05 cs.CV cs.AI cs.MM 57%

VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos

Jiashuo Yu, Yue Wu, Meng Chu, Zhifei Ren, Zizheng Huang, Pei Chu, Ruijie Zhang, Yinan He, Qirui Li, Songze Li, Zhenxiang Li, Zhongying Tu, Conghui He, Yu Qiao, Yali Wang, Yi Wang, Limin Wang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Nanjing University(南京大学) Shanghai Innovation Institute(上海创新研究院) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究所,中国科学院)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

Comments ICCV2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15969 2025-08-05 cs.CV cs.AI 57%

Beyond the Visible: Multispectral Vision-Language Learning for Earth Observation

Clive Tinashe Marimo, Benedikt Blumenstiel, Maximilian Nitsche, Johannes Jakubik, Thomas Brunschwiler

机构 * IBM Germany(IBM德国分公司) IBM Research Europe(IBM欧洲研究院)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

Comments Machine Learning and Knowledge Discovery in Databases. Research Track - European Conference, ECML PKDD 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02062 2025-08-05 cs.RO cs.AI 57%

RICL: Adding In-Context Adaptability to Pre-Trained Vision-Language-Action Models

Kaustubh Sridhar, Souradeep Dutta, Dinesh Jayaraman, Insup Lee

机构 * University of Pennsylvania(宾夕法尼亚大学) University of British Columbia(不列颠哥伦比亚大学)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI

Comments Conference on Robot Learning 2025 (CoRL 2025), 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏