arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-09-11 至 2025-09-11 共收录 110 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 17 篇

2409.03521 2025-09-11 cs.CV 78%

Have Large Vision-Language Models Mastered Art History?

Ombretta Strafforello, Derya Soydaner, Michiel Willems, Anne-Sofie Maerten, Stefanie De Winter

机构 * KU Leuven(库勒韦恩大学) Leiden University(莱顿大学)

专题命中 推理与问题求解 :language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08222 2025-09-11 cs.AI 77%

Exploratory Retrieval-Augmented Planning For Continual Embodied Instruction Following

Minjong Yoo, Jinwoo Jang, Wei-jin Park, Honguk Woo

机构 * Department of Computer Science and Engineering, Sungkyunkwan University(全南大学计算机科学与工程系) Acryl Inc.(阿克罗尔公司)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments 21 pages. NeurIPS 2024

Journal ref Advances in Neural Information Processing Systems 37, 67034-67060, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.02820 2025-09-11 cs.AI cs.CL cs.LG 75%

Heuristics and Biases in AI Decision-Making: Implications for Responsible AGI

Payam Saeedi, Mahsa Goodarzi, M Abdullah Canbaz

机构 * Golisano Institute for Sustainability Rochester Institute of Technology Rochester, The United States Information Sciences \& Technology, CEHC University at Albany, SUNY Albany, The United States

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05714 2025-09-11 cs.CL cs.AI 73%

HIRAG: Hierarchical-Thought Instruction-Tuning Retrieval-Augmented Generation

YiHan Jiao, ZheHao Tan, Dan Yang, DuoLin Sun, Jie Feng, Yue Shen, Jian Wang, Peng Wei

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08826 2025-09-11 cs.CV 67%

RewardDance: Reward Scaling in Visual Generation

Jie Wu, Yu Gao, Zilyu Ye, Ming Li, Liang Li, Hanzhong Guo, Jie Liu, Zeyue Xue, Xiaoxia Hou, Wei Liu, Yan Zeng, Weilin Huang

机构 * ByteDance Seed(字节跳动种子)

专题命中 推理与问题求解 :language model(abstract);RLHF(abstract)

Comments Bytedance Seed Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08621 2025-09-11 cs.CV 67%

AdsQA: Towards Advertisement Video Understanding

Xinwei Long, Kai Tian, Peng Xu, Guoli Jia, Jingxuan Li, Sa Yang, Yihua Shao, Kaiyan Zhang, Che Jiang, Hao Xu, Yang Liu, Jiaheng Ma, Bowen Zhou

机构 * Tsinghua University(清华大学) Peking University(北京大学) CASIA(中国科学院自动化所) Harvard University(哈佛大学) Shanghai Artificial Intelligence Lab(上海人工智能实验室)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

Comments ICCV-2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.02825 2025-09-11 cs.LG 57%

Randomly Sampled Language Reasoning Problems Elucidate Limitations of In-Context Learning

Kavi Gupta, Kate Sanders, Armando Solar-Lezama

专题命中 推理与问题求解 :LLM(abstract);分类 cs.LG

Comments 10 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 28 篇

2508.09016 2025-09-11 cs.CL cs.LG 88%

A Survey on Training-free Alignment of Large Language Models

Birong Pan, Yongqi Li, Weiyu Zhang, Wenpeng Lu, Mayi Xu, Shen Zhou, Yuanyuan Zhu, Ming Zhong, Tieyun Qian

机构 * School of Computer Science, Wuhan University, Wuhan, China(武汉大学计算机学院) Faculty of Computer Science and Technology, Qilu University of Technology, Shandong, China(青岛科技大学计算机科学与技术学院) Zhongguancun Academy, Beijing, China(中关村学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

Comments Accepted to EMNLP 2025 (findings), camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08024 2025-09-11 cs.CV cs.CY 88%

Two Stage Context Learning with Large Language Models for Multimodal Stance Detection on Climate Change

Lata Pangtey, Omkar Kabde, Shahid Shafi Dar, Nagendra Kumar

机构 * Department of Computer Science and Engineering, Indian Institute of Technology (IIT) Indore(计算机科学与工程系,印度理工学院(IIT)印多尔) Chaitanya Bharathi Institute of Technology, Gandipet, Hyderabad, 500075(恰伊坦尼亚·巴哈提技术学院,加迪皮特,海得拉巴,500075)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08182 2025-09-11 cs.PL cs.AI cs.CL 86%

XML Prompting as Grammar-Constrained Interaction: Fixed-Point Semantics, Convergence Guarantees, and Human-AI Protocols

Faruk Alpay, Taylan Alpay

机构 * Lightcap Institut für die Zukunft(未来研究所) Turkish Aeronautical Association(土耳其航空协会) Aerospace Engineering(航空航天工程)

专题命中 评测与基准 :prompting(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 7 pages, multiple XML prompts

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08493 2025-09-11 cs.CR cs.AI 85%

Send to which account? Evaluation of an LLM-based Scambaiting System

Hossein Siadati, Haadi Jafarian, Sima Jafarikhah

机构 * AI Research, Cybera Global Inc./ UNCW(AI研究、Cybera全球公司/UNCW) Department of Computer Science and Engineering, UC Denver(计算机科学与工程系,UC Denver) Department of Computer Science, UNCW(计算机科学系,UNCW)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14161 2025-09-11 cs.CL 85%

TheAgentCompany: Benchmarking LLM Agents on Consequential Real World Tasks

Frank F. Xu, Yufan Song, Boxuan Li, Yuxuan Tang, Kritanjali Jain, Mengxue Bao, Zora Z. Wang, Xuhui Zhou, Zhitong Guo, Murong Cao, Mingyang Yang, Hao Yang Lu, Amaad Martin, Zhe Su, Leander Maben, Raj Mehta, Wayne Chi, Lawrence Jang, Yiqing Xie, Shuyan Zhou, Graham Neubig

机构 * Carnegie Mellon University(卡内基梅隆大学) Independent(独立研究者) Duke University(杜克大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08344 2025-09-11 eess.AS 85%

Few-shot Personalization via In-Context Learning for Speech Emotion Recognition based on Speech-Language Model

Mana Ihori, Taiga Yamane, Naotaka Kawata, Naoki Makishima, Tomohiro Tanaka, Satoshi Suzuki, Shota Orihashi, Ryo Masumura

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract)

Comments Accepted by ASRU 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08494 2025-09-11 cs.CY cs.AI cs.CL cs.HC cs.LG 83%

HumanAgencyBench: Scalable Evaluation of Human Agency Support in AI Assistants

Benjamin Sturgeon, Daniel Samuelson, Jacob Haimes, Jacy Reese Anthis

机构 * Apart Research AI Safety Cape Town University of Chicago(芝加哥大学) Stanford University(斯坦福大学) Sentience Institute(意识研究所)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);RLHF(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08484 2025-09-11 cs.CL 79%

Simulating Identity, Propagating Bias: Abstraction and Stereotypes in LLM-Generated Text

Pia Sommerauer, Giulia Rambelli, Tommaso Caselli

机构 * Computational Linguistics and Text Mining Lab, Vrije Universiteit, Amsterdam(自由大学计算语言学与文本挖掘实验室) Università di Bologna(博洛尼亚大学) CLCG, University of Groningen(格罗宁根大学CLCG)

专题命中 评测与基准 :LLM(title);prompting(abstract);分类 cs.CL

Comments Accepted to EMNLP Findings 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04373 2025-09-11 cs.CL 79%

Measuring Bias or Measuring the Task: Understanding the Brittle Nature of LLM Gender Biases

Bufan Gao, Elisa Kreiss

机构 * The University of Chicago(芝加哥大学) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL

Comments To be published at EMNLP 2025 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08809 2025-09-11 cs.CL 78%

Evaluating LLMs Without Oracle Feedback: Agentic Annotation Evaluation Through Unsupervised Consistency Signals

Cheng Chen, Haiyan Yin, Ivor Tsang

机构 * Australian Artificial Intelligence Institute (AAII), University of Technology Sydney, Australia(澳大利亚人工智能研究所(AAII)、悉尼技术大学) Centre for Frontier AI Research, Institute of High Performance Computing(前沿人工智能研究中心、高性能计算研究所) Agency for Science, Technology and Research, Singapore(科技研究局(新加坡)) College of Computing and Data Science, Nanyang Technological University, Singapore(计算与数据科学学院、南洋理工大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments 11 pages, 10 figures

Journal ref Published ICLR 2025 Workshop on Scaling Self-Improving Foundation Models without Human Supervision

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08303 2025-09-11 cs.CV 78%

An Open Benchmark Dataset for GeoAI Foundation Models for Oil Palm Mapping in Indonesia

M. Warizmi Wafiq, Peter Cutter, Ate Poortinga, Daniel Marc G. dela Torre, Karis Tenneson, Vanna Teck, Enikoe Bihari, Chanarun Saisaward, Weraphong Suaruang, Andrea McMahon, Andi Vika Faradiba Muin, Karno B. Batiran, Chairil A, Nurul Qomar, Arya Arismaya Metananda, David Ganz, David Saah

机构 * RECOFTC – The Center for People and Forests(RECOFTC——人民与森林研究中心) Spatial Informatics Group, LLC(空间信息集团有限公司) Faculty of Forestry, Hasanuddin University(哈桑丁大学林业学院) Department of Forestry, Faculty of Agriculture, Universitas Riau(农业学院林业系,里亚大学) University of San Francisco(圣弗朗西斯科大学)

专题命中 评测与基准 :foundation model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08302 2025-09-11 cs.RO cs.CV 78%

Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities

Rajendramayavan Sathyam, Yueqi Li

机构 * Zoox Inc.(Zoox公司)

专题命中 评测与基准 :foundation model(title,abstract)

Comments 32 pages, 14 figures, accepted at IEEE Open Journal of Vehicular Technology (OJVT)

URL PDF HTML 收藏
2502.16838 2025-09-11 cs.CL 77%

REGen: A Reliable Evaluation Framework for Generative Event Argument Extraction

Omar Sharif, Joseph Gatto, Madhusudan Basak, Sarah M. Preum

机构 * Department of Computer Science, Dartmouth College(计算机科学系,达特茅斯学院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments Accepted at EMNLP-2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05929 2025-09-11 cs.CY 75%

Towards Reliable Generative AI-Driven Scaffolding: Reducing Hallucinations and Enhancing Quality in Self-Regulated Learning Support

Keyang Qian, Shiqi Liu, Tongguang Li, Mladen Raković, Xinyu Li, Rui Guan, Inge Molenaar, Sadia Nawaz, Zachari Swiecki, Lixiang Yan, Dragan Gašević

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

Journal ref Computers & Education, Volume 240, 2026, 105448

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16523 2025-09-11 cs.CL cs.AI 73%

Pay Attention to Real World Perturbations! Natural Robustness Evaluation in Machine Reading Comprehension

Yulong Wu, Viktor Schlegel, Riza Batista-Navarro

机构 * Department of Computer Science, University of Manchester(曼彻斯特大学计算机科学系) Imperial College London, Imperial Global Singapore(伦敦帝国理工学院、帝国全球新加坡)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08777 2025-09-11 cs.CV cs.CL 70%

Calibrating MLLM-as-a-judge via Multimodal Bayesian Prompt Ensembles

Eric Slyman, Mehrab Tanjim, Kushal Kafle, Stefan Lee

机构 * Adobe(Adobe公司) Oregon State University(俄勒冈州立大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

Comments 17 pages, 8 figures, Accepted at ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.13729 2025-09-11 cs.CL 70%

Baba Is AI: Break the Rules to Beat the Benchmark

Nathan Cloos, Meagan Jens, Michelangelo Naim, Yen-Ling Kuo, Ignacio Cases, Andrei Barbu, Christopher J. Cueva

机构 * MIT(麻省理工学院) Department of Computer Science, University of Virginia, USA(弗吉尼亚大学计算机科学系)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

Comments 8 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08088 2025-09-11 cs.AI cs.MA 70%

EnvX: Agentize Everything with Agentic AI

Linyao Chen, Zimian Peng, Yingxuan Yang, Yikun Wang, Wenzheng Tom Tang, Hiroki H. Kobayashi, Weinan Zhang

机构 * EnvX Team(EnvX团队) Shanghai Innovation Institute(上海创新研究院) Shanghai Jiao Tong University(上海交通大学) The University of Tokyo(东京大学) Zhejiang University(浙江大学) Fudan University(复旦大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08757 2025-09-11 cs.RO cs.CV 67%

SocialNav-SUB: Benchmarking VLMs for Scene Understanding in Social Robot Navigation

Michael J. Munje, Chen Tang, Shuijing Liu, Zichao Hu, Yifeng Zhu, Jiaxun Cui, Garrett Warnell, Joydeep Biswas, Peter Stone

机构 * Department of Computer Science, The University of Texas at Austin(德克萨斯大学计算机科学系) Army Research Laboratory(陆军研究实验室) Sony AI(索尼人工智能)

专题命中 评测与基准 :language model(abstract);foundation model(abstract)

Comments Conference on Robot Learning (CoRL) 2025 Project site: https://larg.github.io/socialnav-sub

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08618 2025-09-11 cs.CV 67%

CLAPS: A CLIP-Unified Auto-Prompt Segmentation for Multi-Modal Retinal Imaging

Zhihao Zhao, Yinzheng Zhao, Junjie Yang, Xiangtong Yao, Quanmin Liang, Shahrooz Faghihroohi, Kai Huang, Nassir Navab, M. Ali Nasseri

机构 * Technical University of Munich(慕尼黑技术大学) Sun Yat-Sen University(中山大学)

专题命中 评测与基准 :foundation model(abstract);prompting(abstract)

Comments BIBM

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08345 2025-09-11 cs.CL cs.AI 62%

Toward Subtrait-Level Model Explainability in Automated Writing Evaluation

Alejandro Andrade-Lotero, Lee Becker, Joshua Southerland, Scott Hellman

机构 * Pearson Education(培生教育) Pearson Education, Inc.(培生教育公司)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

Comments Accepted to National Council on Measurement in Education (NCME) 2025 Annual Meeting

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08593 2025-09-11 cs.AI stat.ML 57%

No-Knowledge Alarms for Misaligned LLMs-as-Judges

Andrés Corrada-Emmanuel

机构 * Data Engines(数据引擎)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

Comments 7 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21117 2025-09-11 cs.CL 57%

Beyond One-Size-Fits-All: Inversion Learning for Highly Effective NLG Evaluation Prompts

Hanhua Hong, Chenghao Xiao, Yang Wang, Yiqi Liu, Wenge Rong, Chenghua Lin

机构 * The University of Manchester(曼彻斯特大学) Durham University(杜伦大学) Beihang University(北航大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

Comments 11 pages, accepted by Transactions of the Association for Computational Linguistics (TACL)

详情

展开后加载摘要…

URL PDF HTML 收藏