arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-01 至 2025-12-01 共收录 284 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 60 篇

2511.17554 2025-12-01 cs.CY cs.CL 83%

Beyond the Rubric: Cultural Misalignment in LLM Benchmarks for Sexual and Reproductive Health

超越标准:性与生殖健康LLM基准测试中的文化错位

Sumon Kanti Dey, Manvi S, Zeel Mehta, Meet Shah, Unnati Agrawal, Suhani Jalota, Azra Ismail

机构 * Emory University(埃默里大学) Hoover Institution(霍夫曼研究所) Myna Mahila Foundation(米娜妇女基金会)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文指出现有LLM基准测试在性与生殖健康领域存在文化偏见,提出需开发适应不同文化需求的评估框架。

Comments https://github.com/Sumon/healthbench-srh-eval/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21788 2025-12-01 cs.SE 82%

Code Refactoring with LLM: A Comprehensive Evaluation With Few-Shot Settings

基于LLM的代码重构:结合少样本设置的全面评估

Md. Raihan Tapader, Md. Mostafizer Rahman, Ariful Islam Shiplu, Md Faizul Ibne Amin, Yutaka Watanobe

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract)

AI总结 本研究提出基于LLM的多语言代码重构框架,通过少样本学习和提示工程提升重构准确性与效率,实验显示Java在正确性与可编译性上表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21730 2025-12-01 cs.CL cs.AI cs.LG 82%

A Benchmark for Procedural Memory Retrieval in Language Agents

一种用于语言代理中程序记忆检索的基准测试

Ishant Kohar, Aswanth Krishnan

机构 * Qpi AI

专题命中 评测与基准 :language agent(title);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种用于评估语言代理程序记忆检索能力的基准测试,通过构建双语料库和系统分层查询,揭示了基于嵌入的方法在新上下文中的泛化问题,并展示了LLM生成的程序抽象在跨上下文转移中的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20737 2025-12-01 cs.CV cs.AI cs.CL 81%

CANVAS: A Benchmark for Vision-Language Models on Tool-Based User Interface Design

CANVAS:基于工具的用户界面设计的视觉-语言模型基准

Daeheon Jeong, Seoyeon Byun, Kihoon Son, Dae Hyun Kim, Juho Kim

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 CANVAS是一个用于评估视觉-语言模型在基于工具的用户界面设计任务中性能的基准,通过复制和修改UI设计任务来测试模型的工具调用能力和设计质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21843 2025-12-01 cs.CL cs.AI cs.DL cs.LG 80%

FLAWS: A Benchmark for Error Identification and Localization in Scientific Papers

FLAWS: 一个用于科学论文中错误识别和定位的基准

Sarina Xi, Vishisht Rao, Justin Payan, Nihar B. Shah

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 FLAWS基准通过713篇论文错误对评估LLMs在识别和定位科学论文中关键主张错误的能力,GPT 5在k=10时达到39.1%的识别准确率。

Comments 30 pages, 12 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00202 2025-12-01 cs.LG 79%

RouterArena: An Open Platform for Comprehensive Comparison of LLM Routers

RouterArena: 一个用于全面比较大语言模型路由器的开放平台

Yifan Lu, Rixin Liu, Jiayi Yuan, Xingqi Cui, Shenrun Zhang, Hongyi Liu, Jiarong Xing

机构 * Rice University(里士大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.LG

AI总结 RouterArena是一个开放平台,用于全面比较大语言模型路由器,提供广泛的数据集、可区分的难度级别、广泛的评估指标和自动化的排行榜更新框架。

Comments 22 pages, 13 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26347 2025-12-01 cs.AI 79%

Uncovering Zero-Shot Generalization Gaps in Time-Series Foundation Models Using Real-World Videos

通过真实世界视频揭示时间序列基础模型的零样本泛化差距

Lujun Li, Lama Sleem, Yiqun Wang, Yangjie Xu, Niccolò Gentile, Radu State

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI

AI总结 本文提出REAL-V-TSFM数据集,通过真实世界视频提取时间序列,揭示现有时间序列基础模型在零样本预测中的泛化能力不足问题。

Comments This paper has been accepted by Artificial Intelligence for Time Series Analysis (AI4TS) Workshop @ AAAI 2026: Theory, Algorithms, and Applications

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22448 2025-12-01 cs.AI cs.IR 79%

Structured Extraction from Business Process Diagrams Using Vision-Language Models

使用视觉-语言模型从业务流程图中提取结构

Pritam Deka, Barry Devereux

机构 * Queen's University Belfast(女王大学贝尔法斯特)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 本文提出使用视觉-语言模型和OCR技术从BPMN图像中提取结构化数据,无需源文件或文本注释。

Comments To appear in the Proceedings of the 2026 ACM Symposium on Applied Computing (SAC '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22312 2025-12-01 cs.CL 79%

Token-Level Marginalization for Multi-Label LLM Classifiers

标记级边际化用于多标签LLM分类器

Anjaneya Praharaj, Jaykumar Kasundra

机构 * ServiceNow

专题命中 评测与基准 :LLM(title);language model(abstract);分类 cs.CL

AI总结 本文提出三种标记级概率估计方法,提升生成模型在多标签内容安全分类中的可解释性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22131 2025-12-01 cs.CV cs.LG physics.med-ph 79%

Autonomous labeling of surgical resection margins using a foundation model

利用基础模型实现手术切除边缘的自主标注

Xilin Yang, Musa Aydin, Yuhong Lu, Sahan Yoruc Selcuk, Bijie Bai, Yijie Zhang, Andrew Birkeland, Katjana Ehrlich, Julien Bec, Laura Marcu, Nir Pillar, Aydogan Ozcan

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 本文提出了一种基于基础模型的虚拟勾画网络,用于自主标注手术切除边缘,提升了病理分析的准确性和可重复性。

Comments 20 Pages, 5 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21982 2025-12-01 cs.CV cs.AI 79%

DialBench: Towards Accurate Reading Recognition of Pointer Meter using Large Foundation Models

DialBench: 通过大基础模型实现指针表盘读数的准确识别

Futian Wang, Chaoliu Weng, Xiao Wang, Zhen Chen, Zhicheng Zhao, Jin Tang

机构 * School of Computer Science and Technology, Anhui University, Hefei 230601, China(安徽大学计算机科学与技术学院) School of Artificial Intelligence, Anhui University, Hefei 230601, China(安徽大学人工智能学院) Department of Computer Science and Information Technology, La Trobe University, Bendigo, Australia(拉筹伯大学计算机科学与信息技术系)

专题命中 评测与基准 :foundation model(title);language model(abstract);分类 cs.AI

AI总结 本文提出DialBench基准数据集和MRLM模型,通过物理关系注入提升指针表盘读数识别的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23101 2025-12-01 cs.CL cs.AI 79%

Mind Reading or Misreading? LLMs on the Big Five Personality Test

心念识读还是误读?LLMs在Big Five人格测试中的表现

Francesco Di Cursi, Chiara Boldrini, Marco Conti, Andrea Passarella

机构 * IIT-CNR(意大利理工学院-国家研究委员会)

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 研究评估了LLMs在Big Five人格测试中的表现,发现增强提示虽能提升性能但引入系统偏见,不同特质检测难度差异显著,需协调提示设计与评估指标以获得可解释结果。

Comments Funding: SoBigDatait (IR0000013), FAIR (PE00000013), ICSC (CN00000013)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22818 2025-12-01 cs.CL cs.LG 79%

Mitigating Semantic Drift: Evaluating LLMs' Efficacy in Psychotherapy through MI Dialogue Summarization

缓解语义漂移:通过MI对话摘要评估LLMs在心理治疗中的有效性

Vivek Kumar, Pushpraj Singh Rajawat, Eirini Ntoutsi

机构 * Research Institute CODE University of the Bundeswehr(CODE研究机构 陆军大学) Department of Psychology Barkatullah University(心理学系 Barkatullah大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.LG

AI总结 本文通过MI对话摘要评估LLMs在心理治疗中的有效性,揭示其在复杂心理构念理解中的能力及缓解语义漂移的最佳实践。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21860 2025-12-01 cs.CL cs.AI 79%

Improving Score Reliability of Multiple Choice Benchmarks with Consistency Evaluation and Altered Answer Choices

通过一致性评估和改变答案选项提高多项选择基准的评分可靠性

Paulo Cavalin, Cassia Sanctos, Marcelo Grave, Claudio Pinhanez, Yago Primerano

机构 * IBM Research Brazil(IBM巴西研究院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CoRA指标,通过一致性评估和改变答案选项提高LLM在多项选择基准中的评分可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.10624 2025-12-01 cs.CV 78%

Configurable Fairness: Direct Optimization of Parity Metrics via Vision-Language Models

可配置公平性:通过视觉-语言模型直接优化平衡度指标

Miao Zhang, Rumi Chunara

机构 * New York University(纽约大学)

专题命中 评测与基准 :language model(title,abstract)

AI总结 本文提出通过视觉-语言模型直接优化平衡度量指标的方法,无需群体标签,提升图像识别的公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22805 2025-12-01 cs.CV cs.LG cs.MM 77%

From Pixels to Feelings: Aligning MLLMs with Human Cognitive Perception of Images

从像素到感受:将MLLMs对齐于人类对图像的认知感知

Yiming Chen, Junlin Han, Tianyi Bai, Shengbang Tong, Filippos Kokkinos, Philip Torr

机构 * Oxford University(牛津大学) HKUST(香港科技大学) University College London(伦敦大学学院) New York University(纽约大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.LG

AI总结 本文提出CogIP-Bench基准,通过后训练提升MLLMs对图像认知属性的对齐能力,并展示其在图像生成中的应用。

Comments Project page with codes/datasets/models: https://follen-cry.github.io/MLLM-Cognition-project-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22240 2025-12-01 cs.IR cs.AI 77%

Evaluating Embedding Models and Pipeline Optimization for AI Search Quality

评估嵌入模型与管道优化以提高AI搜索质量

Philip Zhong, Kent Chen, Don Wang

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文评估了不同嵌入模型和管道配置对AI搜索质量的影响,发现高维嵌入和神经重新排序器能显著提升检索准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23377 2025-12-01 cs.CV 75%

DEAL-300K: Diffusion-based Editing Area Localization with a 300K-Scale Dataset and Frequency-Prompted Baseline

DEAL-300K:基于扩散的编辑区域定位与30万规模数据集及频率提示基线

Rui Zhang, Hongxia Wang, Hangqing Liu, Yang Zhou, Qiang Zeng

机构 * School of Cyber Science and Engineering, Sichuan University(四川大学计算机科学与工程学院) Key Laboratory of Data Protection and Intelligent Management, Ministry of Education, Sichuan University(教育部数据保护与智能管理重点实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 DEAL-300K通过多模态大语言模型生成编辑指令,结合频率提示微调方法,实现了基于扩散的图像编辑区域定位,提供高精度的基线和研究基础。

Comments 13pages,12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21749 2025-12-01 cs.CL cs.AI 73%

Proactive Defense: Compound AI for Detecting Persuasion Attacks and Measuring Inoculation Effectiveness

主动防御:用于检测说服攻击并衡量免疫效果的复合AI

Svitlana Volkova, Will Dupree, Hsien-Te Kao, Peter Bautista, Gabe Ganberg, Jeff Beaubien, Laura Cassani

机构 * Aptima, Inc.(Aptima公司)

专题命中 评测与基准 :LLM(abstract);language agent(abstract);分类 cs.CL、cs.AI

AI总结 本文提出BRIES复合AI架构,通过专门代理检测说服攻击并评估免疫效果,揭示不同模型在处理说服语言上的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05244 2025-12-01 cs.AI cs.CL 73%

WritingBench: A Comprehensive Benchmark for Generative Writing

WritingBench: 一个全面的生成写作评估基准

Yuning Wu, Jiahao Mei, Ming Yan, Chenliang Li, Shaopeng Lai, Yuran Ren, Zijia Wang, Ji Zhang, Mengyue Wu, Qin Jin, Fei Huang

机构 * Alibaba Group(阿里巴巴集团) Renmin University of China(中国人民大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 WritingBench是一个用于评估生成写作能力的综合基准,通过查询依赖框架和微调批评模型,提升多领域写作任务的评估效能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19676 2025-12-01 cs.CR 71%

A Survey of LLM-Driven AI Agent Communication: Protocols, Security Risks, and Defense Countermeasures

面向大语言模型驱动的AI代理通信的综述:协议、安全风险及防御措施

Dezhang Kong, Shi Lin, Zhenhua Xu, Zhebo Wang, Minghao Li, Yufeng Li, Yilun Zhang, Hujin Peng, Xiang Chen, Zeyang Sha, Yuyuan Li, Changting Lin, Xun Wang, Xuan Liu, Ningyu Zhang, Chaochao Chen, Chunming Wu, Muhammad Khurram Khan, Meng Han

专题命中 评测与基准 :LLM(title)

AI总结 本文综述了由大语言模型驱动的AI代理通信的安全问题,提出定义、分类框架及防御措施,通过实验揭示通信漏洞并探讨未来研究方向。

Comments 48 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22883 2025-12-01 cs.CL 70%

FEANEL: A Benchmark for Fine-Grained Error Analysis in K-12 English Writing

FEANEL:K-12英语写作中细粒度错误分析的基准

Jingheng Ye, Shen Wang, Jiaqi Chen, Hebin Wang, Deqing Zou, Yanyu Zhu, Jiwei Tang, Hai-Tao Zheng, Ruitong Liu, Haoyang Li, Yanfeng Wang, Qingsong Wen

机构 * Squirrel Ai Learning Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 FEANEL基准旨在评估LLMs在K-12英语写作中细粒度错误分析的能力,通过1000篇学生作文和自定义分类体系,揭示当前模型在教育反馈方面的不足。

Comments 19 pages, 7 figures, and 4 tables. The dataset is available at https://huggingface.co/datasets/Feanel/FEANEL

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14652 2025-12-01 cs.CY cs.AI cs.HC cs.SI 70%

Reranking partisan animosity in algorithmic social media feeds alters affective polarization

算法社交媒体信息流中重新排序偏见影响情感极化

Tiziano Piccardi, Martin Saveski, Chenyan Jia, Jeffrey T. Hancock, Jeanne L. Tsai, Michael Bernstein

机构 * Johns Hopkins University(约翰霍普金斯大学) University of Washington(华盛顿大学) Northeastern University(东北大学) Stanford University(斯坦福大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 通过实时重新排序信息流,研究暴露于反民主内容如何影响情感极化,提供因果证据并建立独立评估方法。

Journal ref Science; Volume 390 | Issue 6776; 27 November 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19957 2025-12-01 cs.CL 70%

AppSelectBench: Application-Level Tool Selection Benchmark

AppSelectBench: 应用级工具选择基准

Tianyi Chen, Michael Solodko, Sen Wang, Jongwoo Ko, Junheng Hao, Colby Banbury, Sara Abdali, Saeed Amizadeh, Qing Xiao, Yinheng Li, Tianyu Ding, Kamran Ghasedi Dizaji, Suzhen Zheng, Hao Fan, Justin Wagle, Pashmina Cameron, Kazuhito Koishida

机构 * Microsoft(微软)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 AppSelectBench通过评估CUAs的应用选择能力,揭示了模型在跨应用推理中的系统性优劣,为智能代理的研究提供了新基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14307 2025-12-01 cs.CL 70%

How LLMs Comprehend Temporal Meaning in Narratives: A Case Study in Cognitive Evaluation of LLMs

大语言模型如何在叙述中理解时间意义:一项对大语言模型认知评估的案例研究

Karin de Langis, Jong Inn Park, Andreas Schramm, Bin Hu, Khanh Chi Le, Michael Mensink, Ahn Thu Tong, Dongyeop Kang

机构 * University of Minnesota(明尼苏达大学) Hamline University(哈姆林大学) University of Wisconsin-Stout(威斯康星州立大学斯托特分校)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究通过实验发现,大语言模型在处理叙述中的时间意义时,过度依赖原型性,导致不一致的判断和因果推理困难,表明其与人类在理解叙述方面存在根本差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23178 2025-12-01 cs.SD 67%

HPSU: A Benchmark for Human-Level Perception in Real-World Spoken Speech Understanding

HPSU:面向真实世界语音理解的人类水平感知基准

Chen Li, Peiji Yang, Yicheng Zhong, Jianxing Yu, Zhisheng Wang, Zihao Gou, Wenqing Chen, Jian Yin

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 HPSU是一个用于评估语音大语言模型人类水平感知能力的基准,通过融合多模态信息提升标注效率,揭示当前模型在真实语音理解上的不足。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19059 2025-12-01 cs.SE 67%

LLMAID: Identifying AI Capabilities in Android Apps with LLMs

LLMAID: 用大语言模型在Android应用中识别AI能力

Pei Liu, Terry Zhuo, Jiawei Deng, Thong James, Shidong Pan, Sherry Xu, Zhenchang Xing, Qinghua Lu, Xiaoning Du, Hongyu Zhang

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 LLMAID利用大语言模型识别Android应用中的AI能力,通过四个任务实现高精度检测,发现计算机视觉中AI功能高度集中。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04449 2025-12-01 cs.LG cs.AI 66%

ChronoGraph: A Real-World Graph-Based Multivariate Time Series Dataset

ChronoGraph:一个基于图的多变量时间序列真实世界数据集

Adrian Catalin Lutu, Ioana Pintilie, Elena Burceanu, Andrei Manolache

机构 * Bitdefender University of Bucharest(布加勒斯特大学) University of Stuttgart(斯图加特大学) International Max Planck Research School for Intelligent Systems(智能系统国际马克斯·普朗克研究学校)

专题命中 评测与基准 :foundation model(abstract,comments);分类 cs.AI、cs.LG

AI总结 ChronoGraph是一个基于图的多变量时间序列数据集,用于研究微服务系统中的结构感知预测和事件感知评估。

Comments Accepted as an oral presentation at the NeurIPS 2025 Workshop on Recent Advances in Time Series Foundation Models (BERT2S)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23287 2025-12-01 cs.LG cs.CL 62%

Transformer-Driven Triple Fusion Framework for Enhanced Multimodal Author Intent Classification in Low-Resource Bangla

基于Transformer的三融合框架用于低资源孟加拉语多模态作者意图分类

Ariful Islam, Tanvir Mahmud, Md Rifat Hossen

机构 * Department of Computer Science(计算机科学系) Engineering Chittagong University of Engineering(工程学院恰尔达格工程大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出基于Transformer的三融合框架BangACMM,通过结合文本和视觉数据,在低资源孟加拉语社交媒体中实现作者意图分类,达到84.11%的宏F1得分,提升8.4个百分点。

Comments Accepted at the 28th International Conference on Computer and Information Technology (ICCIT 2025). To be published in IEEE proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21712 2025-12-01 cs.CL cs.AI cs.CY 62%

EulerESG: Automating ESG Disclosure Analysis with LLMs

EulerESG: 利用LLMs自动化ESG披露分析

Yi Ding, Xushuo Tang, Zhengyi Yang, Wenqian Zhang, Simin Wu, Yuxin Huang, Lingjing Lan, Weiyuan Li, Yin Chen, Mingchen Ju, Wenke Yang, Thong Hoang, Mykhailo Klymenko, Xiwei Zu, Wenjie Zhang

机构 * UNSW Sydney(新南威尔士大学悉尼分校) Eigenflow AI Euler AI UTS Sydney(悉尼大学) Data61, CSIRO

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 EulerESG利用LLM自动化ESG披露分析,通过双通道检索和交互式仪表板实现高精度的指标表格生成与标准对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏