arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32271 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32271 篇

2507.22244 2026-02-04 econ.GN q-fin.EC 88%

Valuing Time in Silicon: Can Large Language Models Replicate Human Value of Travel Time

硅中的时间价值:大语言模型能否复制人类的旅行时间价值

Yingnan Yan, Tianming Liu, Yafeng Yin

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 本研究通过分析三种大语言模型的旅行时间价值,发现其行为与人类高度相似,但存在模型间敏感度差异,为LLMs作为人类旅行者代理提供了基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01816 2026-02-03 cs.CV 88%

Seeing Is Believing? A Benchmark for Multimodal Large Language Models on Visual Illusions and Anomalies

看见即相信?多模态大语言模型在视觉错觉和异常上的基准测试

Wenjin Hou, Wei Liu, Han Hu, Xiaoxiao Sun, Serena Yeung-Levy, Hehe Fan

机构 * Zhejiang University(浙江大学) Tencent Hunyuan Team(腾讯文言团队) Stanford University(斯坦福大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出VIA-Bench基准测试,评估多模态大语言模型在视觉错觉和异常上的性能,揭示其在复杂视觉任务中的鲁棒性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22811 2026-02-02 astro-ph.SR 88%

Operational Solar Flare Forecasting System Using an Explainable Large Language Model

基于可解释大型语言模型的操作性太阳耀斑预报系统

Xuebao Li, Yongshang Lv, Jinfang Wei, Yanfang Zheng, Ting Li, Rui Wang, Zixian Wu, Hongwei Ye, Pengchao Yan, Zamri Zainal Abidin, Noraisyah Mohamed Shah, Changtian Xiang, Shunhuang Zhang, Xiaojia Ji, Xusheng Huang, Xiaotian Wang, Honglei Jin

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出基于可解释大型语言模型的操作性太阳耀斑预报系统,通过SHAP分析揭示关键物理特征,实现优于现有系统的预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09957 2026-02-02 cs.DC cs.CR cs.SE 88%

CloudFix: Automated Policy Repair for Cloud Access Control Policies Using Large Language Models

CloudFix: 利用大语言模型实现云访问控制策略的自动化修复

Bethel Hall, Owen Ungaro, William Eiers

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 CloudFix利用大语言模型和形式方法,实现云访问控制策略的自动化修复,提高修复准确性和效率。

Comments 12 pages

Journal ref SANER 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05895 2026-01-28 cs.CV 88%

BTCChat: Advancing Remote Sensing Bi-temporal Change Captioning with Multimodal Large Language Model

BTCChat: 通过多模态大语言模型推进遥感双时相变化描述

Yujie Li, Wenjia Xu, Yuanben Zhang, Zhiwei Wei, Mugen Peng

机构 * State Key Laboratory of Networking and Switching Technology(网络与交换技术国家重点实验室) Beijing University of Posts and Telecommunications(北京邮电大学) Aerospace Information Research Institute(航天信息研究所) Chinese Academy of Sciences(中国科学院) School of Geographical Sciences(地理科学学院) Hunan Normal University(湖南师范大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 BTCChat通过多模态大语言模型提升遥感双时相变化描述能力,引入变化提取模块和提示增强机制,实现更精确的视觉-语义对齐和更优的性能表现。

Comments 5 pages, 2 figures; Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18346 2026-01-27 cs.CV 88%

Q-Bench-Portrait: Benchmarking Multimodal Large Language Models on Portrait Image Quality Perception

Q-Bench-Portrait:多模态大语言模型在肖像图像质量感知上的基准测试

Sijing Wu, Yunhao Li, Zicheng Zhang, Qi Jia, Xinyue Li, Huiyu Duan, Xiongkuo Min, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 Q-Bench-Portrait首次提出用于评估多模态大语言模型在肖像图像质量感知上的能力,包含2765个三元组,涵盖多种图像来源和质量维度,评估20个模型后发现其表现有限,与人类判断存在差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18712 2026-01-27 cs.CV 88%

LLaVAction: evaluating and training multi-modal large language models for action understanding

LLaVAction:评估和训练多模态大语言模型进行动作理解

Haozhe Qi, Shaokai Ye, Alexander Mathis, Mackenzie W. Mathis

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 LLaVAction通过引入动作标记和两阶段流程提升多模态大语言模型的动作理解能力,显著提升基准测试性能。

Comments https://github.com/AdaptiveMotorControlLab/LLaVAction

Journal ref International Conference on Learning Representations (ICLR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15406 2026-01-23 cs.CV 88%

Evaluating Multimodal Large Language Models for Heterogeneous Face Recognition

评估多模态大语言模型用于异构人脸识别

Hatef Otroshi Shahreza, Anjith George, Sébastien Marcel

机构 * Idiap Research Institute(日内瓦研究所)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 本文评估了多模态大语言模型在异构人脸识别中的性能,发现其在跨模态条件下表现欠佳,凸显了当前模型的局限性及生物识别评估的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12087 2026-01-21 cs.SE 88%

TransLibEval: Demystify Large Language Models' Capability in Third-party Library-targeted Code Translation

TransLibEval: 解密大型语言模型在第三方库定向代码翻译中的能力

Pengyu Xue, Kunwu Zheng, Zhen Yang, Yifei Pei, Linhao Wu, Jiahui Dong, Xiapu Luo, Yan Xiao, Fei Liu, Yuxuan Zhang, Xiran Lyu, Xianhang Li, Xuanyu Zhu, Chengyi Wang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 TransLibEval首次构建了专注于第三方库导向代码翻译的基准测试,揭示LLM在处理TPL时的性能缺陷及改进方向。

Comments 24 pages, 5 figures, accepted by FSE 2026 (The ACM International Conference on the Foundations of Software Engineering)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05879 2026-01-19 cs.HC 88%

Human-AI Alignment of Multimodal Large Language Models with Speech-Language Pathologists in Parent-Child Interactions

与语言病理学家在亲子互动中的人机对齐多模态大语言模型

Weiyan Shi, Kenny Tsu Wei Choo

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 本研究通过多模态大语言模型与语言病理学家的对齐,开发了支持亲子互动分析的系统,实现了85%的感知线索提取准确率和75%的判断精确率,并提出了行为观察-判断系统的构建指南。

Comments This is an earlier version of the work released in May 2025. The version accepted at CHI 2026 is available as a separate preprint at arXiv:2511.04366

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10460 2026-01-16 cs.CL cs.AI cs.CY cs.LG 88%

Contextual StereoSet: Stress-Testing Bias Alignment Robustness in Large Language Models

上下文立体集:在大型语言模型中压力测试偏见对齐的鲁棒性

Abhinaba Basu, Pavan Chakraborty

机构 * Indian Institute of Information Technology, Allahabad (IIITA)(印度信息与技术研究所(Allahabad)) National Institute of Electronics and Information Technology (NIELIT)(国家电子与信息技术研究所)

专题命中 评测与基准 :large language model(title);language model(title);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 上下文立体集通过压力测试大型语言模型在不同上下文中的偏见对齐鲁棒性,揭示固定条件测试的偏见分数可能无法推广。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03432 2026-01-08 cs.SE 88%

CodeEval: A pedagogical approach for targeted evaluation of code-trained Large Language Models

CodeEval: 一种面向代码训练大语言模型的教育性评估方法

Danny Brahman, Mohammad Mahoor

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 CodeEval通过多维基准数据集和开源执行框架,针对代码训练大语言模型的评估与改进提供教育性方法。

Comments Accepted at the International Joint Conference on Natural Language Processing & Asia-Pacific Chapter of the Association for Computational Linguistics, 2025. Will be published at ACL anthology

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12595 2026-01-06 cs.CV 88%

Vision-Enhanced Large Language Models for High-Resolution Image Synthesis and Multimodal Data Interpretation

增强视觉能力的大型语言模型用于高分辨率图像合成和多模态数据解释

Karthikeya KV

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 本研究提出了一种增强视觉能力的大型语言模型,通过整合修正流机制和混合序列建模方法,实现高分辨率图像合成和多模态数据解释的高效生成与高质量输出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06142 2026-01-06 cs.CV 88%

SDEval: Safety Dynamic Evaluation for Multimodal Large Language Models

SDEval: 多模态大语言模型的安全动态评估

Hanqing Wang, Yuan Tian, Mingyu Liu, Zhenhao Zhang, Xiangyang Zhu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 SDEval通过动态调整安全基准分布和复杂度,提升多模态大语言模型的安全评估效果,缓解数据污染并揭示模型安全局限。

Comments AAAI 2026 poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00836 2026-01-06 physics.soc-ph cs.CY 88%

ESG Beliefs of Large Language Models: Evidence and Impact

大语言模型的ESG信念:证据与影响

Tong Li, Luping Yu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 研究发现大语言模型具有系统性的ESG信念,其对ESG的重视程度高于人类投资者,且影响分析师对高ESG公司的乐观态度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16587 2026-01-05 cs.SE 88%

A Survey on the Application of Large Language Models in Scenario-Based Testing of Automated Driving Systems

面向自动驾驶系统场景化测试的大型语言模型应用综述

Yongqi Zhao, Ji Zhou, Dong Bi, Tomislav Mihalj, Jia Hu, Arno Eichberger

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 本文综述了大型语言模型在自动驾驶系统场景化测试中的应用,系统分类了其在不同测试阶段的角色,并总结了关键特性与使用策略,同时指出了五个开放挑战和研究方向。

Comments 24 pages, 11 figures

Journal ref IEEE Transactions on Intelligent Transportation Systems 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23219 2025-12-30 cs.CV 88%

MM-UAVBench: How Well Do Multimodal Large Language Models See, Think, and Plan in Low-Altitude UAV Scenarios?

MM-UAVBench: 多模态大语言模型在低空无人机场景中的感知、推理与规划能力如何?

Shiqi Dai, Zizhi Ma, Zhicong Luo, Xuesong Yang, Yibin Huang, Wanyue Zhang, Chi Chen, Zonghao Guo, Wang Xu, Yufei Sun, Maosong Sun

机构 * Tsinghua University(清华大学) Nankai University(南开大学) Northwest Polytechnical University(西北工业大学) Chinese Academy of Sciences(中国科学院) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 MM-UAVBench通过系统评估多模态大语言模型在低空无人机场景中的感知、推理与规划能力,揭示其在复杂任务中的性能瓶颈与改进方向。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20933 2025-12-30 cs.SE 88%

Hierarchical Evaluation of Software Design Capabilities of Large Language Models of Code

大型语言模型代码设计能力的分层评估

Mootez Saad, Boqi Chen, José Antonio Hernández López, Dániel Varró, Tushar Sharma

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 本文评估了大型语言模型在代码设计能力上的分层表现,发现其在耦合性推理上易受噪声影响,而内聚性分析在受控环境下较稳健,但整体自主推理能力有限。

Comments 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17389 2025-12-22 cs.IR 88%

The Mental World of Large Language Models in Recommendation: A Benchmark on Association, Personalization, and Knowledgeability

大语言模型在推荐系统中的心理世界:关联性、个性化与知识性基准测试

Guangneng Hu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出LRWorld基准,评估大语言模型在推荐系统中的关联性、个性化和知识性能力,发现其在浅层相似性任务上表现良好,但在深度个性化嵌入和多模态推理方面仍有不足。

Comments 21 pages, 13 figures, 27 tables, submission to KDD 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01050 2025-12-19 cs.DB 88%

AutoDDG: Automated Dataset Description Generation using Large Language Models

AutoDDG:利用大语言模型实现自动化数据集描述生成

Haoxiang Zhang, Yurong Liu, Aécio Santos, Wei-Lun Hung, Juliana Freire

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 AutoDDG利用大语言模型自动生成数据集描述,提升数据集检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11215 2025-12-15 cs.CV 88%

SmokeBench: Evaluating Multimodal Large Language Models for Wildfire Smoke Detection

SmokeBench: 评估多模态大语言模型用于野火烟雾检测

Tianye Qi, Weihao Li, Nick Barnes

机构 * Australian National University(澳大利亚国立大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 SmokeBench评估多模态大语言模型在野火烟雾检测中的性能,发现模型在烟雾定位方面存在显著局限,尤其在早期阶段。

Comments Accepted to WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.11255 2025-12-12 cs.HC 88%

Visualization Generation with Large Language Models: An Evaluation

利用大语言模型进行可视化生成:一项评估

Xinyu Wang, Chenwei Liang, Shunyuan Zheng, Jinyuan Liang, Guozheng Li, Yu Zhang, Chi Harold Liu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 本文评估了不同大语言模型在NL2VIS任务中生成可视化规范的能力,发现提示策略、图表类型和模型间存在显著性能差异,并提出改进基准的方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21491 2025-12-09 cs.IR 88%

Geospatial Question Answering on Historical Maps Using Spatio-Temporal Knowledge Graphs and Large Language Models

利用时空知识图谱和大语言模型进行历史地图的地理问题回答

Ziyi Liu, Sidi Wu, Lorenz Hurni

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 本研究提出利用时空知识图谱和大语言模型开发GeoQA系统,实现对历史地图中地理问题的高效回答与可视化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04673 2025-12-05 cs.SE 88%

Cross-Task Benchmarking and Evaluation of General-Purpose and Code-Specific Large Language Models

跨任务基准测试与通用型和代码特定大型语言模型的评估

Gunjan Das, Paheli Bhattacharya, Rishabh Gupta

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 本文评估了通用和代码特定大型语言模型在跨任务基准测试中的表现,发现代码优化模型在推理和语法精确度上优于通用模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01424 2025-12-05 cs.CV 88%

ViRectify: A Challenging Benchmark for Video Reasoning Correction with Multimodal Large Language Models

ViRectify:一种用于多模态大语言模型视频推理纠错的挑战性基准

Xusen Hei, Jiali Chen, Jinyu Yang, Mengchen Zhao, Yi Cai

机构 * South China University of Technology(华南理工大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 ViRectify是一个用于评估多模态大语言模型视频推理纠错能力的挑战性基准,通过构建大规模数据集和提出轨迹证据驱动的纠正框架,验证了模型在纠错任务中的性能差异。

Comments 22 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22055 2025-12-01 cs.CV cs.MM 88%

OralGPT-Omni: A Versatile Dental Multimodal Large Language Model

OralGPT-Omni: 一种多功能的牙科多模态大语言模型

Jing Hao, Yuci Liang, Lizhuo Lin, Yuxuan Fan, Wenkai Zhou, Kaixin Guo, Zanting Ye, Yanpeng Sun, Xinyu Zhang, Yanqi Yang, Qiankun Li, Hao Tang, James Kit-Hon Tsoi, Linlin Shen, Kuo Feng Hung

机构 * Faculty of Dentistry, The University of Hong Kong(香港大学牙科学院) College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院) The Hong Kong University of Science and Technology (GZ)(香港科学与技术大学) School of Biomedical Engineering, Southern Medical University(南方医科大学生物医学工程学院) Singapore University of Technology and Design(新加坡科技与设计大学) University of Auckland(奥克兰大学) University of Science and Technology of China(中国科学技术大学) School of Computer Science, Peking University(北京大学计算机学院) College of Artificial Intelligence, Shenzhen University(深圳大学人工智能学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 OralGPT-Omni是一种专门用于牙科的多模态大语言模型,通过TRACE-CoT数据集和四阶段训练范式,实现了对牙科图像的高效分析和高准确率评估。

Comments 47 pages, 42 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.11561 2025-12-01 cs.CV 88%

Teaching Large Language Models to Regress Accurate Image Quality Scores using Score Distribution

利用大规模语言模型回归准确的图像质量评分使用分数分布

Zhiyuan You, Xin Cai, Jinjin Gu, Tianfan Xue, Chao Dong

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) Multimedia Laboratory, The Chinese University of Hong Kong(香港中文大学多媒体实验室) Shanghai AI Laboratory(上海人工智能实验室) Shenzhen University of Advanced Technology(深圳先进技术大学) CPII under InnoHK(创新香港下的CPII)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 本研究提出基于分布的DeQA-Score模型,通过离散化评分分布为软标签,提升图像质量评分的准确性和一致性。

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19834 2025-11-26 cs.CV 88%

Large Language Model Aided Birt-Hogg-Dube Syndrome Diagnosis with Multimodal Retrieval-Augmented Generation

基于多模态检索增强生成的大型语言模型辅助Birt-Hogg-Dube综合征诊断

Haoqing Li, Jun Shi, Xianmeng Chen, Qiwei Jia, Rui Wang, Wei Wei, Hong An, Xiaowen Hu

机构 * School of Computer Science and Technology(计算机科学与技术学院) Department of Pulmonary and Critical Care Medicine(呼吸与危重症医学科) Center for Diagnosis and Management of Rare Diseases(罕见病诊断与管理中心) the First Affiliated Hospital of USTC(USTC第一附属医院) Division of Life Sciences and Medicine(生命科学与医学系) USTC WanNan Medical College(皖南医学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 本研究提出BHD-RAG框架,通过整合多模态检索增强生成与领域专业知识,提升Birt-Hogg-Dube综合征的CT影像诊断准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02298 2025-11-25 cs.IR 88%

A Zero-shot Explainable Doctor Ranking Framework with Large Language Models

基于大语言模型的零样本可解释医生排名框架

Ziyang Zeng, Dongyuan Li, Yuqing Yang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出基于大语言模型的零样本可解释医生排名框架,通过动态生成疾病特定的排名标准和逐步推理理由,提升医生排名的透明度和可解释性,并在DrRank数据集上取得显著性能提升。

Comments Accepted by Big Data Mining and Analytics (JCR Q1)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18883 2025-11-24 cs.CV 88%

Universal Video Temporal Grounding with Generative Multi-modal Large Language Models

通用视频时间定位与生成多模态大语言模型

Zeqian Li, Shangzhe Di, Zhonghua Zhai, Weilin Huang, Yanfeng Wang, Weidi Xie

机构 * SAI, Shanghai Jiao Tong University(上海交通大学SAI实验室) ByteDance Seed(字节跳动种子)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出UniTime模型,利用生成多模态大语言模型实现通用视频时间定位,有效处理多类型视频并提升VideoQA任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏