arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-21 至 2026-01-21 共收录 543 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 145 篇

2601.10369 2026-01-21 cs.CV 67%

Fine-Grained Human Pose Editing Assessment via Layer-Selective MLLMs

通过层选择性MLLMs实现细粒度人体姿态编辑评估

Ningyu Sun, Zhaolin Cai, Zitong Xu, Peihang Chen, Huiyu Duan, Yichao Yan, Xiongkuo Min, Xiaokang Yang

机构 * Institute of Image Communication and Network Engineering, Shanghai Jiao Tong University(图像通信与网络工程研究所,上海交通大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出HPE-Bench基准和基于层选择性MLLMs的统一框架,用于细粒度评估人体姿态编辑的真实性和质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11637 2026-01-21 cs.CV 67%

Evaluating Self-Correcting Vision Agents Through Quantitative and Qualitative Metrics

通过定量和定性指标评估自我纠正的视觉代理

Aradhya Dixit

机构 * The Thørväld Group(Thørväld集团) Inria Paris-Rocquencourt(巴黎-罗克琴堡Inria) Rajiv Gandhi University Doimukh(拉贾·甘地大学多伊穆克) Tsinghua University(清华大学) Palmer Research Laboratories(帕勒姆研究实验室) The Kumquat Consortium(昆夸特联盟)

专题命中 评测与基准 :foundation model(abstract);language agent(abstract)

AI总结 本文提出诊断微基准测试,通过量化和定性指标评估视觉代理的自我纠正能力,揭示语义漂移是主要瓶颈,并定义可重复的框架以提升多模态代理的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11576 2026-01-21 cs.CY 67%

What Can Student-AI Dialogues Tell Us About Students' Self-Regulated Learning? An exploratory framework

学生-人工智能对话能告诉我们什么?关于学生自主学习能力的探索性框架

Long Zhang, Fangwei Lin, Weilin Wang

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本研究通过分析学生与AI对话日志,提出DHASRL框架,揭示主动对话模式与自主学习能力正相关,而反应性模式则负相关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09949 2026-01-21 cs.CV 67%

UVE: Are MLLMs Unified Evaluators for AI-Generated Videos?

UVE: MLLMs是否能作为AI生成视频的统一评估器?

Yuanxin Liu, Rui Zhu, Shuhuai Ren, Jiacong Wang, Haoyuan Guo, Xu Sun, Lu Jiang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机科学学院,北京大学) ByteDance Seed(字节跳动种子) School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文探讨使用多模态大语言模型作为AI生成视频的统一评估器的可行性,并通过UVE-Bench基准测试评估了18种MLLMs的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14084 2026-01-21 cs.CV cs.AI cs.CL 62%

DermaBench: A Clinician-Annotated Benchmark Dataset for Dermatology Visual Question Answering and Reasoning

DermaBench:一种用于皮肤科视觉问答和推理的临床标注基准数据集

Abdurrahim Yilmaz, Ozan Erdem, Ece Gokyayla, Ayda Acar, Burc Bugra Dagtas, Dilara Ilhan Erdil, Gulsum Gencoglan, Burak Temelkuran

机构 * Imperial College London(帝国理工学院伦敦分校) Istanbul Medeniyet University(伊斯坦布尔医学大学) Usak Research and Training Hospital(Usak研究与培训医院) Istanbul Research and Training Hospital(伊斯坦布尔研究与培训医院) Ipswich Hospital(伊普斯韦奇医院) Medicana Atakoy Hospital(Medicana阿塔基医院)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

AI总结 DermaBench是首个由临床专家标注的皮肤科视觉问答基准数据集,通过精细标注和开放式描述提升多模态模型在皮肤科图像理解与临床推理中的评估能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13398 2026-01-21 cs.LG cs.AI cs.PL 62%

Can LLMs Compress (and Decompress)? Evaluating Code Understanding and Execution via Invertibility

LLMs能否压缩(和解压)?通过可逆性评估代码理解和执行

Nickil Maveli, Antonio Vergari, Shay B. Cohen

机构 * School of Informatics, University of Edinburgh(爱丁堡大学信息学院)

专题命中 评测与基准 :prompting(abstract);分类 cs.AI、cs.LG

AI总结 本文通过RTCE基准评估LLMs在代码理解和执行中的回程一致性,发现现有模型在保持一致推理方面存在不足,揭示了新的研究洞察。

Comments 32 pages (preprint)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13251 2026-01-21 cs.CL cs.LG 62%

Beyond Cosine Similarity: Taming Semantic Drift and Antonym Intrusion in a 15-Million Node Turkish Synonym Graph

超越余弦相似度:在1500万个节点的土耳其同义词图中驯服语义漂移和反义入侵

Ebubekir Tosun, Mehmet Emin Buldur, Özay Ezerceli, Mahmoud ElHussieni

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.LG

AI总结 本文提出了一种基于三元语义关系判别器和软到硬聚类算法的语义聚类系统,有效解决同义词与反义词区分问题,提升语义检索精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12109 2026-01-21 cs.CL cs.AI 62%

Generative Personality Simulation via Theory-Informed Structured Interview

通过理论指导的结构化访谈生成人格模拟

Pengda Wang, Huiqi Zou, Han Jiang, Hanjie Chen, Tianjun Sun, Xiaoyuan Yi, Ziang Xiao, Frederick L. Oswald

机构 * Department of Psychological Sciences & 2 Department of Computer Science, Rice University(1 心理学系 & 2 计算机科学系,莱斯大学) Department of Electrical and Computer Engineering, Northeastern University(3 电气与计算机工程系,东北大学) Department of Computer Science, Johns Hopkins University(4 计算机科学系,约翰霍普金斯大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过理论指导的结构化访谈提升LLM生成的人格数据异质性,结合心理测量理论改进模拟保真度,并预测人格相关行为结果。

Comments Accepted at EACL 2026; 87 Pages, 68 Tables, 10 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13075 2026-01-21 cs.LG cs.AI 62%

METIS: Mentoring Engine for Thoughtful Inquiry & Solutions

METIS:面向深入探究与解决方案的导师引擎

Abhinav Rajeev Kumar, Dhruv Trehan, Paras Chopra

专题命中 评测与基准 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 METIS通过工具增强和阶段意识功能,帮助本科生从想法发展到论文,优于GPT-5和Claude Sonnet 4.5,在文档基础阶段表现更佳。

Comments 12 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16544 2026-01-21 cs.CL cs.AI 62%

WER is Unaware: Assessing How ASR Errors Distort Clinical Understanding in Patient Facing Dialogue

WER是无意识的:评估ASR错误如何扭曲患者面对对话中的临床理解

Zachary Ellis, Jared Joselowitz, Yash Deo, Yajie He, Anna Kalygina, Aisling Higham, Mana Rahimzadeh, Yan Jia, Ibrahim Habli, Ernest Lim

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过LLM作为判断者评估ASR错误的临床影响,发现WER等指标与临床风险标签相关性低,引入优化的LLM模型提升评估准确性。

Comments Published as an Oral at IWSDS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11164 2026-01-21 cs.CV cs.AI cs.LG 62%

Synthetic Geology: Structural Geology Meets Deep Learning

合成地质学:构造地质学与深度学习的交汇

Simon Ghyselincks, Valeriia Okhmak, Stefano Zampini, George Turkiyyah, David Keyes, Eldad Haber

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 StructuralGeo通过模拟地质过程生成合成数据,结合深度学习模型实现对地下结构的概率重建与正则化。

Comments Accepted for publication in Journal of Geophysical Research: Machine Learning and Computation (2026). 16 pages, 9 figures, geological simulation code at https://doi.org/10.5281/zenodo.15244035, generative AI code at https://github.com/chipnbits/flowtrain_stochastic_interpolation/releases/tag/v1.0.2

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12691 2026-01-21 cs.AI cs.LG 62%

Benchmarking Deception Probes via Black-to-White Performance Boosts

通过黑盒到白盒性能提升评估欺骗探测器

Avi Parrack, Carlo Leonardo Attubato, Stefan Heimersheim

机构 * UCLA(加州大学洛杉矶分校) Pivotal(Pivotal公司) Apollo Research(Apollo研究所)

专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文评估了欺骗探测器在白盒监控与黑盒监控之间的性能差异,发现现有探测器在黑盒到白盒的性能提升较为有限但具有积极效果。

Comments Preprint. 39 pages, 11 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13575 2026-01-21 cs.CL 57%

Comparing Without Saying: A Dataset and Benchmark for Implicit Comparative Opinion Mining from Same-User Reviews

无需言说的比较:来自同一用户评论的隐式比较意见挖掘数据集和基准

Thanh-Lam T. Nguyen, Ngoc-Quang Le, Quoc-Trung Phu, Thi-Phuong Le, Ngoc-Huyen Pham, Phuong-Nguyen Nguyen, Hoang-Quynh Le

机构 * VNU University of Engineering and Technology(越南工程大学) Singapore Management University(新加坡管理大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 SUDO数据集通过隐式比较意见挖掘任务,评估了从同一用户评论中推断偏好的挑战与方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13401 2026-01-21 cs.CV cs.AI 57%

Reasoning with Pixel-level Precision: QVLM Architecture and SQuID Dataset for Quantitative Geospatial Analytics

基于像素级精度的推理:QVLM架构与SQuID数据集用于定量遥感分析

Peter A. Massih, Eric Cosatto

机构 * Department of Machine Learning, NEC Laboratories America(机器学习系,NEC美国实验室)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 本文提出QVLM架构和SQuID数据集,通过解耦语言理解和视觉分析,提升定量空间推理的准确性。

Comments Submitted to CVPR 2026. Introduces the QVLM architecture and the SQuID dataset for quantitative geospatial reasoning. Dataset DOI: 10.57967/hf/7565

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13385 2026-01-21 cs.CV cs.AI 57%

Organ-Aware Attention Improves CT Triage and Classification

器官感知注意力提升CT分诊与分类

Lavsen Dahal, Yubraj Bhandari, Geoffrey D. Rubin, Joseph Y. Lo

机构 * Duke University(杜克大学) University of Arizona(亚利桑那大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 ORACLE-CT通过器官感知注意力和标量融合方法,在胸部和腹部CT分诊中实现最先进的分类性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06747 2026-01-21 cs.AI 57%

FinForge: Semi-Synthetic Financial Benchmark Generation

FinForge:半合成金融基准生成

Glenn Matlin, Akhil Theerthala, Anant Gupta, Anirudh JM, Rayan Castilla, Yi Mei Ng, Sudheer Chava

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 FinForge通过半合成方法生成金融领域基准,评估模型在金融推理中的性能,揭示模型在金融领域的表现差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20926 2026-01-21 cs.CL 57%

FicSim: A Dataset for Multi-Faceted Semantic Similarity in Long-Form Fiction

FicSim:一个多维度语义相似性数据集用于长篇小说

Natasha Johnson, Amanda Bertsch, Maria-Emil Deal, Emma Strubell

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 FicSim 是一个用于长篇小说多维度语义相似性评估的数据集,通过作者元数据和数字人文学者验证,评估了多种嵌入模型在表面特征与语义类别上的表现。

Comments Published in Findings of EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23292 2026-01-21 cs.CV cs.AI 57%

Federated Unsupervised Semantic Segmentation

联邦无监督语义分割

Evangelos Charalampakis, Vasileios Mygdalis, Ioannis Pitas

机构 * Department of Informatics, Aristotle University of Thessaloniki(信息学院,阿基米德大学)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI

AI总结 本文提出FUSS框架,通过联邦学习实现去中心化无监督语义分割,优于传统方法和本地训练。

Comments Accepted for publication in Neurocomputing

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13183 2026-01-21 cs.CL 57%

OpenExempt: A Diagnostic Benchmark for Legal Reasoning and a Framework for Creating Custom Benchmarks on Demand

OpenExempt:法律推理的诊断基准及自定义基准框架

Sergio Servantez, Sarah B. Lawsky, Rajiv Jain, Daniel W. Linna, Kristian Hammond

机构 * Northwestern University(西北大学) Adobe Research(Adobe研究) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 OpenExempt通过动态生成法律推理任务和解决方案,提供一个用于诊断评估的基准和框架,揭示模型在复杂推理中的性能差异。

Comments 25 pages, 9 Figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19423 2026-01-21 cs.AI 57%

ETOM: A Five-Level Benchmark for Evaluating Tool Orchestration within the MCP Ecosystem

ETOM:一种用于评估MCP生态系统内工具编排的五级基准

Jia-Kai Dong, I-Wei Huang, Chun-Tin Wu, Yi-Tien Tsai

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 ETOM提出了一种五级基准,用于评估LLM代理在MCP生态系统中进行多跳工具编排的能力,通过构建等效功能集提供客观指标,揭示代理在鲁棒性和复杂任务中的系统性弱点。

Comments Accepted to the Findings of EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12075 2026-01-21 cs.CL 57%

To Copy or Not to Copy: Copying Is Easier to Induce Than Recall

复制还是不复制:复制比回忆更容易引发

Mehrdad Farahani, Franziska Penzkofer, Richard Johansson

机构 * Chalmers University of Technology(查尔姆斯理工大学) University of Gothenburg(哥德堡大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 本文研究了语言模型在检索增强设置中如何在参数化知识与上下文信息之间进行权衡,通过机制分析揭示诱导复制比恢复回忆更容易。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11526 2026-01-21 cs.HC cs.AI 57%

Chatsparent: An Interactive System for Detecting and Mitigating Cognitive Fatigue in LLMs

Chatsparent: 一个用于检测和缓解大语言模型认知疲劳的交互系统

Riju Marwah, Vishal Pallagani, Ritvik Garimella, Amit Sheth

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 Chatsparent通过实时监测和缓解大语言模型的认知疲劳,提升交互体验和模型可靠性。

Comments Accepted to AAAI 2026 Demonstration Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04114 2026-01-21 cs.CV cs.AI cs.RO 57%

Thermal and RGB Images Work Better Together in Wind Turbine Damage Detection

热成像与RGB图像在风力发电机损伤检测中效果更佳

Serhii Svystun, Oleksandr Melnychenko, Pavlo Radiuk, Oleg Savenko, Anatoliy Sachenko, Andrii Lysyi

专题命中 评测与基准 :prompting(abstract);分类 cs.AI

AI总结 本研究通过整合热成像与RGB图像,提升风力发电机叶片缺陷检测的准确性和效率。

Comments Unmanned aerial vehicle, image composition, multispectral images, green energy, data quality management, weighted overlay

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14227 2026-01-21 cs.SD 50%

Transformer Architectures for Respiratory Sound Analysis and Multimodal Diagnosis

用于呼吸声分析和多模态诊断的Transformer架构

Theodore Aptekarev, Vladimir Sokolovsky, Gregory Furman

机构 * Ben Gurion University of the Negev(本· Gurion 农业大学)

专题命中 评测与基准 :language model(abstract)

AI总结 本文提出基于Transformer的AST和VLM模型,用于呼吸声分析和多模态诊断,AST在哮喘检测中达到97%准确率,VLM整合临床信息提升诊断能力。

Comments 7 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14221 2026-01-21 cs.SI 50%

Beyond Polarization: Opinion Mixing and Social Influence in Deliberation

超越极化:在讨论中意见混合与社会影响

Mohak Goyal, Lodewijk Gelauff, Naman Gupta, Ashish Goel, Kamesh Munagala

专题命中 评测与基准 :LLM(abstract)

AI总结 研究探讨了讨论过程中意见混合与社会影响,发现讨论增加了意见混合,而极化指标呈现异质性,且论证质量影响意见变化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13974 2026-01-21 cs.CV 50%

STEC: A Reference-Free Spatio-Temporal Entropy Coverage Metric for Evaluating Sampled Video Frames

STEC:一种无参考的时空熵覆盖度量,用于评估采样视频帧

Shih-Yao Lin

机构 * Independent Researcher(独立研究者)

专题命中 评测与基准 :language model(abstract)

AI总结 STEC是一种无参考的时空熵覆盖度量,用于评估视频帧采样的有效性,通过联合建模空间信息强度、时间分散性和非冗余性,提供一种轻量且原则性的采样质量度量。

Comments This paper corresponds to the camera-ready version of a WACV 2026 Workshop paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13871 2026-01-21 cs.CV 50%

OCCAM: Class-Agnostic, Training-Free, Prior-Free and Multi-Class Object Counting

OCCAM: 无训练、无先验、多类别的对象计数

Michail Spanakis, Iason Oikonomidis, Antonis Argyros

机构 * Computer Science Department, University of Crete(塞萨洛尼基大学计算机科学系) Institute of Computer Science (ICS), Foundation for Research & Technology – Hellas (FORTH)(希腊基础研究与技术研究所计算机科学研究所)

专题命中 评测与基准 :foundation model(abstract)

AI总结 OCCAM提出了一种无需训练和先验信息的多类对象计数方法,利用SAM2和FINCH算法在FSC-147和CARPK数据集上实现高性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13801 2026-01-21 cs.RO 50%

HoverAI: An Embodied Aerial Agent for Natural Human-Drone Interaction

HoverAI: 一种用于自然人-无人机交互的具身空中代理

Yuhua Jin, Nikita Kuzmin, Georgii Demianchuk, Mariya Lezina, Fawad Mehboob, Issatay Tokmurziyev, Miguel Altamirano Cabrera, Muhammad Ahsan Mustafa, Dzmitry Tsetserukou

机构 * Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Skolkovo Institute of Science and Technology(斯克尔科沃信息科技研究所)

专题命中 评测与基准 :LLM(abstract)

AI总结 HoverAI通过结合无人机移动、视觉投影和对话式AI,实现了人-无人机自然交互的具身代理,提升了空间感知与社交响应能力。

Comments This paper has been accepted for publication at LBR HRI 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13758 2026-01-21 cs.SD 50%

GOMPSNR: Reflourish the Signal-to-Noise Ratio Metric for Audio Generation Tasks

GOMPSNR:为音频生成任务复兴信号噪声比度量

Lingling Dai, Andong Li, Cheng Chi, Yifan Liang, Xiaodong Li, Chengshi Zheng

专题命中 评测与基准 :prompting(abstract)

AI总结 本文提出GOMPSNR,通过引入相位距离项改进SNR,提升音频生成任务中客观度量的可靠性,并通过两种新型损失函数优化模型性能。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13539 2026-01-21 cs.SD 50%

LongSpeech: A Scalable Benchmark for Transcription, Translation and Understanding in Long Speech

LongSpeech: 一种可扩展的基准,用于长语音的转录、翻译和理解

Fei Yang, Xuanfan Ni, Renyi Yang, Jiahui Geng, Qing Li, Chenyang Lyu, Yichao Du, Longyue Wang, Weihua Luo, Kaifu Zhang

机构 * Alibaba International Digital Commerce(阿里巴巴国际数字商务) Shanghai Jiao Tong University(上海交通大学) Delft University of Technology(代尔夫特理工大学) Linköping University(林肯大学) University of Groningen(格罗宁根大学)

专题命中 评测与基准 :language model(abstract)

AI总结 LongSpeech是一个大规模可扩展的语音基准,旨在评估和推动语音模型在长音频转录、翻译和理解上的能力,揭示了现有模型在多任务和高阶推理上的不足。

Comments ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏