arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-13 至 2026-01-13 共收录 362 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 87 篇

2502.18798 2026-01-13 cs.CL cs.AI 73%

Choices Speak Louder than Questions

选择胜过问题

Gyeongje Cho, Yeonkyoung So, Jaejin Lee

机构 * Graduate School of Data Science, Seoul National University(数据科学研究生院,首尔国立大学) Department of Computer Science, Seoul National University(计算机科学系,首尔国立大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出NPSQ方法,用于更准确评估大语言模型对问题的理解能力,通过实验发现传统方法易受答案选项影响,而NPSQ在修改答案选项时保持稳定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06445 2026-01-13 cs.CL cs.AI 73%

LitVISTA: A Benchmark for Narrative Orchestration in Literary Text

LitVISTA:文学文本叙事编排的基准测试

Mingzhe Lu, Yiwen Wang, Yanbing Liu, Qi You, Chong Liu, Ruize Qin, Haoyu Dong, Wenyu Zhang, Jiarui Zhang, Yue Hu, Yunpeng Li

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) University of Science and Technology of China(中国科学技术大学) University of Melbourne(墨尔本大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 LitVISTA通过结构注释的文学文本基准,评估模型在叙事编排中的能力,揭示现有模型在构建统一叙事视图方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06109 2026-01-13 cs.AI cs.LG 73%

CBMAS: Cognitive Behavioral Modeling via Activation Steering

通过激活引导的认知行为建模:CBMAS

Ahmed H. Ismail, Anthony Kuang, Ayo Akinkugbe, Kevin Zhu, Sean O'Brien

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 CBMAS通过连续激活引导技术,提升大型语言模型的认知行为可解释性,提供诊断框架和数据集以分析模型行为演变。

Comments Accepted to CogInterp @ NeurIPS 2025. Equal contribution by Ahmed H. Ismail and Anthony Kuang

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02716 2026-01-13 cs.LG cs.CL 73%

A Unified Understanding and Evaluation of Steering Methods

对引导方法的统一理解和评估

Shawn Im, Sharon Li

机构 * Department of Computer Sciences University of Wisconsin-Madison(计算机科学系 威斯康星大学麦迪逊分校)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出统一框架,分析评估引导方法,揭示其有效性并展示方法优势,为LLM中的设计优化提供指导

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22976 2026-01-13 cs.CV 71%

From Flatland to Space: Teaching Vision-Language Models to Perceive and Reason in 3D

从二维空间到三维空间:教视觉语言模型感知和推理三维世界

Jiahui Zhang, Yurui Chen, Yanpeng Zhou, Yueming Xu, Ze Huang, Jilin Mei, Junhui Chen, Yu-Jie Yuan, Xinyue Cai, Guowei Huang, Xingyue Quan, Hang Xu, Li Zhang

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 评测与基准 :language model(title)

AI总结 本文提出了一种基于2D空间数据生成和标注的管道,构建了SPAR-7M数据集和SPAR-Bench基准,通过训练和微调提升视觉语言模型在三维空间感知和推理中的性能。

Comments Project page: https://logosroboticsgroup.github.io/SPAR/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07280 2026-01-13 cs.CL 70%

ReasonTabQA: A Comprehensive Benchmark for Table Question Answering from Real World Industrial Scenarios

ReasonTabQA: 一个全面的表格问题回答基准,用于现实世界工业场景

Changzai Pan, Jie Zhang, Kaiwen Wei, Chenshuo Pan, Yu Zhao, Jingwang Huang, Jian Yang, Zhenhe Wu, Haoyang Zeng, Xiaoyan Gu, Weichao Sun, Yanbo Zhai, Yujie Mao, Zhuoru Jiang, Jiang Zhong, Shuangyong Song, Yongxiang Li, Zhongjiang He

机构 * Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究所) Chongqing University(重庆大学) Beihang University(北京航空航天大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 ReasonTabQA是一个针对现实工业场景的表格问题回答基准,通过引入TabCodeRL强化学习方法提升模型推理能力,揭示了工业级表格问答的复杂性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07274 2026-01-13 cs.CL 70%

Towards Comprehensive Semantic Speech Embeddings for Chinese Dialects

面向中文方言的全面语义语音嵌入

Kalvin Chang, Yiwen Shao, Jiahong Li, Dong Yu

机构 * Tencent AI Labs(腾讯AI实验室) Tencent(腾讯)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出通过仅使用ASR数据训练语音编码器,实现中文方言与普通话的跨方言语义对齐,并在新基准测试中展示了语音到语音检索和ASR性能的突破。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07019 2026-01-13 cs.CR cs.AI cs.SE 70%

Zer0n: An AI-Assisted Vulnerability Discovery and Blockchain-Backed Integrity Framework

Zer0n:一种结合人工智能的漏洞发现与区块链保障完整性框架

Harshil Parmar, Pushti Vyas, Prayers Khristi, Priyank Panchal

机构 * Parul University(帕鲁大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Zer0n通过结合AI与区块链技术,实现高效漏洞检测与完整性保障,达到80%的准确率并保持低开销。

Comments 10 pages, 3 figures, 7 tables. Framework for AI-Assisted Vulnerability Discovery

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06573 2026-01-13 cs.AI cs.MM 70%

QMAVIS: Long Video-Audio Understanding using Fusion of Large Multimodal Models

QMAVIS:利用大多模态模型融合实现长视频音频理解

Zixing Lin, Jiale Wang, Gee Wah Ng, Lee Onn Mak, Chan Zhi Yang Jeriel, Jun Yang Lee, Yaohao Li

机构 * National University of Singapore(新加坡国立大学) Nanyang Technological University, Singapore(南洋理工大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 QMAVIS通过融合大型多模态模型、大型语言模型和语音识别模型,实现了长视频音频理解,展示了在VideoMME数据集上38.75%的性能提升,并在其他数据集上表现出竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00333 2026-01-13 cs.CL 70%

IndicParam: Benchmark to evaluate LLMs on low-resource Indic Languages

IndicParam:评估大语言模型在低资源印度-斯瓦希里语言上的基准测试

Ayush Maheshwari, Kaushal Sharma, Vivek Patel, Aditya Maheshwari

机构 * Indian Institute of Management Indore(印度管理学院印度尔)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 IndicParam通过评估20种LLM在低资源印度-斯瓦希里语言上的表现,揭示了跨语言迁移的局限性,并为这些语言提供了挑战性的基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08728 2026-01-13 cs.CR cs.AI cs.IR 70%

Securing RAG: A Risk Assessment and Mitigation Framework

保障RAG:风险评估与缓解框架

Lukas Ammann, Sara Ott, Christoph R. Landolt, Marco P. Lehmann

机构 * Eastern Switzerland University of Applied Sciences (OST)(东瑞士应用科学大学(OST)) Cyber-Defence Campus, armasuisse Science and Technology(网络安全校园,armasuisse科技)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种结合RAG特定安全考虑与通用安全指南的框架,以保障RAG系统的安全性和可信度。

Comments 8 pages, 3 figures, Sara Ott and Lukas Ammann contributed equally. This work has been submitted to the IEEE for possible publication

Journal ref 2025 IEEE Swiss Conference on Data Science (SDS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01149 2026-01-13 cs.AI 70%

A3: Android Agent Arena for Mobile GUI Agents with Essential-State Procedural Evaluation

A3: 用于移动GUI代理的Android代理竞技场:基于本质状态的程序评估

Yuxiang Chai, Shunye Tang, Han Xiao, Weifeng Lin, Hanhao Li, Jiayu Zhang, Liang Liu, Pengxiang Zhao, Guangyi Liu, Guozhi Wang, Shuai Ren, Rongduo Han, Haining Zhang, Siyuan Huang, Hongsheng Li

机构 * Nankai University(南开大学) vivo AI Lab(vivo 人工智能实验室) SJTU(上海交通大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 A3提出了一种基于本质状态的程序评估系统,通过动态在线应用的100个任务基准和工具包,提升移动GUI代理的评估能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07186 2026-01-13 cs.RO 67%

PROTEA: Securing Robot Task Planning and Execution

PROTEA:保障机器人任务规划与执行的安全性

Zainab Altaweel, Mohaiminul Al Nahian, Jake Juettner, Adnan Siraj Rakin, Shiqi Zhang

专题命中 评测与基准 :LLM(abstract);foundation model(abstract)

AI总结 PROTEA通过LLM-as-a-Judge机制评估机器人任务计划的安全性,解决维度和历史挑战,提升任务规划系统的鲁棒性和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01592 2026-01-13 cs.CR cs.CV 67%

OpenRT: An Open-Source Red Teaming Framework for Multimodal LLMs

OpenRT: 一种用于多模态大语言模型的开源红队框架

Xin Wang, Yunhao Chen, Juncheng Li, Yixu Wang, Yang Yao, Tianle Gu, Jie Li, Yan Teng, Yingchun Wang, Xia Hu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 OpenRT框架通过模块化设计和高吞吐量运行时,系统性评估多模态大语言模型的安全性,揭示了前沿模型在复杂攻击下的脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19024 2026-01-13 cs.CV 67%

A Survey of Multimodal Hallucination Evaluation and Detection

多模态幻觉评估与检测综述

Zhiyuan Chen, Yuecong Min, Jie Zhang, Bei Yan, Jiahao Wang, Xiaozhen Wang, Shiguang Shan

机构 * State Key Laboratory of AI Safety(人工智能安全国家重点实验室) Institute of Computing Technology, Chinese Academy of Sciences (CAS)(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) Trustworthy Technology and Engineering Laboratory(可信技术与工程实验室) Huawei(华为公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文综述了多模态幻觉评估与检测方法,分析了幻觉分类、评估基准、检测技术及未来研究方向。

Comments 40 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20051 2026-01-13 cs.IR 67%

Controlled Retrieval-augmented Context Evaluation for Long-form RAG

受控检索增强上下文评估用于长形式RAG

Jia-Huei Ju, Suzan Verberne, Maarten de Rijke, Andrew Yates

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 CRUX提出了一种受控检索增强上下文评估框架,用于评估长形式RAG任务中检索增强上下文的质量和影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07392 2026-01-13 cs.LG cs.AI cs.CV 62%

OceanSAR-2: A Universal Feature Extractor for SAR Ocean Observation

OceanSAR-2:一种适用于SAR海洋观测的通用特征提取器

Alexandre Tuel, Thomas Kerdreux, Quentin Febvre, Alexis Mouche, Antoine Grouazel, Jean-Renaud Miadana, Antoine Audras, Chen Wang, Bertrand Chapron

机构 * Galeio, Paris, France(法国加利欧) LOPS, Ifremer, Plouzané, France(法国若特默尔实验室) OceanScope, Brest, France(法国海洋观测中心) Nanjing University of Information Science and Technology, Nanjing, China(中国信息科学技术大学)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 OceanSAR-2是一种基于SAR技术的通用特征提取器,通过改进的自监督学习和动态数据整理策略,在海洋观测任务中实现了高效且准确的性能表现。

Comments accepted at EUSAR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07638 2026-01-13 cs.AI 57%

SALT-KG: A Benchmark for Semantics-Aware Learning on Enterprise Tables

SALT-KG:一个面向企业表格的语义感知学习基准

Isaiah Onando Mulang, Felix Sasaki, Tassilo Klein, Jonas Kolk, Nikolay Grechanov, Johannes Hoffart

机构 * SAP SE(SAP股份有限公司)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI

AI总结 SALT-KG是一个面向企业表格的语义感知学习基准,通过链接元数据知识图与多表事务数据,评估模型在表格证据和上下文语义上推理的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07459 2026-01-13 cs.CV cs.LG 57%

Improving Video Question Answering through query-based frame selection

通过基于查询的帧选择改进视频问答

Himanshu Patil, Geo Jolly, Ramana Raja Buddala, Ganesh Ramakrishnan, Rohit Saluja

机构 * Indian Institute of Technology, Bombay(印度理工学院孟买分校) Indian Institute of Technology, Mandi(印度理工学院曼迪分校)

专题命中 评测与基准 :language model(abstract);分类 cs.LG

AI总结 通过基于查询的帧选择方法提升视频问答的准确性,利用子模ularity互信息函数选择重要帧,实验表明在多动作视频任务中准确率提升达4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07395 2026-01-13 cs.CR cs.AI 57%

MCP-ITP: An Automated Framework for Implicit Tool Poisoning in MCP

MCP-ITP:一种用于MCP中隐式工具中毒的自动化框架

Ruiqi Li, Zhiqiang Wang, Yunhao Yao, Xiang-Yang Li

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 MCP-ITP是一种用于MCP中隐式工具中毒的自动化框架,通过黑箱优化策略提升攻击成功率并规避检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07375 2026-01-13 cs.CL 57%

GROKE: Vision-Free Navigation Instruction Evaluation via Graph Reasoning on OpenStreetMap

GROKE: 通过OpenStreetMap上的图推理进行无视觉导航指令评估

Farzad Shami, Subhrasankha Dey, Nico Van de Weghe, Henrikki Tenkanen

机构 * Aalto University(阿alto大学) Ghent University(根特大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

AI总结 GROKE提出一种基于OpenStreetMap的无视觉导航指令评估框架,通过图推理和拓扑导航提升评估精度与可扩展性。

Comments Under Review for ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07312 2026-01-13 cs.CL 57%

PsyCLIENT: Client Simulation via Conversational Trajectory Modeling for Trainee Practice and Model Evaluation in Mental Health Counseling

PsyCLIENT: 通过对话轨迹建模实现客户端模拟,用于心理健康辅导培训和模型评估

Huachuan Qiu, Zhaoming Chen, Yuqian Chen, Yuan Xie, Yu Lu, Zhenzhong Lan

机构 * Westlake University(西湖大学) The University of Utah(犹他大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

AI总结 PsyCLIENT通过对话轨迹建模实现客户端模拟,提供首个中文开放数据集,显著提升辅导培训和模型评估的真实性和有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06039 2026-01-13 cs.CL 57%

Operation Veja: Fixing Fundamental Concepts Missing from Modern Roleplaying Training Paradigms

Operation Veja: 修复现代角色扮演训练范式中缺失的根本概念

Yueze Liu, Ajay Nagi Reddy Kumdam, Ronit Kanjilal, Hao Yang, Yichi Zhang

机构 * Divergence 2% LLC Department of Electrical and Computer Engineering University of Illinois Urbana-Champaign(电气与计算机工程系伊利诺伊大学厄巴纳-香槟分校) Department of Computer Science University of Illinois Urbana-Champaign(计算机科学系伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

AI总结 Operation Veja提出VEJA框架,通过整合价值观、经历、判断和能力,改进角色扮演模型的数据整理方法,以提升角色真实性和叙述连续性。

Comments Accepted to NeurIPS 2025 PeronaLLM workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06027 2026-01-13 cs.HC cs.AI cs.CE cs.IR cs.PL 57%

AI-Assisted Authoring for Transparent, Data-Driven Documents

辅助作者生成透明、数据驱动的文档

Alfonso Piscitelli, Cristina David, Mattia De Rosa, Ali Mohammed, Federico Nanni, Jacob Pake, Roly Perera, Jessy Sodimu, Chenyiqiu Zheng

机构 * University of Salerno(萨勒诺大学) University of Bristol(布里斯托大学) Manchester Metropolitan University(曼彻斯特 Metropolitan 大学) The Alan Turing Institute(艾伦·图灵研究所) University of Kent(肯特大学) University of Cambridge(剑桥大学) University of Bath(巴斯大学) University College London(伦敦大学学院)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 本文提出了一种基于大语言模型的工具,用于生成透明、数据驱动的文档,通过交互式数据溯源技术增强学术文章的可验证性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17298 2026-01-13 cs.LG stat.ML 57%

SAVeD: Semantic Aware Version Discovery

SAVeD: 语义感知版本发现

Artem Frenk, Roee Shraga

机构 * Worcester Polytechnic Institute(沃斯特理工大学)

专题命中 评测与基准 :post-training(abstract);分类 cs.LG

AI总结 SAVeD通过对比学习框架实现结构化数据集版本的语义感知检测,显著提升未见表格的准确率和分离度。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03310 2026-01-13 cs.AI cs.SE 57%

app.build: A Production Framework for Scaling Agentic Prompt-to-App Generation with Environment Scaffolding

app.build:一种用于扩展基于代理的提示到应用程序生成的生产框架

Evgenii Kniazev, Arseny Kravchenko, Igor Rekun, James Broadhead, Nikita Shamgunov, Pranav Sah, Pratik Nichite, Ivan Yamshchikov

机构 * Databricks THWS University of Applied Sciences Würzburg-Schweinfurt (CAIRO)(THWS应用科学大学沃尔夫斯堡-施维林(CAIRO))

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 app.build通过结构化环境和系统验证提升基于代理的应用程序生成效率,实现高可行性与质量,为生产级代理系统提供参考实现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07812 2026-01-13 cs.CV 50%

More Images, More Problems? A Controlled Analysis of VLM Failure Modes

更多图像,更多问题?对VLV失败模式的受控分析

Anurag Das, Adrian Bulat, Alberto Baldrati, Ioannis Maniadis Metaxas, Bernt Schiele, Georgios Tzimiropoulos, Brais Martinez

机构 * MPI for Informatics Saarland Informatics Campus(马克斯·普朗克研究所(信息学)萨尔兰信息学校区) Samsung AI Cambridge(三星人工智能(剑桥)) Technical University of Iași Romania(罗文扎大学(罗马尼亚)) Queen Mary University of London UK(伦敦女王大学(英国))

专题命中 评测与基准 :language model(abstract)

AI总结 MIMIC基准通过诊断实验揭示LVLM在多图像任务中的失败模式,并提出数据生成和注意力遮罩方案以提升跨图像信息聚合能力。

Comments 19 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07064 2026-01-13 eess.AS 50%

Bridging Attribution and Open-Set Detection using Graph-Augmented Instance Learning in Synthetic Speech

通过图增强的实例学习桥接归因与开放集检测在合成语音中

Mohd Mujtaba Akhtar, Girish, Farhan Sheth, Muskaan Singh

专题命中 评测与基准 :foundation model(abstract)

AI总结 SIGNAL通过结合图神经网络和开放集检测方法,实现了合成语音来源的归因与开放集检测的统一。

Comments Accepted to EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07014 2026-01-13 eess.AS cs.SD 50%

DIVINE: Coordinating Multimodal Disentangled Representations for Oro-Facial Neurological Disorder Assessment

DIVINE:协调多模态解耦表示以评估口面部神经系统疾病

Mohd Mujtaba Akhtar, Girish, Muskaan Singh

机构 * Veer Bahadur Singh Purvanchal University(韦尔·巴哈杜尔·辛格·普瓦兰恰尔大学) UPES(UPES大学) Ulster University(乌斯特大学)

专题命中 评测与基准 :foundation model(abstract)

AI总结 DIVINE通过多模态解耦和多任务学习,实现对口面部神经系统疾病的高精度评估,达到98.26%的准确率。

Comments Accepted to EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06198 2026-01-13 cs.CV 50%

How Does India Cook Biryani?

印度是如何烹饪饭团的?

Shubham Goel, Farzana S, C V Rishi, Aditya Arun, C V Jawahar

机构 * IIIT Hyderabad

专题命中 评测与基准 :language model(abstract)

AI总结 本文提出首个大规模饭团制作视频数据集及多阶段框架,用于研究烹饪视频中细粒度步骤差异及文化关联性。

详情

展开后加载摘要…

URL PDF HTML 收藏