arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-23 至 2026-06-23 共收录 766 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 164 篇

2606.23583 2026-06-23 cs.CL 新提交 79%

Evaluation Awareness Is Not One Capability: Evidence from Open Language Models

评估意识并非单一能力:来自开放语言模型的证据

Nilesh Nayan, Aishwarya Sampath Kumar, Rishiraj Girmal, Shivani Anilkumar, Sankaran Vaidyanathan, David A. Nader Palacio, Reshmi Ghosh, Soundararajan Srinivasan

机构 * University of Massachusetts, Amherst(马萨诸塞大学阿默斯特分校) Microsoft Corp.(微软公司)

专题命中 评测与基准 :language model(title);instruction tuning(abstract);分类 cs.CL

AI总结 通过37个开放权重模型实验,发现语言模型对评估线索的检测、行为变化和表征可控性三个维度弱耦合,表明评估意识是多维的,单一分数无法可靠预测部署安全。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22188 2026-06-23 cs.LG 新提交 79%

Bayesian Adaptation Gym: A Benchmark for the Bayesian Low-Rank Adaptation of Multi-Modal Language Models

贝叶斯适应健身房:多模态语言模型贝叶斯低秩适应的基准

Colin Samplawski, Ramneet Kaur, Manoj Acharya, Anirban Roy, Adam D. Cobb

机构 * Neuro-Symbolic Computing and Intelligence Research Group(神经符号计算与智能研究组) Computer Science Laboratory(计算机科学实验室) SRI International(SRI国际)

专题命中 评测与基准 :language model(title,abstract);分类 cs.LG

AI总结 提出贝叶斯适应健身房(BAG)基准,用于评估多模态语言模型的贝叶斯低秩适应方法,涵盖校准、分布偏移鲁棒性和主动学习下的不确定性决策。

Comments Oral Paper at UAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22181 2026-06-23 cs.LG 新提交 79%

Residue-Level Attributions in Protein Language Models Do Not Recover Allergen Epitopes

蛋白质语言模型中的残基级归因不能恢复过敏原表位

Jianzhou Yao, Anxiong Song, Katja Baerenfaller, Damir Zhakparov

机构 * Swiss Institute of Allergy and Asthma Research, Davos, Switzerland(瑞士过敏与哮喘研究所,达沃斯,瑞士) ETH Zurich, Zurich, Switzerland(苏黎世联邦理工学院,苏黎世,瑞士) Swiss Institute of Bioinformatics, Lausanne, Switzerland(瑞士生物信息学研究所,洛桑,瑞士)

专题命中 评测与基准 :language model(title,abstract);分类 cs.LG

AI总结 本研究通过引入表位基准,评估蛋白质过敏原性模型的可解释性,发现分类器残基级归因与注释表位对齐不显著,模型可能依赖理化特征而非表位特异性机制。

Comments Accepted at the ICML 2026 Mechanistic Interpretability Workshop (peer-reviewed)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22166 2026-06-23 cs.DL cs.AI cs.LG 新提交 79%

Rebuttals Move Peer-Review Scores, but Initial-Review Structure Bounds the Movement

反驳会改变同行评审分数,但初始评审结构限制了变化幅度

Mathieu Louis, Tibo Vanleke, Vincent Ginis, Andres Algaba

机构 * Data Analytics Lab, Vrije Universiteit Brussel(自由大学布鲁塞尔数据分析实验室) imec-SMIT, Vrije Universiteit Brussel(imec-SMIT,自由大学布鲁塞尔) School of Engineering and Applied Sciences, Harvard University(哈佛大学工程与应用科学学院)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);分类 cs.AI、cs.LG

AI总结 利用ICLR 2024-2025的73,000条评审轨迹,结合LLM分析,发现反驳能改变分数,但初始评审结构已预测大部分变化,且可测量的交换信号多为反驳失败模式。

Comments 26 pages, 7 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09178 2026-06-23 cs.CL cs.AI 新提交 79%

Culturally-Adapted Red-Teaming Across East and Southeast Asian Contexts: A Methodological and Comparative Analysis

跨东亚和东南亚语境的文化适应红队测试:方法论与比较分析

Hyeji Choi, Yongtaek Lim, Minwoo Kim

机构 * University of California, Berkeley(加州大学伯克利分校) Korea Advanced Institute of Science and Technology(韩国科学技术院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对大语言模型的多语言安全评估,通过构建直接翻译与文化适应数据集,发现文化适应提示的攻击成功率平均提升9.3个百分点,直接翻译低估风险,且文化深度评分显著低于文化适应版本,表明适应文化语境对有效评估至关重要。

Comments Accepted to ICML 2026 Workshop on Culture X AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06676 2026-06-23 cs.CL cs.AI cs.HC 版本更新 79%

One Interaction Is Worth a Thousand Guesses: Benchmarking the Interactive Capabilities of Deep Research Agents

一次交互胜过千次猜测:深度研究代理的交互能力基准测试

Yingchaojie Feng, Qiang Huang, Xiaoya Xie, Zhaorui Yang, Jun Yu, Wei Chen, Anthony K. H. Tung

机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院) School of Intelligence Science and Engineering, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)智能科学与工程学院) Zhejiang University(浙江大学) State Key Lab of CAD&CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室)

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出IDRBench基准,通过交互式框架和用户模拟器评估深度研究代理的交互能力,实验表明交互能提升研究质量和鲁棒性。

Comments 17 pages, 9 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23139 2026-06-23 eess.AS 新提交 78%

Audio Editing in the Era of Foundation Models: A Survey

基础模型时代的音频编辑:综述

Changhao Pan, Yifei Fan, Fan Zhuo, Yifu Chen, Wenxiang Guo, Yu Zhang, Ruiqi Li, Zhiyuan Zhu, Rui Yang, Shengpeng Ji, Chenyuhao Wen, Jiayang Xu, Ke Lei, Xiaoda Yang, Jingyu Lu, Zhou Zhao

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 本文综述了基础模型时代音频编辑的研究进展,提出了统一的任务分类法,总结了基于训练和免训练的编辑范式,并讨论了数据集、评估协议等资源及未来方向。

Comments 23 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21861 2026-06-23 cs.CV 新提交 78%

Zero-Shot Vision-Language Models for Classroom Engagement Recognition: A Benchmark Study of Prompt Sensitivity and Cross-Dataset Generalization

零样本视觉语言模型用于课堂投入度识别:提示敏感性与跨数据集泛化的基准研究

Aman Goyal, Kshama Nitin Shah, Kemmannu Vineet Venkatesh Rao

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Michigan, Ann Arbor(密歇根大学安娜堡分校) Magna International(麦格纳国际)

专题命中 评测与基准 :language model(title,abstract)

AI总结 本研究系统评估五种视觉语言模型在零样本条件下识别课堂投入度的表现,发现三个主要失败模式:个体学生识别近乎随机、类别崩溃和极端提示敏感性,但场景级分类效果较好。

Comments 11 pages, 6 figures, including supplementary material. Presented as a non-archival paper at the CV4Edu Workshop, CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21787 2026-06-23 cs.SE 新提交 78%

Towards Imputation of Pre-Trained Language Model Metadata using Semantic Fingerprinting

基于语义指纹的预训练语言模型元数据插补方法

Adekunle Ajibode, Oussama Ben Sghaier, Keheliya Gallaba, Bram Adams, Ahmed E. Hassan

专题命中 评测与基准 :language model(title,abstract)

AI总结 提出语义指纹(SemFin)方法,利用Hugging Face配置文件和仓库标签自动插补缺失的PTLM元数据并重建模型谱系,在317,133个模型上相比基线提升预测准确率最高31.4%,并成功处理16.6%的孤立模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22793 2026-06-23 cs.AI 新提交 77%

A Formula-Driven Survey and Research Agenda for On-Policy Distillation

基于公式驱动的在线策略蒸馏综述与研究议程

Bowen Zhang

机构 * Tsinghua University(清华大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);post-training(abstract);分类 cs.AI

AI总结 本文提出一种公式驱动的分类法,将在线策略蒸馏(OPD)视为反馈到更新的问题,区分直接分布损失和策略梯度式对数比更新,并揭示状态兼容性、支持构建、时间信用、词汇路由等关键因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22442 2026-06-23 cs.AI 新提交 77%

Efficient Multimodal Clinical Question Answering for Pulmonary Embolism Risk Assessment

用于肺栓塞风险评估的高效多模态临床问答

Xiangyuan Xue, Yang Yu, Yan Gao, Junyan Wang, Bin Chen, Lingyan Ruan, Ting Dang, Hong Jia

机构 * University of Auckland(奥克兰大学) University of Cambridge(剑桥大学) University of Adelaide(阿德莱德大学) University of Melbourne(墨尔本大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI

AI总结 本研究构建了基于INSPECT数据集的肺栓塞多模态基准,通过结构化问答任务评估高效多模态大模型在CTPA和EHR输入下的诊断与预后性能,发现Gemma4模型在结合CTPA+EHR时表现更优,且诊断任务优于预后任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00710 2026-06-23 cs.AI 版本更新 77%

Learning More from Less: Unlocking Internal Representations for Benchmark Compression

从更少中学习更多:解锁内部表示以实现基准压缩

Yueqi Zhang, Jin Hu, Shaoxiong Feng, Peiwen Yuan, Xinglin Wang, Yiwei Li, Jiayi Shi, Chuyi Tan, Ji Zhang, Boyuan Pan, Yao Hu, Kan Li

机构 * School of Computer Science, Beijing Institute of Technology(北京理工大学计算机科学学院)

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出RepCore方法,通过对齐异构隐藏状态构建代表性核心集,仅需少量源模型即可精确估计大语言模型在完整基准上的性能,显著优于基于输出的基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15378 2026-06-23 cs.CL 版本更新 77%

AlgoSimBench: Identifying Algorithmically Similar Problems for Competitive Programming

AlgoSimBench: 识别算法相似问题的竞赛编程基准

Jierui Li, Raymond Mooney

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出AlgoSimBench基准,通过对抗性设计的多选题评估大语言模型识别算法相似问题的能力,并引入尝试解决方案匹配方法提升准确率。

Comments 14 pages, accepted to IJCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22000 2026-06-23 cs.AI cs.CL cs.LG cs.SE 新提交 75%

CFAgentBench: A Reproducible Environment and Benchmark for Autonomous Construction-Finance Agents

CFAgentBench:面向自主建筑金融智能体的可复现环境与基准测试

Rishi Srivastava

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出CFAgentBench,一个可复现的建筑金融智能体基准,包含1014个任务、35个模拟应用,通过功能正确性评分,强调资金流动防护,实验表明单次准确率高估了部署能力。

Comments 28 pages, 2 figures, 13 tables. Benchmark, environment spec, and app contract released. First open-weight three-model sweep (k=5) on a 40-task oracle-validated executable suite; frontier-model leaderboard committed in the roadmap

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21810 2026-06-23 cs.SE 新提交 75%

GitReq: A Gold Standard Dataset for Software Quality Requirements

GitReq:软件质量需求的金标准数据集

Farha Kamal, Md Humaun Kabir, Md Rakibul Islam

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出GitReq数据集,包含6302条专家验证的软件质量需求,覆盖8个ISO/IEC 25010:2011质量类别,通过三重信号挖掘和人工标注构建,零样本评估GPT-5.2达到最高宏平均F1为0.641。

Comments Accepted at The 24th IEEE/ACIS International Conference on Software Engineering Research, Management and Applications

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16584 2026-06-23 cs.CL cs.AI cs.LG 版本更新 75%

Measuring Intent Comprehension in LLMs

测量LLMs中的意图理解

Nadav Kunievsky, James A. Evans

机构 * Knowlesdge Lab, University of Chicago, Chicago, Illinois, USA(知识实验室,芝加哥大学,芝加哥,伊利诺伊州,美国) Knowledge Lab, Data Science Institute, Department of Sociology, University of Chicago, Chicago, Illinois, USA(知识实验室,数据科学学院,社会学系,芝加哥大学,芝加哥,伊利诺伊州,美国)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出一个形式化框架,通过方差分解评估LLMs对用户意图的理解能力,发现更大模型通常将更多输出方差归因于意图差异,表明意图理解更强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23042 2026-06-23 cs.CY cs.AI cs.CL stat.AP 新提交 73%

The Model as One Rater Among Several: Measuring Political Positions in Data-Sparse Regions with a Language-Model Panel

模型作为多位评估者之一:在数据稀疏区域使用语言模型面板测量政治立场

Tarek Gara

机构 * Independent researcher(独立研究者)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出将大语言模型作为面板中的一位评估者,通过多模型投票测量政治立场,在数据稀疏区域(如中东和北非)验证了可靠性,并发现分歧可提供信息。

Comments 21 pages, 1 figure, 7 tables. Dataset, rubric, and interactive tools: https://tarekgara.com/tayyar

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22811 2026-06-23 cs.CL cs.AI 新提交 73%

Bagpiper-TTS: Natural Language Guided Universal Speech Synthesis

Bagpiper-TTS: 自然语言引导的通用语音合成

Jinchuan Tian, Haoran Wang, Siddhant Arora, Takashi Maekaku, Keita Goto, Jin Sakuma, Yusuke Shinohara, Chao-Han Huck Yang, Shinji Watanabe

机构 * Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所) LY Corporation NVIDIA Research(英伟达研究院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出Bagpiper-TTS,通过自然语言提示推理用户意图生成丰富描述,再合成语音,支持多说话人、意图转语音、角色扮演、歌声合成等任务,在Seed-TTS-Eval上WER为1.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21685 2026-06-23 cs.CL cs.AI cs.DB 新提交 73%

TACO: Task-Aware Column Description Generation Using LLMs

TACO:使用LLMs的任务感知列描述生成

Ting Cai, Rakesh R. Menon, Yiru Chen, Zifan Liu, Yuan Tian, Fei Wu, Anudeep Chimakurthi, Prashanthi Ramamurthy, Sunav Choudhary, Kun Qian, Yunyao Li

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Purdue University(普渡大学) Adobe

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出TACO框架,通过三步流水线(缩写扩展、描述生成、描述修订)利用LLMs自动生成准确且信息丰富的列描述,在下游任务中性能提升高达32%。

Comments 15 pages, 11 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20961 2026-06-23 cs.LG cs.AI 新提交 73%

Is Our Benchmark Enough? An Analysis of Continual Learning for MLLMs

我们的基准测试足够吗?多模态大语言模型持续学习分析

Van-Tuan Tran, Shruthi Gowda, Merim Dzaferagic, Marco Ruffini

机构 * School of Computer Science and Statistics, Trinity College Dublin(都柏林圣三一学院计算机科学与统计学院) Department of Mathematics and Computer Science, Eindhoven University of Technology(埃因霍温理工大学数学与计算机科学系)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文质疑MR-LoRA方法对MLLM路由器的依赖,提出无训练无重放的简单原型路由方法RePRo,并指出共享专家无益,揭示MLLM-CL基准的任务高度可分离和固定顺序导致评估偏差,从而提出新基准设计。

Comments ICML 2026 Workshop "Continual Adaptation at Scale: Towards Sustainable AI"

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20255 2026-06-23 cs.CL cs.AI 新提交 73%

The Register Gap: A Meaning Intelligence Framework for Nigerian Public Discourse

语域差距:尼日利亚公共话语的意义智能框架

Celestine Achi

机构 * AGENTPR™ / AI-Powered PR / Cihan Digital Academy(AGENTPR™ / AI-Powered PR / 塞汉数字学院)

专题命中 评测与基准 :language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 提出九维意义智能框架(MIF),通过语域、真实意图等维度区分表面情感与真实交际意图,在尼日利亚公共话语数据集上使语域分类准确率提升40个百分点,复合意义智能评分提升5.4分。

Comments Preprint v2. 14 pages, 3 tables. Multi-model evaluation (Gemini 2.5 Flash, GPT-5, Gemini 2.5 Pro). Supplementary materials available from the author

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03553 2026-06-23 cs.CL cs.AI 版本更新 73%

MultiZebraLogic: A Multilingual Logical Reasoning Benchmark

MultiZebraLogic:多语言逻辑推理基准

Sofie Helene Bruun, Dan Saattrup Smart

机构 * The Alexandra Institute(亚历山大研究所)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出多语言逻辑推理基准MultiZebraLogic,包含九种语言的高质量斑马谜题数据集,通过调整谜题大小和添加无关线索控制难度,分析语言、文化敏感性和线索类型对模型性能的影响。

Comments Camera-ready version for RESOURCEFUL 2026 at LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04458 2026-06-23 cs.CL cs.IR 版本更新 70%

DoGMaTiQ: Automated Generation of Question-and-Answer Nuggets for Report Evaluation

DoGMaTiQ:面向报告评估的问答片段自动生成

Bryan Li, William Walden, Yu Hou, Gabrielle Kaili-May Liu, Dawn Lawrie, James Mayfield, Eugene Yang, Chris Callison-Burch, Laura Dietz

机构 * Google Inc.(谷歌公司) Johns Hopkins University(约翰霍普金斯大学) University of Maryland(马里兰大学) Yale University(耶鲁大学) University of Pennsylvania(宾夕法尼亚大学) University of New Hampshire(新罕布什尔大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 提出DoGMaTiQ流水线,通过文档锚定生成、释义聚类和基于质量准则的子选择三步自动生成高质量QA片段,实现报告的全自动评估,在跨语言任务中与人工判断高度相关。

Comments ICTIR '26

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23633 2026-06-23 cs.AI econ.GN q-fin.EC 新提交 70%

AI Exposure Scores: what they measure, what they miss, and what comes next

AI暴露分数:它们衡量什么、遗漏什么以及下一步是什么

Campbell Lund, Thomas Euyang, Zanele Munyikwa, Marzieh Fadaee

机构 * Cohere Labs(Cohere实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文以2023年GPTs暴露分数为案例,分析静态暴露分数在政策分析中的结构性局限,并综述五种应对方法,强调需弥合研究-政策差距。

Comments 19 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23403 2026-06-23 cs.AI 新提交 70%

Litmus: Zero-Label, Code-Driven Metric Specification for Evaluating AI Systems

Litmus: 零标注、代码驱动的AI系统评估指标规范

Prajjwal Gupta, Prasang Gupta, Vishal Bhutani, Apoorva Sharma, Sumanth Chundru, Waqar Sarguroh, Kevin Paul

机构 * PricewaterhouseCoopers, U.S.(普华永道(美国))

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出Litmus系统,通过分析源代码自动生成评估指标,无需人工标注,在三个真实AI流水线上优于基线方法。

Comments 22 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21930 2026-06-23 cs.CL 新提交 70%

MindTailor: Personalized Emotional Support via Post History-Grounded Case Formulation and Collaborative Refinement

MindTailor: 通过历史帖子基于案例构建和协作精炼的个性化情感支持

Suhyun Han, Kyunghyun Cho, JinYeong Bak

机构 * Sungkyunkwan University(成均馆大学) New York University(纽约大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 提出MindTailor框架,利用求助者历史帖子构建案例,并通过基于不同咨询策略的协作批评迭代精炼回复,在Reddit数据集上优于基线,提升共情和个性化。

Comments 45 pages, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21657 2026-06-23 cs.CV cs.CL 新提交 70%

Chehre: An Emoji-Prompted Video Dataset for Perceptually Diverse Facial Expression Recognition

Chehre: 一个用于感知多样面部表情识别的表情符号提示视频数据集

Bita Azari, Zoe Stanley, Avneet Batra, Poorvi Bhatia, Hali Kil, Manolis Savva, Angelica Lim

机构 * Simon Fraser University(西蒙弗雷泽大学)

专题命中 评测与基准 :language model(abstract);prompting(abstract);分类 cs.CL

AI总结 提出Chehre数据集,通过表情符号提示收集动态面部表情视频,并转移至合成人脸以保护隐私,定义主导和分布表情识别任务,基准测试显示现有模型表现有限。

Comments 16 pages, 8 images

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21618 2026-06-23 cs.CL 新提交 70%

CulMind: Benchmarking Multimodal Understanding and Reasoning in Chinese Cultural Heritage

CulMind:中国文化遗产中的多模态理解与推理基准

Zhangwei Cao, Shuhan Fan, Yuting Wei, Jiajun Zhang, Yihang Peng, Qi Meng, Yangfu Zhu, Liangbin Yang

机构 * University of International Relations(国际关系学院) Kedge Business School(凯致商学院) Peking University(北京大学) Tsinghua University(清华大学) Beijing University of Posts and Telecommunications(北京邮电大学) Capital Normal University(首都师范大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对现有基准忽视推理过程的问题,提出CulMind和CulMind-R基准,涵盖50个任务和24个推理子任务,并设计ReaScore指标评估推理质量,揭示答案与推理之间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21222 2026-06-23 cs.RO cs.AI 新提交 70%

FleetAgent: Teleoperation Assistant for Autonomous Fleets via Vectorized V2N Messages

FleetAgent: 通过向量化V2N消息实现自主车队远程操作助手

Juntong Peng, Qi Chen, Deyuan Qu, Takayuki Shimizu, Yaobin Chen, Ziran Wang

机构 * College of Engineering, Purdue University(普渡大学工程学院) Toyota InfoTech Labs(丰田信息技术实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出FleetAgent,一种基于多模态大语言模型的云端助手,通过紧凑的向量化V2N消息实现高效远程操作监控,显著降低上行负载和内存占用,并提升操作员优先级判断与干预效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20608 2026-06-23 cs.CY cs.AI cs.CV 新提交 70%

CourseBlueprint: A Structured Pipeline for Adaptive Pedagogical Video Generation Grounded in Course Corpora

CourseBlueprint:基于课程语料库的自适应教学视频生成的结构化流程

Md Zabirul Islam, Md Motaleb Hossen Manik, Ge Wang

机构 * Department of Computer Science, Rensselaer Polytechnic Institute(计算机科学系,拉特格斯理工学院) Department of Biomedical Engineering, Rensselaer Polytechnic Institute(生物医学工程系,拉特格斯理工学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出CourseBlueprint流程,通过结构化教学蓝图(含先决条件图、自适应控制、参与合约)从课程语料库生成自适应教学视频,实验证明显式教学合约比表面流畅性更关键。

详情

展开后加载摘要…

URL PDF HTML 收藏