arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-03 至 2026-02-03 共收录 608 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 116 篇

2511.16209 2026-02-03 cs.CR cs.CL 85%

PSM: Prompt Sensitivity Minimization via LLM-Guided Black-Box Optimization

PSM:通过LLM引导的黑盒优化实现提示敏感性最小化

Huseein Jawad, Nicolas Brunel

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出PSM框架,通过LLM引导的黑盒优化,利用SHIELD层减少系统提示泄露,提升LLM安全性和隐私保护。

Comments accepted at the Trustworthy Agentic AI Workshop @ AAAI 2026 (Singapore, Jan 27, 2026). Workshop PDF: https://trustagenticai.github.io/AAAI2026/AAAI-Workshop/20.pdf

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00414 2026-02-03 cs.CV cs.LG 85%

Toward Autonomous Laboratory Safety Monitoring with Vision Language Models: Learning to See Hazards Through Scene Structure

迈向自主实验室安全监控:通过场景结构学习识别危险

Trishna Chakraborty, Udita Ghosh, Aldair Ernesto Gongora, Ruben Glatt, Yue Dong, Jiachen Li, Amit K. Roy-Chowdhury, Chengyu Song

机构 * Electrical and Computer Engineering, University of California, Riverside, USA(加州大学河滨分校电气与计算机工程系) Computer Science and Engineering, University of California, Riverside, USA(加州大学河滨分校计算机科学与工程系) Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);post-training(abstract);分类 cs.LG

AI总结 本文提出通过场景图引导对齐方法,利用视觉语言模型提升实验室安全监控中危险识别的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00204 2026-02-03 cs.CR cs.AI 85%

Semantic-Aware Advanced Persistent Threat Detection Using Autoencoders on LLM-Encoded System Logs

基于语义的高级持续性威胁检测:使用自动编码器对LLM编码的系统日志进行分析

Waleed Khan Mohammed, Zahirul Arief Irfan Bin Shahrul Anuar, Mousa Sufian Mousa Mitani, Hezerul Abdul Karim, Nouar AlDahoul

机构 * Faculty of Artificial Intelligence and Engineering, Multimedia University Cyberjaya, Malaysia(人工智能与工程学院,多媒体大学(Cyberjaya校区)) Centre for Image and Vision Computing, Centre of Excellence for Artificial Intelligence, Faculty of Artificial Intelligence and Engineering, Multimedia University, Cyberjaya, Selangor, Malaysia(图像与视觉计算中心,人工智能卓越中心,人工智能与工程学院,多媒体大学(Cyberjaya校区,Selangor州)) Computer Science, New York University Abu Dhabi, UAE(计算机科学,纽约大学阿布扎克校区)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出利用LLM生成的语义嵌入和自动编码器,提升对高级持续性威胁的检测能力,实验显示其在复杂威胁场景中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06749 2026-02-03 cs.AI cs.SE 85%

DoVer: Intervention-Driven Auto Debugging for LLM Multi-Agent Systems

DoVer:基于干预的LLM多智能体系统自动调试

Ming Ma, Jue Zhang, Fangkai Yang, Yu Kang, Qingwei Lin, Saravan Rajmohan, Dongmei Zhang

机构 * Institute of Neuroscience, State Key Laboratory of Brain Cognition and Brain-inspired Intelligence Technology, Center for Excellence in Brain Science and Intelligence Technology, Chinese Academy of Sciences, Shanghai, 200031, China(中国科学院神经科学研究所、脑认知与脑启发智能技术重点实验室、脑科学与智能技术卓越中心、中国科学院、上海) University of Chinese Academy of Sciences, School of Future Technology, Beijing, 100049, China(中国科学院大学、未来技术学院、北京) Microsoft(微软公司)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 DoVer通过干预驱动的调试方法,显著提高了LLM多智能体系统的可靠性,实现了高比例的失败试验修复和任务进展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01213 2026-02-03 cs.HC 85%

LeagueBot: A Voice LLM Companion of Cognitive and Emotional Support for Novice Players in Competitive Games

LeagueBot: 一款为竞技游戏新手玩家提供认知与情感支持的语音大语言模型伴侣

Jungmin Lee, Inhee Cho, Youngjae Yoo

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 LeagueBot通过语音大语言模型为竞技游戏新手提供认知与情感支持,减轻学习压力和心理负担,提升游戏体验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02455 2026-02-03 cs.AI cs.CL cs.SE 84%

Drift-Bench: Diagnosing Cooperative Breakdowns in LLM Agents under Input Faults via Multi-Turn Interaction

Drift-Bench: 通过多轮交互诊断LLM代理在输入故障下的合作破裂

Han Bao, Zheyuan Zhang, Pengcheng Jing, Zhengqing Yuan, Kaiwen Shi, Yanfang Ye

机构 * University of Notre Dame(内布拉斯加大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 Drift-Bench通过多轮交互评估LLM代理在输入故障下的合作破裂,采用角色驱动的用户模拟器和Rise评估协议,揭示澄清效果随用户角色和故障类型的变化,推动代理安全评估。

Comments 65 pages, 40 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18110 2026-02-03 cs.CL 83%

Watch and Listen: Understanding Audio-Visual-Speech Moments with Multimodal LLM

Watch and Listen: 通过多模态大语言模型理解音频-视觉-语音时刻

Zinuo Li, Xian Zhang, Yongxin Guo, Mohammed Bennamoun, Farid Boussaid, Girish Dwivedi, Luqi Gong, Qiuhong Ke

机构 * University of Western Australia(西澳大学) Alibaba Group(阿里巴巴集团) Zhejiang Laboratory(浙江实验室) Monash University(墨尔本大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 TriSense通过整合视觉、音频和语音模态,提升视频时间理解能力,采用基于查询的连接器实现多模态鲁棒性,并通过TriSense-2M数据集推动多模态视频分析发展。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00034 2026-02-03 cs.CY cs.AI 83%

Synthetic Student Responses: LLM-Extracted Features for IRT Difficulty Parameter Estimation

合成学生响应:基于LLM提取的IRT难度参数估计

Matias Hoyl

机构 * School of Education, Stanford University(教育学院,斯坦福大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 利用LLM提取的特征,通过模拟学生响应过程准确估计IRT难度参数,实现高相关性预测。

Comments 17 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00123 2026-02-03 cs.HC cs.CV 82%

Visual Affect Analysis: Predicting Emotions of Image Viewers with Vision-Language Models

视觉情感分析:利用视觉-语言模型预测图像观看者的感受

Filip Nowicki, Hubert Marciniak, Jakub Łączkowski, Krzysztof Jassem, Tomasz Górecki, Vimala Balakrishnan, Desmond C. Ong, Maciej Behnke

机构 * Faculty of Mathematics and Computer Science, Adam Mickiewicz University(数学与计算机科学学院,亚当·密茨凯维奇大学) Faculty of Computer Science and Information Technology, Universiti Malaya(计算机科学与信息技术学院,马来亚大学) Department of Computer Science and Engineering, Korea University(计算机科学与工程系,韩国大学) Department of Psychology, University of Texas at Austin(心理学系,德克萨斯大学奥斯汀分校) Cognitive Neuroscience Center, Adam Mickiewicz University(认知神经科学中心,亚当·密茨凯维奇大学)

专题命中 评测与基准 :language model(title,abstract);prompting(abstract)

AI总结 本文研究了视觉-语言模型在预测图像观众情感方面的性能,发现其在离散情绪分类上表现良好,但在连续评分预测中存在偏差,揭示了其在情感计算中的潜力与局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22752 2026-02-03 cs.CL 81%

CUS-QA: Local-Knowledge-Oriented Open-Ended Question Answering Dataset

CUS-QA:面向局部知识的开放性问答数据集

Jindřich Libovický, Jindřich Helcl, Andrei Manea, Gianluca Vico

机构 * Charles University(查尔斯大学) University of Oslo(奥斯陆大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 CUS-QA数据集旨在评估开放性区域问答性能,通过文本和视觉模态问题测试,揭示LLM在不同任务上的准确率差异及评估指标的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15969 2026-02-03 cs.LG cs.AI 81%

LinearizeLLM: An Agent-Based Framework for LLM-Driven Exact Linear Reformulation of Nonlinear Optimization Problems

LinearizeLLM: 一个基于代理的框架,用于由LLM驱动的非线性优化问题的精确线性重 formulations

Paul-Niklas Ken Kandora, Simon Caspar Zeller, Aaron Jeremias Elsing, Elena Kuss, Steffen Rebennack

机构 * Institute for Operations Research, Karlsruhe Institute of Technology, Karlsruhe, Germany(运营研究学院,卡尔斯鲁厄技术大学) Institute for Information Systems, Reutlingen University, Reutlingen, Germany(信息系统研究所,鲁特lingen大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 LinearizeLLM通过基于代理的LLM框架实现非线性优化问题的自动精确线性化,显著提升线性化效率和准确性。

Comments This version is a major revision with a new abstract, updated workflow logic and description, an expanded instance set, additional numerical experiments, and corrected bibliography entries

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00305 2026-02-03 cs.CR cs.AI cs.LG 81%

Semantics-Preserving Evasion of LLM Vulnerability Detectors

保持语义的LLM漏洞检测器逃避

Luze Sun, Alina Oprea, Eric Wong

机构 * Northeastern University(东北大学) University of Pennsylvania(宾夕法尼亚大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 研究发现基于LLM的漏洞检测器在保持语义的逃避攻击下存在系统性失效,提出联合鲁棒性指标以评估检测器的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02162 2026-02-03 cs.LG 79%

Interpretable Tabular Foundation Models via In-Context Kernel Regression

通过上下文核回归实现可解释的表格基础模型

Ratmir Miftachov, Bruno Charron, Simon Valentin

机构 * Amazon(亚马逊) AWS AI Labs(AWS人工智能实验室)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 KernelICL通过在最终层引入核函数,实现表格基础模型的可解释性,同时保持性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17649 2026-02-03 cs.LG 79%

Longitudinal Progression Prediction of Alzheimer's Disease with Tabular Foundation Model

阿尔茨海默病纵向进展预测的表格基础模型

Yilang Ding, Jiawen Ren, Jiaying Lu, Gloria Hyunjung Kwak, Armin Iraji, Shengpu Tang, Alex Fedorov

机构 * Department of Computer Science Emory University Atlanta GA USA(埃默里大学计算机科学系) Center for Data Science Nell Hodgson Woodruff School of Nursing Emory University Atlanta GA USA(埃默里大学数据科学中心) Department of Computer Science Georgia State University Atlanta GA USA(佐治亚州立大学计算机科学系) Tri-Institutional Center for Translational Research in Neuroimaging and Data Science (TReNDS) Atlanta GA USA(神经影像与数据科学转化研究三机构中心(TReNDS))

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 本文提出L2C-TabPFN方法,结合纵向到横断面转换与预训练表格基础模型,用于预测阿尔茨海默病的临床相关生物标志物,特别是在脑室体积预测上取得突破性成果。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01346 2026-02-03 cs.AI 79%

Model Specific Task Similarity for Vision Language Model Selection via Layer Conductance

为视觉语言模型选择而基于模型特定任务相似性的层导电性

Wei Yang, Hong Xie, Tao Tan, Xin Li, Defu Lian, Enhong Chen

机构 * School of Computer Science and Technology, University of Science and Technology of China(计算机科学与技术学院,科学技术大学) School of AI and Data Science, University of Science and Technology of China(人工智能与数据科学学院,科学技术大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 本文提出了一种基于模型特定任务相似性的视觉语言模型选择方法,通过层导电性分析和方向导电性发散度度量,提升模型选择效果。

Comments Preprint. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01276 2026-02-03 cs.AI 79%

LLM-Driven Ontology Construction for Enterprise Knowledge Graphs

基于大语言模型的企业知识图谱本体构建

Abdulsobur Oyewale, Tommaso Soru

机构 * Liber AI Research(Liber AI研究)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 本文提出OntoEKG,利用大语言模型自动构建企业知识图谱的领域本体,通过提取和蕴含模块提升效率,但在范围定义和层次推理方面仍有挑战。

Comments 20th International Conference on Semantic Computing (ICSC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00782 2026-02-03 q-bio.BM cs.AI 79%

Controlling Repetition in Protein Language Models

控制蛋白质语言模型中的重复

Jiahao Zhang, Zeqing Zhang, Di Wang, Lijie Hu

机构 * Mohamed bin Zayed University of Artificial Intelligence(Mohamed bin Zayed人工智能大学) King Abdullah University of Science and Technology(国王阿卜杜勒阿齐兹科技大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 本文提出UCCS方法,通过受约束数据集引导蛋白质生成,有效减少重复并保持折叠可靠性。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00376 2026-02-03 cs.LG 79%

MATRIX: A Multimodal Benchmark and Post-Training Framework for Materials Science

MATRIX: 一种用于材料科学的多模态基准和后训练框架

Delia McGrath, Curtis Chong, Rohil Kulkarni, Gerbrand Ceder, Adeesh Kolluru

专题命中 评测与基准 :post-training(title,abstract);分类 cs.LG

AI总结 MATRIX通过多模态后训练提升材料科学推理,展示视觉引导对实验解释和文本任务的显著改进。

Comments 17 pages, 9 Figures, submitted

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00641 2026-02-03 cs.AI 79%

AgentAuditor: Human-Level Safety and Security Evaluation for LLM Agents

AgentAuditor: 为LLM代理提供人类水平的安全性和安全性评估

Hanjun Luo, Shenyu Dai, Chiming Ni, Xinfeng Li, Guibin Zhang, Kun Wang, Tongliang Liu, Hanan Salam

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 AgentAuditor通过构建经验记忆和多阶段检索生成过程,提升LLM在代理安全性和安全性评估中的性能,达到人类水平的准确性。

Comments This paper is accepted by 39th Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01644 2026-02-03 cs.LG cs.AI cs.CV cs.MA cs.RO 79%

From Perception to Action: Spatial AI Agents and World Models

从感知到行动:空间AI代理与世界模型

Gloria Felicia, Nolan Bryant, Handi Putra, Ayaan Gazali, Eliel Lobo, Esteban Rojas

机构 * AtlasPro AI

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种统一的三轴分类法,将代理能力与空间任务联系起来,强调空间定位与符号定位的区别,并指出世界模型对跨尺度安全部署的重要性。

Comments 61 pages, 742 citations, 1 figure, 3 tables. Survey paper on spatial AI agents, embodied AI, graph neural networks, and world models

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09473 2026-02-03 cs.LG cs.AI 79%

SimMerge: Learning to Select Merge Operators from Similarity Signals

SimMerge: 从相似性信号中学习选择合并操作符

Oliver Bolton, Aakanksha, Arash Ahmadian, Sara Hooker, Marzieh Fadaee, Beyza Ermis

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 SimMerge通过学习从相似性信号中选择合并操作符,实现了在大规模模型组合中的高效且无需迭代评估的合并方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05980 2026-02-03 cs.CL cs.LG 79%

Lost in Localization: Building RabakBench with Human-in-the-Loop Validation to Measure Multilingual Safety Gaps

迷失于定位:通过人类在环验证构建RabakBench以衡量多语言安全差距

Gabriel Chua, Leanne Tan, Ziyu Ge, Roy Ka-Wei Lee

机构 * GovTech, Singapore(新加坡政府科技局) Singapore University of Technology and Design(新加坡科技与设计大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 RabakBench通过人类在环验证构建,用于衡量多语言安全差距,通过三阶段流程生成、标注和翻译数据,评估LLM在低资源语言中的安全性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00723 2026-02-03 cs.LG cs.AI 79%

Rethinking Hallucinations: Correctness, Consistency, and Prompt Multiplicity

重新思考幻觉:正确性、一致性与提示多样性

Prakhar Ganesh, Reza Shokri, Golnoosh Farnadi

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出提示多样性框架,揭示LLM幻觉评估中一致性的重要性,指出现有检测与缓解技术的局限性。

Comments To appear at EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20169 2026-02-03 cs.LG cs.CL stat.ML 79%

Learning to Reason in LLMs by Expectation Maximization

通过期望最大化学习大语言模型的推理能力

Junghyun Lee, Branislav Kveton, Anup Rao, Subhojyoti Mukherjee, Ryan A. Rossi, Sunav Choudhary, Alexa Siu

机构 * kaist-ai(韩国科学技术院人工智能学院) adobe(Adobe研究)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出基于奖励的过滤期望最大化方法,通过不同采样方案提升大语言模型的推理能力,实验表明PPS在任务表现上优于其他方案。

Comments 27 pages, 15 figures, 5 tables (ver2: major revision, including new experiments, reorganization, etc)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13853 2026-02-03 cs.CL cs.AI cs.DB cs.HC 79%

BenchPress: A Human-in-the-Loop Annotation System for Rapid Text-to-SQL Benchmark Curation

BenchPress:一种用于快速文本到SQL基准定制的人机协作标注系统

Fabian Wenz, Omar Bouattour, Devin Yang, Justin Choi, Cecil Gregg, Nesime Tatbul, Çağatay Demiralp

机构 * TU Munich(慕尼黑技术大学) MIT(麻省理工学院) Intel Labs(英特尔实验室) AWS AI Labs(亚马逊AI实验室)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 BenchPress通过人机协作系统加速特定领域文本到SQL基准的创建,结合LLM生成与人类验证提升标注准确性与基准可靠性。

Comments CIDR'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00070 2026-02-03 cs.CY cs.CL cs.LG 79%

FoundationalASSIST: An Educational Dataset for Foundational Knowledge Tracing and Pedagogical Grounding of LLMs

FoundationalASSIST: 一个用于基础知识追踪和LLM教学基础的教育数据集

Eamon Worden, Cristina Heffernan, Neil Heffernan, Shashank Sonkar

机构 * Worcester Polytechnic Institute(沃斯特理工大学) The ASSISTments Foundation(ASSISTments基金会) University of Central Florida(中央佛罗里达大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 FoundationalASSIST 是首个为研究LLM在教育中的应用而设计的英文教育数据集,提供完整问题文本、学生实际回答和对齐标准,用于评估LLM在知识追踪和教学基础方面的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00066 2026-02-03 cs.SE cs.CL cs.LG 79%

IntentCoding: Amplifying User Intent in Code Generation

IntentCoding: 提升代码生成中用户意图的遵循能力

Zheng Fang, Yihong Dong, Lili Mou, Dongming Jin, Zhi Jin, Ge Li

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) Department of Computing Science, University of Alberta(阿尔伯塔大学计算机科学系) Canada CIFAR AI Chair(加拿大CIFAR人工智能 chair)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 IntentCoding通过增强用户意图的影响力,提升代码生成中对约束条件的遵循能力,显著提高约束满足和功能正确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01055 2026-02-03 cs.CV 78%

Baseline Method of the Foundation Model Challenge for Ultrasound Image Analysis

超声图像分析基础模型挑战的基线方法

Bo Deng, Yitong Tang, Jiake Li, Yuxin Huang, Li Wang, Yu Zhang, Yufei Zhan, Hua Lu, Xiaoshen Zhang, Jieyun Bai

机构 * The First Affiliated Hospital of Jinan University(暨南大学第一附属医院) Southern Medical University(南方医科大学) Guangzhou Women and Children's Medical Center(广州市妇女儿童医疗中心)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 本文提出了一种统一的多任务学习框架,用于超声图像分析的基础模型挑战,通过多任务学习和特征金字塔网络实现多任务的统一处理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.00068 2026-02-03 cs.CV 78%

Towards Artwork Explanation in Large-scale Vision Language Models

迈向大规模视觉语言模型中的艺术作品解释

Kazuki Hayashi, Yusuke Sakai, Hidetaka Kamigaito, Katsuhiko Hayashi, Taro Watanabe

机构 * Nara Institute of Science and Technology(奈良科学技术大学) The University of Tokyo(东京大学)

专题命中 评测与基准 :language model(title,abstract)

AI总结 本文提出艺术作品解释生成任务,评估大规模视觉语言模型在整合语言和视觉信息以及从图像中获取知识的能力。

Comments Accepted to ACL 2024 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02360 2026-02-03 cs.CL 77%

Automated Multiple Mini Interview (MMI) Scoring

自动化多轮面试(MMI)评分

Ryan Huynh, Frank Guerin, Alison Callwood

机构 * University of Surrey(萨里大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 本文提出多智能体提示框架,通过转录优化和标准特定评分提升MMI评分的准确性和可靠性,优于传统微调方法。

Comments 18 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏