arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-21 至 2026-01-21 共收录 224 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 72 篇

2601.13717 2026-01-21 cs.CL cs.AI 73%

Simulated Ignorance Fails: A Systematic Study of LLM Behaviors on Forecasting Problems Before Model Knowledge Cutoff

模拟无知失败:在模型知识截止前的预测问题上的系统研究

Zehan Li, Yuxuan Wang, Ali El Lahib, Ying-Jieh Xia, Xinyu Pi

机构 * University of Chicago(芝加哥大学) University of California, San Diego(加州大学圣地亚哥分校)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了在模型知识截止前的预测问题中,模拟无知方法的局限性,发现其无法有效近似真实无知,且推理链推理和优化模型在抑制先前知识方面存在缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13368 2026-01-21 cs.CL cs.LG 73%

Recurrent Confidence Chain: Temporal-Aware Uncertainty Quantification in Large Language Models

递归置信链:大型语言模型中的时间感知不确定性量化

Zhenjiang Mao, Anirudhh Venkat

机构 * University of Florida(佛罗里达大学)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.LG

AI总结 本文提出递归置信链方法,通过跨步骤注意力和隐藏置信机制,提升大型语言模型在不确定性量化中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12560 2026-01-21 cs.AI cs.MA 70%

Agentic Artificial Intelligence (AI): Architectures, Taxonomies, and Evaluation of Large Language Model Agents

代理型人工智能(AI):架构、分类及大语言模型代理的评估

Arunkumar V, Gangadharan G. R., Rajkumar Buyya

机构 * University College of Engineering, Anna University(安娜大学工程学院) National Institute of Technology Tiruchirappalli(Tiruchirappalli 国家理工学院) School of Computing and Information Systems University of Melbourne(墨尔本大学计算机与信息系统学院)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文探讨了代理型人工智能的架构、分类及评估,提出统一分类框架,分析从线性推理到原生推理模型的转变,并指出未来研究方向以提升自主系统的可靠性。

Comments 28 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13770 2026-01-21 cs.AI cs.CL cs.LG q-fin.CP q-fin.GN 67%

Look-Ahead-Bench: a Standardized Benchmark of Look-ahead Bias in Point-in-Time LLMs for Finance

Look-Ahead-Bench: 一个用于评估点即时大型语言模型在金融领域中前瞻性偏差的标准基准

Mostapha Benhenda

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Look-Ahead-Bench通过评估点即时LLMs在金融领域中的前瞻性偏差,揭示了标准LLMs的显著偏差问题,并为标准化评估提供了实用框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19529 2026-01-21 cs.CV 67%

Vidi2.5: Large Multimodal Models for Video Understanding and Creation

Vidi2.5:大型多模态模型用于视频理解和创作

Vidi Team, Chia-Wen Kuo, Chuang Huang, Dawei Du, Fan Chen, Fanding Lei, Feng Gao, Guang Chen, Haoji Zhang, Haojun Zhao, Jin Liu, Jingjing Zhuge, Lili Fang, Lingxi Zhang, Longyin Wen, Lu Guo, Lu Xu, Lusha Li, Qihang Fan, Rachel Deng, Shaobo Fang, Shu Zhang, Sijie Zhu, Stuart Siew, Weiyan Tao, Wen Zhong, Xiaohui Shen, Xin Gu, Ye Yuan, Yicheng He, Yiming Cui, Zhenfang Chen, Zhihua Wu, Zuhua Lin

机构 * ByteDance Inc.(字节跳动公司)

专题命中 推理评测 :reasoning(abstract);planning(abstract)

AI总结 Vidi2.5通过细粒度时空定位和复杂情节推理模型,提升了视频理解和创作的多模态能力,同时在多个基准测试中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12820 2026-01-21 cs.CV 67%

A Generalist Foundation Model for Total-body PET/CT Enables Diagnostic Reporting and System-wide Metabolic Profiling

一种通用的基础模型用于全身PET/CT,实现诊断报告和系统层面的代谢分析

Wei Chen, Liang Wu, Shuyi Lu, Yuanyuan Sun, Wenkai Bi, Zilong Yuan, Yaoyao He, Feng Wang, Junchi Ma, Shuyong Liu, Zhaoping Cheng, Xiaoyan Hu, Jianfeng Qiu

专题命中 推理评测 :reasoning(abstract);logical reasoning(abstract)

AI总结 SDF-HOLO是一种用于全身PET/CT的通用基础模型,通过多模态学习实现诊断报告和系统代谢分析,提升医疗影像处理的精度与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12491 2026-01-21 cs.HC 67%

VASTU: Value-Aligned Social Toolkit for Online Content Curation

VASTU:面向在线内容编纂的价值对齐社交工具包

Agam Goyal, Xianyang Zhan, Charlotte Lambert, Koustuv Saha, Eshwar Chandrasekharan

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract)

AI总结 VASTU通过社区特定模型在内容编纂中实现价值对齐,微调的转换器表现最佳,揭示了学习社区规范的重要性。

Comments Preprint: 15 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14160 2026-01-21 cs.CL cs.AI 62%

Domain-Adaptation through Synthetic Data: Fine-Tuning Large Language Models for German Law

通过合成数据实现领域适应:通过合成数据微调大型语言模型进行德国法律问答

Ali Hamza Bashir, Muhammad Rehan Khalid, Kostadin Cvejoski, Jana Birr, Jule Berghaus, Armin Berger, Sandra Halscheidt, Christian Temath, Rafet Sifa, David Berghaus

机构 * Fraunhofer IAIS(弗劳恩霍夫人工智能研究所) Georg-August-University Göttingen(哥廷根乔治-亚历山大大学) Lamarr Institute(拉马尔研究所) University of Bonn(波恩大学) JetBrains Research(JetBrains研究)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文通过合成数据生成方法微调大型语言模型,提升其在德国法律问答任务中的性能,展示合成数据在替代人工标注方面的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20543 2026-01-21 cs.CL cs.AI 62%

The Dog the Cat Chased Stumped the Model: Measuring When Language Models Abandon Structure for Shortcuts

狗追猫的猫让模型困惑:衡量语言模型何时放弃结构分析而采用捷径

Sangmitra Madhusudan, Kaige Chen, Ali Emami

机构 * Emory University(埃默里大学) Brock University(布罗克大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CenterBench数据集,用于衡量语言模型在处理中心嵌套句子时何时从结构分析转向语义捷径,揭示模型在复杂性增加时性能差距扩大及人类与模型的差异。

Comments 9 pages (excluding references), accepted to EACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20941 2026-01-21 cs.CL cs.AI 62%

Do LLMs Truly Understand When a Precedent Is Overruled?

大型语言模型真的能理解当先例被推翻时的情况吗?

Li Zhang, Jaromir Savelka, Kevin Ashley

机构 * University of Pittsburgh(匹兹堡大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文通过评估LLMs在识别美国最高法院案件中推翻关系的能力,揭示了模型在时间敏感性、推理深度和上下文依赖性方面的局限性,并提出了一种更贴近真实法律推理任务的长上下文基准。

Comments 12 pages, 2 figures, JURIX 2025

Journal ref Proceedings of the 2025 Conference on Legal Knowledge and Information Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08464 2026-01-21 cs.CL cs.LG cs.SI 62%

Large Language Models Meet Stance Detection: A Survey of Tasks, Methods, Applications, Challenges and Future Directions

大语言模型与立场检测:任务、方法、应用、挑战与未来方向的综述

Lata Pangtey, Anukriti Bhatnagar, Shubhi Bansal, Shahid Shafi Dar, Nagendra Kumar

机构 * Department of Computer Science and Engineering, Indian Institute of Technology (IIT) Indore, Indore 453552, India(计算机科学与工程系,印度理工学院(IIT)印多尔,印多尔453552,印度)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文综述了大语言模型在立场检测中的任务、方法、应用及挑战,提出分类框架并探讨未来发展方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12259 2026-01-21 cs.AI cs.CE cs.LG 62%

FutureX-Pro: Extending Future Prediction to High-Value Vertical Domains

FutureX-Pro: 将未来预测扩展到高价值垂直领域

Jiashuo Liu, Siyuan Chen, Zaiyuan Wang, Zhiyuan Zeng, Jiacheng Guo, Liang Hu, Lingyue Yin, Suozhi Huang, Wenxin Hao, Yang Yang, Zerui Cheng, Zixin Yao, Lingyue Yin, Haoxin Liu, Jiayi Cheng, Yuzhen Li, Zezhong Ma, Bingjie Wang, Bingsen Qiu, Xiao Liu, Zeyang Zhang, Zijian Liu, Jinpeng Wang, Mingren Yin, Tianci He, Yali Liao, Yixiao Tian, Zhenwei Zhu, Anqi Dai, Ge Zhang, Jingkai Liu, Kaiyuan Zhang, Wenlong Wu, Xiang Gao, Xinjie Chen, Zhixin Yao, Zhoufutu Wen, B. Aditya Prakash, Jose Blanchet, Mengdi Wang, Nian Si, Wenhao Huang

机构 * Hong Kong University of Science and Technology(香港科技大学) Georgia Institute of Technology(佐治亚理工学院) Stanford University(斯坦福大学) Princeton University(普林斯顿大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 FutureX-Pro通过扩展未来预测到金融、零售、公共健康和自然灾害等高价值垂直领域,评估代理LLMs在工业部署中的领域基础能力。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11776 2026-01-21 cs.CL cs.AI 62%

Cleansing the Artificial Mind: A Self-Reflective Detoxification Framework for Large Language Models

净化人工智能:一种用于大型语言模型的自反思净化框架

Kaituo Zhang, Zhimeng Jiang, Na Zou

机构 * University of Houston(休斯顿大学) Texas A&M University(德克萨斯农工大学)

专题命中 推理评测 :self-correction(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种自反思净化框架,利用LLMs自身能力检测并纠正有毒内容,提升文本生成的安全性和连贯性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11658 2026-01-21 cs.CL cs.AI 62%

Towards AGI A Pragmatic Approach Towards Self Evolving Agent

迈向AGI:一种务实的自我进化代理方法

Indrajit Kar, Sammy Zonunpuia, Zonunfeli Ralte

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种分层自我进化多代理框架,通过整合基础LLM、操作SLM代理、代码生成LLM和教师LLM,实现代理的持续适应与自我进化,展示了在不同任务难度下的进化优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11567 2026-01-21 cs.CL cs.AI 62%

Measuring Stability Beyond Accuracy in Small Open-Source Medical Large Language Models for Pediatric Endocrinology

在儿科内分泌学中超越准确性的医疗小型开源大语言模型稳定性测量

Vanessa D'Amario, Randy Daniel, Alessandro Zanetti, Dhruv Edamadaka, Nitya Alaparthy, Joshua Tarkoff

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了儿科内分泌学中医疗小型开源大语言模型的稳定性,发现高一致性不等于正确性,且系统扰动会影响输出,强调了评估框架的必要性。

Comments 20 pages, 11 figures, accepted at 47 workshop Reproducible Artificial Intelligence (AAAI 2026, Singapore, January 27, 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23816 2026-01-21 cs.CL cs.LG 62%

A Course Correction in Steerability Evaluation: Revealing Miscalibration and Side Effects in LLMs

在可转向性评估中的课程修正:揭示LLMs中的误校准与副作用

Trenton Chang, Tobias Schnabel, Adith Swaminathan, Jenna Wiens

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出了一种多维目标空间框架,揭示LLMs在文本改写任务中存在意外副作用,表明现有对齐策略可能不足。

Comments 8 pages, 6 figures. 26 pages of references and supplementary material, 22 additional figures. Association for the Advancement of Artificial Intelligence Conference (AAAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13880 2026-01-21 cs.AI 57%

LifeAgentBench: A Multi-dimensional Benchmark and Agent for Personal Health Assistants in Digital Health

LifeAgentBench: 一个多维基准和代理用于数字健康中的个人健康助手

Ye Tian, Zihao Wang, Onat Gungor, Xiaoran Fan, Tajana Rosing

机构 * University of California San Diego(加州大学圣地亚哥分校) Google Research(谷歌研究)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出LifeAgentBench多维基准和代理,用于评估LLM在长周期、跨维度健康推理中的能力,并通过实验识别关键瓶颈,提出基线代理LifeAgent实现显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13581 2026-01-21 cs.AI 57%

SCRIPTMIND: Crime Script Inference and Cognitive Evaluation for LLM-based Social Engineering Scam Detection System

SCRIPTMIND:基于LLM的社会工程诈骗检测系统的犯罪脚本推断与认知评估

Heedou Kim, Changsik Kim, Sanghwa Shin, Jaewoo Kang

机构 * Korea University(韩国大学) Korean National Police Agency(韩国国家警察局) Inje University(仁荷大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 ScriptMind通过结合自动化推理与人类认知,提升LLM在社会工程诈骗检测中的准确性与用户认知意识

Comments This paper has been accepted to the EACL 2026 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13443 2026-01-21 cs.AI 57%

Explicit Cognitive Allocation: A Principle for Governed and Auditable Inference in Large Language Models

显式认知分配:一种用于受控和可审计的大语言模型推理的原则

Héctor Manuel Manzanilla-Granados, Zaira Navarrete-Cazales, Miriam Pescador-Rojas, Tonahtiu Ramírez-Romero

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出显式认知分配原则,通过认知通用代理架构实现结构化推理,提升大语言模型在高责任场景下的可追溯性和可审计性。

Comments Preprint. This version corresponds to the initial public release of the CUA architecture and associated evaluation metrics

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06747 2026-01-21 cs.AI 57%

FinForge: Semi-Synthetic Financial Benchmark Generation

FinForge:半合成金融基准生成

Glenn Matlin, Akhil Theerthala, Anant Gupta, Anirudh JM, Rayan Castilla, Yi Mei Ng, Sudheer Chava

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 FinForge通过半合成方法生成金融领域基准,评估模型在金融推理中的性能,揭示模型在金融领域的表现差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10795 2026-01-21 cs.CL 57%

Beyond "Not Novel Enough": Enriching Scholarly Critique with LLM-Assisted Feedback

超越‘不够新颖’:利用LLM辅助反馈丰富学术批评

Osama Mohammed Afzal, Preslav Nakov, Tom Hope, Iryna Gurevych

机构 * UKP Lab, TU Darmstadt and Hessian Center for AI (hessian.AI)(图林人工智能实验室、德累斯顿理工大学和黑森人工智能中心) MBZUAI(马克斯·普朗克人工智能研究所) The Allen Institute for AI (AI2)(人工智能研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出一种结构化LLM辅助方法,通过三个阶段评估论文新颖性,实现86.5%的人类推理一致性,显著优于现有基线方法,提升同行评审的严谨性和透明度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15364 2026-01-21 cs.AI 57%

KeyDiff: Key Similarity-Based KV Cache Eviction for Long-Context LLM Inference in Resource-Constrained Environments

KeyDiff: 基于键相似性的KV缓存淘汰方法用于资源受限环境中的长上下文LLM推理

Junyoung Park, Dalton Jones, Matthew J Morse, Raghavv Goel, Mingu Lee, Chris Lott

机构 * Qualcomm AI Research(高通人工智能研究)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 KeyDiff是一种基于键相似性的KV缓存淘汰方法,能够在资源受限环境下高效处理长上下文LLM推理,减少缓存占用并提升响应效率。

Comments 37 pages, 19 figures, NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19498 2026-01-21 cs.CL 57%

DomainCQA: Crafting Knowledge-Intensive QA from Domain-Specific Charts

DomainCQA: 从领域特定图表中构建知识密集型问答

Yujing Lu, Ling Zhong, Jing Yang, Weiming Li, Peng Wei, Yongheng Wang, Manni Duan, Qing Zhang

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 DomainCQA通过构建领域特定图表问答基准测试,提升多模态大语言模型在视觉理解和知识密集型推理方面的能力。

Comments 83 pages, 59 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13206 2026-01-21 cs.AI 57%

Real-Time Deadlines Reveal Temporal Awareness Failures in LLM Strategic Dialogues

实时截止时间揭示了LLM战略对话中的时间意识失败

Neil K. R. Sehgal, Sharath Chandra Guntuku, Lyle Ungar

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究发现LLM在时间敏感任务中存在时间跟踪不足的问题,导致在实时截止条件下表现不佳,但能在回合制限制下表现良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13186 2026-01-21 cs.AI cs.MA 57%

Prompt Injection Mitigation with Agentic AI, Nested Learning, and AI Sustainability via Semantic Caching

通过语义缓存、嵌套学习和AI可持续性缓解提示注入

Diego Gosmar, Deborah A. Dahl

机构 * Head of AI, Tesisquare Member, Open Voice Interoperability Initiative Linux Foundation AI & Data Torino, Italy(AI负责人,Tesisquare成员,开放语音互操作性倡议Linux基金会AI与数据部门,意大利托里诺) Principal, Conversational Technologies Member, Open Voice Interoperability Initiative Linux Foundation AI & Data Plymouth Meeting, PA, USA(首席科学家,对话技术成员,开放语音互操作性倡议Linux基金会AI与数据部门,美国普利茅斯会议)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文通过语义缓存、嵌套学习和AI可持续性方法,提出了一种缓解提示注入的系统,实现安全、高效且环保的LLM部署。

Comments 33 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12974 2026-01-21 cs.CL 57%

Bridging the Knowledge-Action Gap by Evaluating LLMs in Dynamic Dental Clinical Scenarios

通过评估LLMs在动态牙科临床场景中弥合知识-行动鸿沟

Hongyang Ma, Tiantian Gu, Huaiyuan Sun, Huilin Zhu, Yongxin Wang, Jie Li, Wubin Sun, Zeliang Lian, Yinghong Zhou, Yi Gao, Shirui Wang, Zhihui Tang

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文通过SCMPE基准评估LLMs在动态牙科临床场景中的表现,发现其在动态对话中存在主动信息收集和状态跟踪的瓶颈,揭示了外部知识不足以弥补推理差距,需领域自适应预训练。

Comments 29 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12807 2026-01-21 cs.LG 57%

Semi-supervised Instruction Tuning for Large Language Models on Text-Attributed Graphs

大型语言模型在文本属性图上的半监督指令微调

Zixing Song, Irwin King

机构 * University of Bristol(布里斯托大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 SIT-Graph通过半监督指令微调提升文本属性图学习性能,实现低标签条件下20%以上的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12799 2026-01-21 cs.RO cs.CL cs.CV 57%

FRoM-W1: Towards General Humanoid Whole-Body Control with Language Instructions

FRoM-W1: 向通用人形机器人全身控制迈进:利用语言指令

Peng Li, Zihan Zhuang, Yangfan Gao, Yi Dong, Sixian Li, Changhao Jiang, Shihan Dou, Zhiheng Xi, Enyu Zhou, Jixuan Huang, Hui Li, Jingjing Gong, Xingjun Ma, Tao Gui, Zuxuan Wu, Qi Zhang, Xuanjing Huang, Yu-Gang Jiang, Xipeng Qiu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.CL

AI总结 FRoM-W1通过语言指令实现人形机器人全身控制,结合大规模语言模型和强化学习提升动作生成与执行能力。

Comments Project Page: https://openmoss.github.io/FRoM-W1

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12661 2026-01-21 cs.AI 57%

MedConsultBench: A Full-Cycle, Fine-Grained, Process-Aware Benchmark for Medical Consultation Agents

MedConsultBench: 一个完整周期、细粒度、过程感知的医疗咨询代理基准

Chuhan Qiao, Jianghua Huang, Daxing Zhao, Ziding Liu, Yanjun Shen, Bing Cheng, Wei Lin, Kai Wu

机构 * Meituan(美团)

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 MedConsultBench通过细粒度过程感知评估医疗咨询代理的完整咨询周期,揭示高诊断准确性背后的效率与安全问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12585 2026-01-21 cs.HC cs.AI cs.ET 57%

Do MLLMs See What We See? Analyzing Visualization Literacy Barriers in AI Systems

MLLMs是否看到我们看到的?分析AI系统中可视化素养障碍

Mengli, Duan, Yuhe, Jiang, Matthew Varona, Carolina Nobre

机构 * University of Toronto(多伦多大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本研究分析了MLLMs在可视化素养中的障碍,揭示了两种机器特定的障碍,并展示了模型在复杂可视化任务上的表现差异。

详情

展开后加载摘要…

URL PDF HTML 收藏