arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10472 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10472 篇

2607.27895 2026-07-31 cs.AI cs.CV 新提交 57%

MMHBench: A Multi-Perspective Benchmark for Mental Health Understanding in Long-Form Videos

MMHBench:用于长视频心理健康理解的多视角基准测试集

Jinpeng Hu, Erqiang Wang, Shan Wang, Zhuo Li, Peipei Song, Xun Yang, Meng Wang

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出MMHBench多视角心理健康理解基准,含268个长视频与2184条问题,采用MAQG框架生成问题,评估22个多模态大语言模型后发现该任务仍具挑战性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27877 2026-07-31 cs.AI cs.MA 新提交 57%

An Empirical Study of Coordination Mode as the First-Class Citizen in From-Scratch Multi-Agent Coding

从零开始多智能体编码中作为一等公民的协作模式的实证研究

Yanyu Ren, Yunfeng Bai, Xizheng Wang, Li Chen, Dan Li

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本研究构建多智能体编码基准MSEval,发现组织拓扑与模型能力对速度-成本-质量权衡影响相当,结构化流水线表现最优,为多智能体软件开发评估提供严格标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27826 2026-07-31 cs.AI cs.CV 新提交 57%

Sign Language Question Answering: A New Task, Benchmark, and Baseline for Sign Language Understanding

手语问答:手语理解的新任务、基准与基线模型

Shiwei Gan, Lichen Wang, Xiao Liu, Yafeng Yin, Kuizhuang Liu, Sanglu Lu, Lei Xie

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 该研究提出手语问答新任务,构建基于PHOENIX14T与CSL-Daily的SignQA基准,设计带特定模块的基线模型,实验显示其在各问题类别上优于代表性视觉-语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27556 2026-07-31 cs.AI cs.MA 新提交 57%

Evaluating Agentic Bioinformatics through Function, Evidence, and Validation

通过功能、证据和验证评估智能体生物信息学

Phuc Pham, Truong-Son Hy

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 该研究提出FEV框架评估智能体生物信息学,梳理多领域128篇文献后发现规划等进展快于科学验证相关环节,主张应基于工作流正确性评估这类系统

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27354 2026-07-31 cs.AI 新提交 57%

PAUSE: A User-Centric Benchmark for Personal AI Assistants in Unified Service Environments

PAUSE:统一服务环境中面向用户的个人AI助手基准测试

Haoyu Chen, Xirui Shi, Yuyao Wang, Jerry Chen, Di Niu

机构 * University of Alberta(阿尔伯塔大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究人员针对现有个人AI助手基准测试的缺陷,提出PAUSE基准测试,采用多机制评估框架,实验发现现有先进模型在相关场景任务完成率不足70%,还提出可扩展生成任务的合成流水线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19261 2026-07-31 cs.CV cs.AI 版本更新 57%

PathAgentBench: Benchmarking Evidence-Seeking Vision-Language Models on Whole-Slide Pathology Image

PathAgentBench:在全切片病理图像上对寻求证据的视觉语言模型进行基准测试

Dankai Liao, Tianyi Zhang, Yufeng Wu, Xinyue Zhang, Qiaochu Xue, Zeyu Liu, Dachun Zhao, Linghan Cai, Yueming Jin

机构 * National University of Singapore(新加坡国立大学) PuzzleLogic Pte Ltd(拼图逻辑私人有限公司) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳校区) Peking Union Medical College Hospital(北京协和医院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究针对全切片病理图像诊断中证据获取与整合问题,引入PathAgentBench基准,评估视觉语言模型的四项互补能力,包含多模型评估结果,揭示了证据推理与获取间的差距,为改进病理模型提供统一框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11015 2026-07-31 cs.AI 版本更新 57%

Numbers Beat Words: A Rigorous On-Premise Benchmark for Coupled MIMO Controller Tuning

从推理中获取结构,从搜索中获取数值:本地部署的开放大语言模型作为耦合MIMO控制器整定的结构先验

Yang Shu, Jiaxuan Chen, Haonan Li

机构 * Jinling Institute of Technology(金陵科技学院) College of Water Resources and Civil Engineering, China Agricultural University(中国农业大学水利与土木工程学院) Zhejiang University(浙江大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 针对强耦合MIMO过程,提出利用本地部署的开源大语言模型作为结构先验,通过推理耦合关系提出非对称结构,结合经典优化器实现样本高效且可解释的控制器整定。

Comments 17 pages, 7 figures, 6 tables. Substantially revised benchmark, analysis, and presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10579 2026-07-31 cs.CL 版本更新 57%

VISTA: A Controllable Platform for Generating and Auditing Egocentric Assistance Scenarios

VISTA:一种用于日常协助的生成性眼动视频框架

Yu-Hsiang Liu, Yu-Chien Tang, An-Zi Yen

机构 * Department of Computer Science, National Yang Ming Chiao Tung University(国立阳明交通大学计算机科学系)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 VISTA通过生成高保真眼动视频为AI代理提供训练和评估数据,支持从日常家务到紧急安全情况的主动协助,包含反应性和前瞻性干预模式,提供可定制的视频基准测试。

Comments pre-print

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10913 2026-07-31 cs.CL 版本更新 57%

LLM2Vec-Gen: Generative Embeddings from Large Language Models

LLM2Vec-Gen:从大型语言模型生成嵌入向量

Parishad BehnamGhader, Vaibhav Adlakha, Fabian David Schmidt, Nicolas Chapados, Marius Mosbach, Siva Reddy

机构 * McGill University(麦吉尔大学) Mila–Quebec AI Institute(米拉-魁北克人工智能研究所) ServiceNow Research(ServiceNow研究院) Cohere Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 LLM2Vec-Gen通过自监督学习生成大型语言模型的嵌入向量,无需微调,提升MTEB基准测试性能,并保留语义和推理能力。

Comments Accepted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14649 2026-07-31 cs.CL 版本更新 57%

GradMAP: Faster Layer Pruning with Gradient Metric and Projection Compensation

GradMAP: 更快的层剪枝与梯度度量和投影补偿

Hao Liu, Guangyan Li, Wensheng Zhang, Yongqiang Tang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 GradMAP通过梯度度量和投影补偿实现更快的层剪枝,提升剪枝效率和性能。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19982 2026-07-31 cs.CV cs.AI 版本更新 57%

EmoFeedback$^2$: Reinforcement of Continuous Emotional Image Generation via LVLM-based Reward and Textual Feedback

EmoFeedback$^2$:基于LVLM的奖励与文本反馈的连续情绪图像生成强化

Kai Shu, Jingyang Jia, Gang Yang, Long Xing, Xun Chen, Aiping Liu

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 EmoFeedback$^2$通过基于LVLM的奖励与文本反馈机制,提升连续情绪图像生成的质量与情绪保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04281 2026-07-31 cs.AI 版本更新 57%

RetiBridge: Bridging Quantitative Retinal Biomarkers and Qualitative Diagnosis with a Knowledge-Guided Multimodal Large Language Model

RetiBridge:用知识引导的多模态大语言模型连接定量视网膜生物标志物与定性诊断

Zhuangzhi Gao, Hongyi Qin, He Zhao, Qinkai Yu, Feixiang Zhou, Fu Wang, Jinru Ding, Eduard Shantsila, Uazman Alam, Alena Shantsila, Wahbi El-Bouri, Gregory Y. H. Lip, Yalin Zheng

机构 * University of Liverpool(利物浦大学) Institute of Life Course & Medical Sciences(生命课程与医学科学研究院) Department of Eye and Vision Sciences(眼科与视觉科学系) Computer Science Department(计算机科学系) Cardiovascular & Metabolic Medicine(心血管与代谢医学) Liverpool Centre for Cardiovascular Science(利物浦心血管科学中心)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 该研究提出RetiBridge模型,结合CFP、OCT数据与文本,通过知识引导微调学习定量到定性诊断路径,在眼科理解基准上表现优于开源基线及OpenAI o3,代码数据已公开。

Comments 10 pages, 4 figures, 3 table. Equal contribution: Zhuangzhi Gao and Hongyi Qin. Corresponding author: Yalin Zheng (yzheng@liverpool.ac.uk)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26367 2026-07-30 cs.AI 新提交 57%

Exploring Structures in Physics Problems: Can AI Agents Discover Statistical Mechanical Mappings?

探索物理问题中的结构:AI智能体能否发现统计力学映射?

Wanyu Zhao, Wanbing Zhao

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本研究以StatMechBench-v0为基准,评估基于LLM的“提出-验证-修正”智能体发现统计力学映射的能力,揭示其推理局限并提出验证栈的设计方向。

Comments Accepted to the AID-Wild workshop at CAIS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26339 2026-07-30 cs.LG cs.CR cs.IR 新提交 57%

RAGuard: A Layered Defense Framework for Retrieval-Augmented Generation Systems Against Data Poisoning

RAGuard:一种针对检索增强生成系统数据中毒的分层防御框架

Pushkal Kumar, Tucker Nielson, Tanish Kolhe, Shubham Zala, Vincent Li

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 该研究针对RAG系统的语料库中毒攻击,提出分层防御框架RAGuard,含对抗微调检索器与ZKIP两层,可将攻击成功率降至0,且保持检索性能,相关资源已开源。

Comments Accepted to NeurIPS ResponsibleFM 2025, AAAI FrontierIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26155 2026-07-30 cs.AI 新提交 57%

ClinLens: Towards Long-Horizon Coding Agents for Longitudinal Multimodal Clinical Data Science

ClinLens:面向纵向多模态临床数据科学的长周期编码智能体

Yuan Zhu, Ethan B. Liu, Frank Nie, Jindong Han

机构 * Shandong University(山东大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 该研究推出CLINLENS基准,包含200项基于5种MIMIC资源的临床可执行任务,实验显示现有编码智能体与生物医学系统在正确临床分析上存在显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02464 2026-07-30 cs.CL 版本更新 57%

Will Scaling Improve Social Simulation with LLMs?

扩展规模会改善基于LLM的社会模拟吗?

Caleb Ziems, William Held, Su Doga Karaca, David Grusky, Tatsunori Hashimoto, Diyi Yang

机构 * Stanford University(斯坦福大学) Open Athena(开放雅典娜)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 研究LLM规模扩展对社会模拟保真度的影响,发现多数任务随规模提升而改善,但存在例外,如纵向预测和低资源领域改进缓慢。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24155 2026-07-30 cs.CY cs.AI cs.HC 版本更新 57%

The Alignment Target Problem: Divergent Moral Judgments of Humans, AI Systems, and Their Designers

对齐目标问题:人类、人工智能系统及其设计者的道德判断分歧

Benjamin Minhao Chen, Xinyu Xie

机构 * The University of Hong Kong(香港大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究探讨了人类、AI系统及其设计者在道德判断上的差异,通过实验发现人类设计的AI行为会引发更强烈的道德约束,揭示了价值对齐的挑战。

Comments ACM FAccT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25992 2026-07-29 cs.DB cs.AI 新提交 57%

MemLens: A Value-Aware Memory Management System with Interactive Analytics for LLM-based Agents

MemLens:一种用于基于大语言模型的智能体的具有交互式分析的价值感知内存管理系统

Shuyue Wei, Chang Liu, Zimu Zhou, Yongxin Tong, Lizhen Cui

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究针对基于LLM的智能体内存管理问题,提出价值感知内存管理系统MemLens,通过端到端交互式分析仪表板展示内存生命周期,经学习助手应用程序帮助用户比较策略,可实现高效、可解释和个性化的长期内存管理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25891 2026-07-29 cs.AI cs.DB 新提交 57%

Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation

梅西耶:用于跨基准智能体评估的高分辨率语料库

Stefan Krsteski, Charlotte Meyer, Guillaume Allegre, Tony O'Halloran, Alexandre Sallinen

机构 * Andromede AI(仙女座人工智能公司)

专题命中 推理评测 :verifier(abstract);分类 cs.AI

AI总结 研究针对智能体评估中任务等碎片化问题,引入梅西耶语料库,整合多基准、智能体、任务和验证器等信息,标准化记录并分类。通过该语料库发现基准进展不均衡,指出多验证器任务评分问题,得出能力量表,为智能体评估提供基础可复用设施。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25420 2026-07-29 cs.IR cs.AI 新提交 57%

MARS: Multi-Agent Re-ranking for Repeat-Order Food Delivery Recommendation

MARS:用于重复订单食品配送推荐的多智能体重排

Jiahao Tian, Zhenkai Wang

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究针对重复订单食品配送推荐,提出MARS模块化多智能体重排框架,分两阶段推荐,结合多种信号与推理。通过实验评估,贡献包括给出集成框架、证明预训练主干结合轻量级检索有竞争力、建立可重现评估设置。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24856 2026-07-29 cs.CV cs.AI 新提交 57%

DisasterTD: Disaster Toponym Disambiguation Using Multimodal LLMs and Cross-View Geolocalization

DisasterTD:使用多模态大语言模型和跨视角地理定位的灾害地名消歧

Wenping Yin, Ziqi Liu, Naixia Mou, Weijia Li, Danfeng Hong, Hao Li

机构 * College of Geodesy and Geomatics, Shandong University of Science and Technology(山东科技大学测绘与地理信息学院) School of Environmental Science and Spatial Informatics, China University of Mining and Technology(中国矿业大学环境与测绘学院) State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing, Wuhan University(武汉大学测绘遥感信息工程国家重点实验室) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) School of Automation, Southeast University(东南大学自动化学院) Department of Geography, National University of Singapore(新加坡国立大学地理系)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究针对社交媒体图像地理参考模糊问题,提出DisasterTD框架,集成多模态大语言模型语义推理与跨视角地理定位,在飓风哈维数据集上评估,该方法优于基线,能有效进行细粒度灾害地理定位,提升不同距离下的定位准确率并减少误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24810 2026-07-29 cs.AI eess.IV 新提交 57%

RRS-10K: A Multitask Vision-Language Model Benchmark for Rare Remote Sensing Image Interpretation

RRS-10K:用于罕见遥感图像解释的多任务视觉语言模型基准测试

Yuqiao Lai, Jiancheng Qi, Fei Wang, Yuxin Liu, Kun Li, Ye Chen, Yan Gao, Yanyan Wei

机构 * Laboratory of Intelligent Language Processing, National University of Defense Technology(国防科技大学智能语言处理实验室) Hefei University of Technology(合肥工业大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院) United Arab Emirates University(阿联酋大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 针对视觉语言模型在罕见遥感图像解释能力不足的问题,提出RRS-10K基准测试,含军事遥感图像及问答对,构建时引入干扰项过滤策略,评估多个模型,揭示其性能弱点,为开发更可靠的遥感视觉语言模型提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08285 2026-07-29 cs.AI 版本更新 57%

Psychological Competence as a Missing Dimension in AI Evaluation

心理能力作为人工智能评估中缺失的维度

Marcos Economides, Paul M. Sacher, Samuel Salzer, Alexis Michelle Abellar, Fendi Tsim, Antoine Ferrère

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究指出当前人工智能评估框架对面向人类的系统不足,引入心理能力这一缺失维度,借鉴多领域研究概述其概念框架,定义结构、阐明边界并说明评估方式,强调其应成为多方关注的核心考量。

Comments 12 pages, 3 figures. LaTeX source added to enable accessible HTML; minor wording and typesetting revisions

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24707 2026-07-28 cs.AI cs.CV cs.DB 新提交 57%

ERUnderstand: Evaluating Vision-Language Models on Structured ER Diagrams

ERUnderstand:在结构化实体关系图上评估视觉语言模型

Ali Ansari, Yasmin Mohammadi, Farnoush Nili, Parsa Esmaeilkhani, Longin Jan Latecki, Eduard Dragut

机构 * Temple University(天普大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究针对实体关系图仅为图像限制AI辅助数据库工程的问题,引入ERUnderstand基准测试。通过对2960个图表及标准化表示评估视觉语言模型,发现常见元素恢复良好,但特定元素性能差,推理增强模型可提升性能,为评估多模态理解提供基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24625 2026-07-28 cs.CR cs.AI 新提交 57%

Agentic Permissions Policy Algebra for Taint Confinement in LLM Agents

用于大语言模型代理中污点限制的代理权限策略代数

Arseny Kravchenko, Vadim Liventsev, Innokentii Konstantinov, Ildar Iskhakov, Matvey Kukuy

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究大语言模型代理处理混合机密数据时的安全风险,提出APPA框架,通过引擎管理上下文分支等解决可用性瓶颈,经双幺半群模型证明相关特性,实验表明其能抑制数据泄露并恢复部分被污点跟踪损失的效用。

Comments Preprint. Submitted to the 19th ACM Workshop on Artificial Intelligence and Security (AISec '26). 10 pages, 2 tables, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24273 2026-07-28 cs.CL 新提交 57%

INS-ActBench: A Comprehensive Benchmark for Assessing Professional Actuarial Capability of Large Language Models

INS-ActBench:一个用于评估大语言模型专业精算能力的综合基准

Changyu Chen, Chenwei Lin, Xian Xu

机构 * Fudan University(复旦大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 介绍INS-ActBench这一综合基准评估大语言模型专业精算能力,含12050个问答对及三个子集,通过实验揭示前沿大语言模型在不同方面的能力表现,为精算大语言模型开发提供可重复基础。

Comments 18 pages, including appendices; 11 figures and 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24054 2026-07-28 cs.AI 新提交 57%

Success Is Not Self-Explanatory: Auditing Success Provenance in Agent Evaluation

成功并非不言自明:在智能体评估中审核成功溯源

Jingkun Luo, Da-Tian Peng

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究智能体评估中成功溯源问题,通过AcquaBench的匹配值替换和聚类分析审核,在不同场景测试,发现成功与正确值相关,行为依赖可能超出预期,模型比较有分数差距变化,建议基准报告成功及信息状态支持情况。

Comments 17 pages, 3 figures, including supplementary material. Code: https://github.com/luojingkun22/acquabench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23386 2026-07-28 cs.AI 新提交 57%

Confidently Wrong: Exception Chain Collapse in Frontier LLM Rule Evaluation

确信错误:前沿大语言模型规则评估中的异常链崩溃

Paul Simpson, John Kozak, Lisa Doake

机构 * Aethis

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究前沿大语言模型在规则评估中异常链崩溃问题,提出神经符号架构Aethis资格模块,通过多方面验证,将不确定性从推理边界转移到规范边界,且相关内容公开可重现。

Comments 43 pages, 9 figures. Working paper v3.13.0. Benchmark data, rule encodings and per-case result artefacts: https://github.com/Aethis-ai/confidently-wrong-benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23123 2026-07-28 cs.AI 新提交 57%

SQBench: A Benchmark for Evaluating Task Delivery by Language-Model Agents in Production-Oriented Workflows

SQBench:用于评估面向生产工作流程中语言模型代理任务交付的基准测试

Summer Sun

机构 * Shaqiu Community(沙丘社区)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究面向生产工作流程中语言模型代理任务交付评估问题,核心方法是引入SQBench基准测试,包含多种任务并按特定方式评估,主要贡献是揭示功能完成度不能完全体现交付质量,风险判定需单独报告。

Comments 17 pages, 8 figures. Code and aggregate results: https://github.com/shaqiu-ai/SQBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22600 2026-07-28 cs.AI 新提交 57%

Chart Deception in Vision-Language Models: From Vulnerability to Mitigation

视觉语言模型中的图表欺骗:从漏洞到缓解

Ridwan Mahbub, Mohammed Saidul Islam, Md Tahmid Rahman Laskar, Mizanur Rahman, Mir Tafseer Nayeem, Enamul Hoque

机构 * York University(约克大学) University of Alberta(阿尔伯塔大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究视觉语言模型对图表欺骗的鲁棒性,引入VisDeception基准和欺骗分数,发现模型易受影响,提出推理时多智能体缓解框架,揭示可靠性差距,确立相关评估及推理方向以开发更可信的视觉分析VLM。

详情

展开后加载摘要…

URL PDF HTML 收藏