arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10577 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10577 篇

2605.26102 2026-06-02 cs.CV 50%

InstructSAM: Segment Any Instance with Any Instructions

InstructSAM: 根据任意指令分割任意实例

Yuqian Yuan, Wentong Li, Zhaocheng Li, Yutong Lin, Juncheng Li, Siliang Tang, Jun Xiao, Yueting Zhuang, Wenqiao Zhang

机构 * Zhejiang University(浙江大学) Nanjing University of Aeronautics and Astronautics(南京航空航天大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 提出InstructSAM框架,通过将指令驱动实例分割建模为集合结构查询预测问题,并设计显式推理到实例查询接口,结合视觉语言模型和SAM3实现单次前向传播中的多实例分割。

Comments 19 pages, 8 figures, code: https://github.com/DCDmllm/InstructSAM

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01009 2026-06-02 cs.CV cs.MM 50%

POVQA: Preference-Optimized Video Question Answering with Rationales for Data Efficiency

POVQA: 基于偏好的视频问答与数据效率的推理

Ashim Dahal, Ankit Ghimire, Saydul Akbar Murad, Nick Rahimi

机构 * University of Southern Mississippi(密西根州立大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 提出POVQA方法,通过时间池化压缩视频帧、监督微调加偏好优化,在长视频问答中实现数据高效推理。

Comments Accepted in MAR at CVPR Workshop (Proceedings Track)

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Workshops, 2026, pp. 11533-11542

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02558 2026-06-02 cs.IR 50%

Lighting the Way for BRIGHT: Reproducible Baselines with Anserini, Pyserini, and RankLLM

为BRIGHT照亮道路:基于Anserini、Pyserini和RankLLM的可复现基线

Sahel Sharifymoghaddam, Yijun Ge, Jimmy Lin

专题命中 推理评测 :reasoning(abstract)

AI总结 本研究系统评估了面向推理的检索基准BRIGHT,通过集成到Anserini、Pyserini和RankLLM中的强基线方法,发现查询端BM25(BM25Q)在长查询下优于标准BM25,并揭示了数据质量问题及融合策略的泛化性。

Comments SIGIR 2026 Reproducibility Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31066 2026-06-01 cs.RO 50%

Can Aerial VLA Models Cooperate? Evaluating Closed-Loop Air-Ground Coordination with CARLA-Air

空中VLA模型能协作吗?基于CARLA-Air的闭环空地协调评估

Tianle Zeng, Yanci Wen, Xueang Yu, Hong Zhang

机构 * Southern University of Science and Technology(南方科技大学) Fudan University(复旦大学)

专题命中 推理评测 :planning(abstract)

AI总结 本文通过构建CARLA-Air仿真环境,评估空中视觉-语言-动作模型在空地协作任务中的表现,发现当前模型难以将单智能体能力转化为稳定协作行为,并指出零样本协作需要伙伴状态显式感知、低延迟动作协调和团队目标对齐三个关键组件。

Comments Code at https://github.com/louiszengCN/CarlaAir

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30346 2026-05-29 cs.CV 50%

YoCausal: How Far is Video Generation from World Model? A Causality Perspective

YoCausal: 视频生成距离世界模型还有多远?一个因果视角

You-Zhe Xie, Yu-Hsuan Li, Jie-Ying Lee, Kaipeng Zhang, Yu-Lun Liu, Zhixiang Wang

机构 * National Yang Ming Chiao Tung University Shanda AI Research Tokyo

专题命中 推理评测 :reasoning(abstract)

AI总结 提出YoCausal基准,通过时间反转真实视频生成反事实样本,利用反向惊奇指数(RSI)和因果认知指数(CCI)评估视频扩散模型的因果理解能力,发现模型感知时间方向不等于理解因果关系,与人类水平存在显著差距。

Comments Project page: https://www.youzhexie.me/papers/YoCausal/index.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29954 2026-05-29 cs.CV 50%

SwInception -- Local Attention Meets Convolutions

SwInception -- 局部注意力与卷积的结合

David Hagerman, Roman Naeem, Jakob Lindqvist, Carl Lindström, Fredrik Kahl, Lennart Svensson

机构 * Chalmers University of technology(查尔姆斯理工大学) Zenseact(Zenseact公司)

专题命中 推理评测 :reasoning(abstract)

AI总结 提出SwInception架构,通过在Swin Transformer的前馈层引入Inception块增强归纳偏置,并改进解码器以更少参数捕捉细节,在多个医学数据集上提升分割性能。

Comments International Conference on Pattern Recognition and Artificial Intelligence, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27976 2026-05-28 cs.SD 50%

VoiceGiraffe: A Benchmark for Extreme Long-Context Audio-Language Understanding

VoiceGiraffe: 极端长上下文音频-语言理解的基准

Jashin Ye, Dongxiao Wang, Yixuan Ye, Sashuai Zhou, Weihuang Lin, Mingyang Han, Kunpeng Wang, Zeyu Yuan, Boyu Li, Haoxiang Shi, Jingchen Shu, Jun Song, Bo Zheng

机构 * Future Living Lab(未来生活实验室) Alibaba(阿里巴巴)

专题命中 推理评测 :reasoning(abstract)

AI总结 提出VoiceGiraffe基准,通过1500个三元组和双层分类法评估大音频语言模型在长上下文场景下的单跳感知与多跳推理能力,揭示模型在长距离记忆持久性上的瓶颈。

Comments Benchmark Project: https://github.com/LivingFutureLab/VoiceGiraffe

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27761 2026-05-28 cs.CV cs.SE 50%

AndroidDaily: A Verifiable Benchmark for Mobile GUI Agents on Real-World Closed-Source Applications

AndroidDaily: 面向真实世界闭源应用的可验证移动GUI智能体基准

Yifan Sui, Xin Huang, Hongbing Li, Fang Xu, Jiahe Lv, Haolong Yan, Yeqing Shen, Litao Liu, Zhimin Fan, Ziyang Meng, Jia Wang, Junbo Qi, Kaijun Tan, Zheng Ge, Xiangyu Zhang, Daxin Jiang, Osamu Yoshie

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) StepFun Waseda University(早稻田大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 针对闭源应用无法获取内部状态导致自动验证困难的问题,提出AndroidDaily基准(350个日常任务)和GRADE评估器(基于可观察外部指南的三层系统),实现无需内部状态的可验证评估,最强模型成功率为62.0%。

Comments 11 pages, 6 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09301 2026-05-28 q-fin.PM 50%

Constructing a Portfolio Optimization Benchmark Framework for Evaluating Large Language Models

构建用于评估大语言模型的投资组合优化基准框架

Hanyong Cho, Jang Ho Kim

专题命中 推理评测 :reasoning(abstract)

AI总结 本研究提出一个基准框架,通过具有数学显式解的投资组合优化问题评估大语言模型的金融决策能力,实验显示GPT-4在基于风险的目标上表现最佳,而Llama 3.1-70B整体性能最低。

Comments Poster presented at the AI for Finance Symposium '25, The 6th ACM International Conference on AI in Finance (ICAIF '25)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09580 2026-05-28 cs.CR 50%

AICrypto: Evaluating Cryptography Capabilities of Large Language Models

AICrypto:评估大型语言模型的密码学能力

Yu Wang, Yijian Liu, Liheng Ji, Han Luo, Wenjie Li, Xiaofei Zhou, Chiyun Feng, Puji Wang, Yuhan Cao, Geyuan Zhang, Xiaojian Li, Rongwu Xu, Yilei Chen, Tianxing He

专题命中 推理评测 :reasoning(abstract)

AI总结 构建AICrypto基准测试,通过多项选择题、夺旗挑战和证明题评估LLM在密码学知识记忆、漏洞利用和形式推理方面的能力,发现最先进模型在常规任务上匹配或超越人类专家,但在抽象概念理解和多步推理上仍有不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04876 2026-05-28 cs.SD 50%

ChronosAudio: A Comprehensive Long-Audio Benchmark for Evaluating Audio-Large Language Models

ChronosAudio: 用于评估音频大语言模型的综合长音频基准

Kaiwen Luo, Liang Lin, Yibo Zhang, Moayad Aloqaily, Jialiang Tao, Dexian Wang, Zhenhong Zhou, Junwei Zhang, Kun Wang, Li Sun, Qingsong Wen

机构 * Nanyang Technological University(南洋理工大学) Independent Researcher(独立研究者) United Arab Emirates University(阿联酋大学) North China Electric Power University(华北电力大学) Southwest Jiaotong University(西南交通大学) Squirrel AI Learning(Squirrel AI学习)

专题命中 推理评测 :reasoning(abstract)

AI总结 提出首个针对音频大语言模型长音频理解的多任务基准ChronosAudio,包含6大任务类别和36000个测试实例,实验发现模型存在长上下文崩溃、注意力稀释等问题,现有缓解策略仅恢复50%性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27074 2026-05-27 cs.CV 50%

IPIBench: Evaluating Interactive Proactive Intelligence of MLLMs under Continuous Streams

IPIBench: 在连续流下评估多模态大模型的交互式主动智能

Jinzhao Li, Yinuo Chen, Wenxuan Song, Yijia Lei, Yichi Zhang, Honglei Yan, Panwang Pan, Miao Liu

机构 * College of AI, Tsinghua University(清华大学人工智能学院) ByteDance(字节跳动)

专题命中 推理评测 :reasoning(abstract)

AI总结 提出IPIBench基准,用于评估多模态大模型在流式视频场景中的交互式主动智能,并设计IPI-Agent框架以改善主动触发和交互协调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26539 2026-05-27 cs.SE cs.CR 50%

FuzzPilot: Plateau-Triggered Recipe Validation for Structured Text Fuzzing

FuzzPilot: 用于结构化文本模糊测试的高原触发式配方验证

Zhiyi Yao

专题命中 推理评测 :reasoning(abstract)

AI总结 FuzzPilot 通过高原触发式配方验证,在覆盖率停滞时利用快照和微测试评估变异配方,以提升 AFL++ 的模糊测试效率。

Comments 41 pages, 7 figures, 7 tables. Preliminary cJSON-only evaluation (N=5 main, N=3 ablation; descriptive statistics, no significance claims). Code and 25-run artifacts at https://github.com/Qiao-Zhiyi/fuzz_agent (tag paper01-arxiv-v1). Venue-version Stage-1 pilot on libxml2, sqlite3, openssl_x509 currently in flight; v2 will report those results

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16578 2026-05-27 cs.RO cs.SY eess.SY 50%

Zero-Shot MARL Benchmark in the Cyber-Physical Mobility Lab

Cyber-Physical Mobility Lab中的零样本多智能体强化学习基准测试

Julius Beerwerth, Jianye Xu, Simon Schäfer, Fynn Belderink, Bassam Alrifaee

机构 * Cyber-Physical Mobility Lab(智能物理移动实验室) University of the Bundeswehr Munich(联邦国防军大学慕尼黑) RWTH Aachen University(亚琛工业大学)

专题命中 推理评测 :planning(abstract)

AI总结 本文基于Cyber-Physical Mobility Lab构建了一个可复现的基准测试平台,用于评估联网自动驾驶汽车多智能体强化学习策略的仿真到现实迁移,并揭示了性能下降的两个互补来源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25357 2026-05-26 cs.CV cs.MA 50%

Towards Reliable Fetal Ultrasound Interpretation with Multi-Agent Collaboration

面向可靠胎儿超声解读的多智能体协作

Xiaotian Hu, Mingxuan Liu, Junwei Huang, Kasidit Anmahapong, Yifei Chen, Yiming Huang, Xuguang Bai, Zihan Li, Hongjia Yang, Yingqi Hao, Hong Xu, Yu Jiang, Tian Tian, Yi Liao, Haibo Qu, Qiyuan Tian

机构 * Tsinghua University(清华大学) University of California San Diego(加州大学圣地亚哥分校) West China Second University Hospital, Sichuan University(四川大学西昌医学院)

专题命中 推理评测 :reasoning(abstract)

AI总结 提出FetUSAgents多智能体系统,通过协作LLM代理和双路径证据仲裁(DPEA)整合视觉工具与临床推理,在胎儿超声VQA、报告生成等任务上超越最强基线25%以上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25343 2026-05-26 cs.CV 50%

Toward Native Multimodal Modeling: A Roadmap

迈向原生多模态建模:路线图

Siyu An, Junru Lu, Junnan Dong, Qiufeng Wang, Yinghui Li, Weizhi Fei, Zichao Yu, Zheng Yuan, Biao Liu, Haopeng Wang, Renzhao Liang, Yixuan Yang, Yunhang Shen, Bo Ke, Keyu Chen, Linhao Luo, Difan Zou, Xiao Huang, Di Yin, Ruizhi Qiao, Xing Sun

机构 * Tencent Youtu Lab(腾讯优图实验室) Tsinghua University(清华大学) The University of Hong Kong(香港大学) University of Warwick(沃林汉大学) Monash University(墨尔本大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出从非原生多模态范式向原生多模态建模(NMM)过渡的正式路线图,通过输入-输出二元性分类现有模型,并系统探讨架构协调、数据整理、训练推理及评估的全栈工业级方案。

Comments 52 pages, 5 figures, 3 tables, ~300 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25296 2026-05-26 cs.HC 50%

Subjective Code Preferences in Experts and Large Language Models

专家与大型语言模型中的主观代码偏好

Anna Mokhova, Subhabrata Dutta, Iryna Gurevych, Simone Balloccu

专题命中 推理评测 :reasoning(abstract)

AI总结 通过收集约3000对Python代码片段并由73位专家评分,研究LLM在四个主观偏好轴(复杂度、注释、模块化、可读性)上的表现,发现模型在自然语言与代码评估中存在不一致,且表现出位置偏差和极化评分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25273 2026-05-26 cs.CY 50%

LLM-as-a-Judge in Healthcare: A Scoping Analysis of Applications, Methods, and Human Alignment

LLM-as-a-Judge 在医疗保健中的应用:应用、方法和人类一致性的范围分析

Lingyao Li, Deyi Li, Chen Chen, Renkai Ma, Runlong Yu, Mingquan Lin, Rui Yin, Lizhou Fan, Cathy Shyr, Siyuan Ma, Mei Liu, Steven Bethard

专题命中 推理评测 :reasoning(abstract)

AI总结 本研究通过PRISMA指导的系统综述,分析了LLM-as-a-Judge在医疗保健中的应用场景、技术配置和与人类专家判断的一致性,发现其在临床决策支持、自然语言处理等领域有广泛应用,但可靠性因任务而异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09658 2026-05-26 cs.CV 50%

Measuring Epistemic Humility in Multimodal Large Language Models

测量多模态大语言模型中的认知谦逊

Bingkui Tong, Jiaer Xia, Sifeng Shang, Kaiyang Zhou

机构 * Mohamed bin Zayed University of Artificial Intelligence(Mohamed bin Zayed人工智能大学) Hong Kong Baptist University(香港 Baptist大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 提出HumbleBench基准,通过强制选择多项选择中引入“以上皆非”选项,评估多模态大语言模型拒绝错误选项的谦逊行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25039 2026-05-26 cs.CV 50%

AstroRAG -- A Pagerank-Based Retrieval-Augmented Generation Pipeline for Question Answering in Astronomy

AstroRAG -- 一种基于PageRank的检索增强生成管道用于天文学问答

Zhifeng Wang, Jason Jingshi Li, Kaihao Zhang, Ramesh Sankaranarayana

机构 * Australian National University(澳大利亚国立大学) Learning Machines Pty Ltd

专题命中 推理评测 :reasoning(abstract)

AI总结 提出AstroRAG,一种基于PageRank的检索增强生成管道,通过两阶段检索(MMR和PR重排序)在严格token预算下选择紧凑互支持的上下文,无需训练且保护隐私,在天文学QA基准上使Mistral-7B准确率和F1分数达到79.49%,性能近乎翻倍。

Comments Accepted to IEEE CAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24322 2026-05-26 cs.CV 50%

Causal Physics Steering in Video World Models via Concept Activation Vectors

通过概念激活向量在视频世界模型中进行因果物理引导

Nahid Alam

机构 * Oreon Labs(Oreon实验室) Cohere Labs Community(Cohere实验室社区)

专题命中 推理评测 :reasoning(abstract)

AI总结 提出一种无需训练的方法,利用物理涌现区(PEZ)的概念激活向量(CAV)在推理时引导视频模型的物理期望,无需修改模型权重。

Comments In proceedings of CVPR 2026 workshop on Video World Model

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23465 2026-05-25 cs.CY 50%

IyàwóBench: A Benchmark for Evaluating Large Language Model Clinical Triage Accuracy on Undifferentiated Febrile Illness in Nigerian Primary Health Settings

IyàwóBench: 评估大型语言模型在尼日利亚初级卫生机构中对未分化发热性疾病的临床分诊准确性的基准

Anthonio Oladimeji Gabriel, Dimeji Abdulsobur Olawuyi, Oloruntoba Ajayi, Temiloluwa Aderemi

专题命中 推理评测 :reasoning(abstract)

AI总结 针对西非初级卫生机构中未分化发热性疾病,构建了基于真实患者数据的合成临床病例基准IyàwóBench,评估六种LLM的分诊准确性和安全性,发现所有模型安全性达100%但准确性差异大,嵌入WHO指南的临床工程系统表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01018 2026-05-25 cs.CV 50%

WildTableBench: Benchmarking Multimodal Foundation Models on Table Understanding In the Wild

WildTableBench:在真实场景中评估多模态基础模型的表格理解能力

Junzhe Huang, Xiaoxiao Sun, Yan Yang, Yuxuan Hou, Ruotian Zhang, Sirui Li, Hehe Fan, Serena Yeung-Levy, Xin Yu

机构 * The University of Queensland(昆士兰大学) Stanford University(斯坦福大学) The Australian National University(澳大利亚国立大学) Zhejiang University(浙江大学) Murdoch University(莫纳什大学) The University of Adelaide(阿德莱德大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 提出WildTableBench基准,包含402张真实场景表格图像和928个问答对,评估21个前沿多模态模型,仅一个模型准确率超50%,揭示模型在结构感知和推理方面的持续弱点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03070 2026-05-25 eess.SY cs.SE cs.SY 50%

ProOPF: Benchmarking and Improving LLMs for Professional-Grade Power Systems Optimization Modeling

ProOPF: 面向专业级电力系统优化建模的大语言模型基准测试与改进

Chao Shen, Zihan Guo, Xu Wan, Zhenghao Yang, Yifan Zhang, Wengi Huang, Jie Song, Zongyan Zhang, Mingyang Sun

专题命中 推理评测 :reasoning(abstract)

AI总结 针对电力系统优化建模中自动化翻译自然语言需求为可执行优化模型的问题,本文提出专业级最优潮流数据集ProOPF-D和基准ProOPF-B,用于评估和改进大语言模型在专业级OPF建模中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22811 2026-05-22 cs.DB 50%

GS-QA: A Benchmark for Geospatial Question Answering

GS-QA:一个地理空间问答的基准测试

Majid Saeedan, Muhammad Shihab Rashid, Ahmed Eldawy, Vagelis Hristidis

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出GS-QA基准测试,用于评估地理空间问答系统,通过结合多个来源的信息,涵盖广泛的空间对象、谓词和答案类型,展示了现有方法在处理复杂空间谓词和多源推理时的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22366 2026-05-22 cs.CV 50%

AgroTools: A Benchmark for Tool-Augmented Multimodal Agents in Agriculture

AgroTools: 一个用于农业中增强工具的多模态代理基准

Zi Ye, Yibin Wen, Xiaoya Fan, Xinyu Zhang, Jing Wu, Kun Zeng, Zurong Mai, Jiarui Zhang, Bohan Shi, Juepeng Zheng, Jianxi Huang, Yutong Lu, Haohuan Fu

机构 * Sun Yat-Sen University(中山大学) Southwest University(西南大学) Northeastern University(东北大学) National Supercomputing Center in Shenzhen(深圳国家超算中心) Southwest Jiaotong University(西南交通大学) China Agricultural University(中国农业大学) Tsinghua University(清华大学)

专题命中 推理评测 :planning(abstract)

AI总结 本文提出AgroTools基准,用于评估农业中增强工具的多模态代理,通过539个问题-答案实例和1097张异构农业图像,评估模型在工具使用中的执行质量和任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28177 2026-05-22 cs.CV cs.CY 50%

AEGIS: A Holistic Benchmark for Evaluating Forensic Analysis of AI-Generated Academic Images

AEGIS:一个评估人工智能生成学术图像取证分析的综合基准

Bo Zhang, Tzu-Yen Ma, Zichen Tang, Junpeng Ding, Zirui Wang, Yizhuo Zhao, Peilin Gao, Zijie Xi, Zixin Ding, Haiyang Sun, Haocheng Gao, Yuan Liu, Liangjia Wang, Yiling Huang, Yujie Wang, Yuyue Zhang, Ronghui Xi, Yuanze Li, Jiacheng Liu, Zhongjun Yang, Haihong E

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出AEGIS基准,通过七个学术类别和39个细粒度子类型覆盖,揭示了人工智能生成学术图像取证分析的内在难度,同时评估了多种模型在检测、推理和定位方面的性能,揭示了不同模型家族的互补优势。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22068 2026-05-22 cs.CV 50%

COCOTree: A Dataset and Benchmark for Open Tree-Structured Visual Decomposition

COCOTree: 一个用于开放树状视觉分解的数据集和基准

Junhyub Lee, Seunghun Chae, Hyosu Kim

机构 * Chung-Ang University(Chung-Ang大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出COCOTree数据集和基准,通过自动化生成管道和开放词汇空间,实现了对复杂物理组装的长尾分布的捕捉,并提出了Open Tree Quality (OTQ)评估指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21882 2026-05-22 cs.CV 50%

Thermo-VL: Extending Vision-Language Models to Thermal Infrared Perception

Thermo-VL:扩展视觉语言模型以适应热红外感知

Rusiru Thushara, Yasiru Ranasinghe, Jay Paranjape, Vishal M. Patel

机构 * Department of Electrical & Computer Engineering, Johns Hopkins University(约翰霍普金斯大学电气与计算机工程系)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出Thermo-VL,一种基于热红外感知的视觉语言模型,通过引入可训练的热编码器和文本引导的双注意力融合模块,提升了低光照条件下的多光谱融合能力,并在热红外和RGB+热红外推理任务中取得显著成果。

Comments 18 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21642 2026-05-22 cs.CV 50%

Ablate-to-Validate: Are Vision-Language Models Really Using Continuous Thought Tokens?

Ablate-to-Validate: 视觉语言模型真的在使用连续思维令牌吗?

Tianyi Zhang, Mahtab Bigverdi, Ranjay Krishna

机构 * University of Washington(华盛顿大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出了一种诊断原则Ablate-to-Validate,通过Token Replacement Test(TRT)测试视觉语言模型是否真正利用了连续令牌内容,发现模型性能提升可能并非源于令牌内容,而是令牌存在本身。

详情

展开后加载摘要…

URL PDF HTML 收藏