arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-15 至 2025-12-15 共收录 30 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 30 篇

2502.18581 2025-12-15 cs.CL cs.AI cs.LG 90%

Scalable Best-of-N Selection for Large Language Models via Self-Certainty

通过自我确定性实现大规模语言模型的可扩展最佳-N选择

Zhewei Kang, Xuandong Zhao, Dawn Song

机构 * UC Berkeley(伯克利大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出自我确定性方法,通过利用LLM输出的概率分布,高效提升大规模语言模型的推理能力,适用于多种推理任务和开放性生成场景。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02925 2025-12-15 cs.LG cs.CL q-bio.BM 90%

Large Language Model Agent for Modular Task Execution in Drug Discovery

用于药物发现模块化任务执行的大型语言模型代理

Janghoon Ock, Radheesh Sharma Meda, Srivathsan Badrinarayanan, Neha S. Aluru, Achuth Chandrasekhar, Amir Barati Farimani

机构 * Department of Chemical Engineering, Carnegie Mellon University(化学工程系,卡内基梅隆大学) Department of Material Science and Engineering, Carnegie Mellon University(材料科学与工程系,卡内基梅隆大学) Department of Mechanical Engineering, Carnegie Mellon University(机械工程系,卡内基梅隆大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

AI总结 本文提出了一种基于大型语言模型的模块化框架,用于药物发现中的任务执行,通过自动化分子生成和属性预测提升药物筛选效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.00900 2025-12-15 cs.AI cs.CL 89%

From Next-Token to Mathematics: The Learning Dynamics of Mathematical Reasoning in Language Models

从单个词到数学:语言模型中数学推理学习动态

Shubhra Mishra, Gabriel Poesia, Noah D. Goodman

机构 * Department of Computer Science 1 and Psychology 2(计算机科学系和心理学系) Stanford University(斯坦福大学)

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract);large language model(abstract);instruction tuning(abstract)

AI总结 本研究分析了语言模型在预训练和后训练过程中数学推理能力的发展,揭示了数学技能学习顺序与课程设计的相关性,并探讨了指令微调对不同数学技能的影响。

Comments Accepted to COLM 2025. Dataset and code: https://github.com/gpoesia/mathcamps/

Journal ref Conference on Language Modeling (COLM), Montreal, Canada, October 7-10, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07299 2025-12-15 cs.CV 86%

VADER: Towards Causal Video Anomaly Understanding with Relation-Aware Large Language Models

VADER:基于关系感知大型语言模型的因果视频异常理解

Ying Cheng, Yu-Ho Lin, Min-Hung Chen, Fu-En Yang, Shang-Hong Lai

机构 * National Tsing Hua University(清华大学) NVIDIA

专题命中 推理与问题求解 :large language model(title);language model(title);LLM(abstract)

AI总结 VADER通过整合关系感知的大型语言模型与视频关键帧特征,提升视频异常的因果理解与解释能力。

Comments Accepted to WACV 2026. Project page available at: https://vader-vau.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11421 2025-12-15 cs.AI 85%

Towards Trustworthy Multi-Turn LLM Agents via Behavioral Guidance

通过行为指导实现可信的多轮大语言模型代理

Gonca Gürsun

机构 * Gonca Gürsun(独立研究者)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种框架,通过行为指导使大语言模型代理在多轮任务中实现可靠和可验证的行为。

Comments Accepted to AAAI 2026 Workshop on Trust and Control in Agentic AI (TrustAgent)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10978 2025-12-15 q-bio.NC cs.AI 85%

Cognitive Mirrors: Exploring the Diverse Functional Roles of Attention Heads in LLM Reasoning

认知镜像:探索大语言模型推理中注意力头的多样化功能角色

Xueqi Ma, Jun Wang, Yanbei Jiang, Sarah Monazam Erfani, Tongliang Liu, James Bailey

机构 * The University of Melbourne(墨尔本大学) The University of Sydney(悉尼大学) Amazon(亚马逊公司)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出认知镜像框架,通过CogQA数据集分析LLM中注意力头的功能专业化,揭示其在推理任务中的关键作用。

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11143 2025-12-15 cs.CR 85%

Automated Penetration Testing with LLM Agents and Classical Planning

基于LLM代理和经典规划的自动化渗透测试

Lingzhi Wang, Xinyi Shi, Ziyu Li, Yi Jiang, Shiyu Tan, Yuhao Jiang, Junjie Cheng, Wenyuan Chen, Xiangmin Shen, Zhenyuan LI, Yan Chen

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出CHECKMATE框架,结合增强的经典规划与LLM代理,提升渗透测试能力、稳定性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05943 2025-12-15 cs.AI 79%

TRACE: A Framework for Analyzing and Enhancing Stepwise Reasoning in Vision-Language Models

TRACE:一种用于分析和增强视觉-语言模型逐步推理的框架

Shima Imani, Seungwhan Moon, Lambert Mathias, Lu Zhang, Babak Damavandi

机构 * Meta Reality Lab(Meta现实实验室)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI

AI总结 TRACE通过辅助推理集和一致性评估,提升视觉-语言模型的推理透明性和错误检测能力,促进模型改进和优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11277 2025-12-15 cs.CL cs.LG 79%

When Actions Teach You to Think: Reasoning-Action Synergy via Reinforcement Learning in Conversational Agents

当行动教你思考:通过强化学习在对话代理中实现推理-行动协同

Mrinal Rawat, Arkajyoti Chakraborty, Neha Gupta, Roberto Pieraccini

机构 * Uniphore

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);SFT(abstract);分类 cs.CL、cs.LG

AI总结 通过强化学习实现对话代理中推理与行动的协同,提升模型推理质量和工具调用精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11060 2025-12-15 cs.CV 78%

Synthetic Vasculature and Pathology Enhance Vision-Language Model Reasoning

合成血管和病理增强视觉-语言模型推理

Chenjun Li, Cheng Wan, Laurin Lux, Alexander Berger, Richard B. Rosen, Martin J. Menten, Johannes C. Paetzold

机构 * Cornell University(康奈尔大学) Weill Cornell Medicine(韦尔·康奈尔医学) Technical University of Munich(慕尼黑技术大学) New York Eye and Ear Infirmary of Mount Sinai(圣文森特医院) Cornell Tech(康奈尔科技)

专题命中 推理与问题求解 :language model(title,abstract)

AI总结 本研究提出合成血管推理框架,通过生成具有糖尿病视网膜病变特征的图像和文本,提升视觉-语言模型在OCTA图像诊断中的推理能力与病理定位精度。

Comments 23 pages, 8 figures, 6 tables. Full paper under review for MIDL 2026 (Medical Imaging with Deep Learning)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05178 2025-12-15 cs.MA cs.AI 77%

CREW-WILDFIRE: Benchmarking Agentic Multi-Agent Collaborations at Scale

CREW-WILDFIRE:大规模代理协作基准测试

Jonathan Hyun, Nicholas R Waytowich, Boyuan Chen

机构 * Duke University(杜克大学) Army Research Laboratory(陆军研究实验室)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 CREW-WILDFIRE是一个开源基准测试,用于评估大规模多代理协作的可扩展性、鲁棒性和协作能力,通过真实复杂的野火响应场景推动多代理Agentic AI的研究发展。

Comments Our project website is at: http://generalroboticslab.com/CREW-Wildfire

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11620 2025-12-15 cs.RO cs.SY eess.SY 75%

Architecting Large Action Models for Human-in-the-Loop Intelligent Robots

为具有人类在环的智能机器人构建大型动作模型

Kanisorn Sangchai, Methasit Boonpun, Withawin Kraipetchara, Paulo Garcia

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本文提出通过整合符号方法与现成模型构建可验证的神经符号智能机器人动作模型,以提升可靠性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11275 2025-12-15 cs.RO 75%

Towards Logic-Aware Manipulation: A Knowledge Primitive for VLM-Based Assistants in Smart Manufacturing

面向逻辑感知的操控:一种用于智能制造中基于VLM助手的知识原语

Suchang Chen, Daqiang Guo

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

专题命中 推理与问题求解 :LLM(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出了一种面向智能制造的基于VLM助手的知识原语,通过定义对象为中心的操控-逻辑模式,实现了在制造单元中执行复杂操控任务的逻辑感知和高效规划。

Comments 8 pages, 2 figures, submitted to the 2026 IFAC World Congress

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11099 2025-12-15 cs.CV 75%

VGent: Visual Grounding via Modular Design for Disentangling Reasoning and Prediction

VGent: 通过模块化设计实现视觉 grounding 的解耦推理与预测

Weitai Kang, Jason Kuen, Mengwei Ren, Zijun Wei, Yan Yan, Kangning Liu

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) Adobe(Adobe公司)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 VGent 通过模块化设计实现视觉 grounding 的解耦推理与预测,利用冻结 MLLM 和解码器交叉注意力机制,提升多目标识别性能。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18234 2025-12-15 cs.AI cs.CL cs.LG 75%

The Illusion of Readiness in Health AI

健康AI中的“准备”幻觉

Yu Gu, Jingjing Fu, Xiaodong Liu, Jeya Maria Jose Valanarasu, Noel CF Codella, Reuben Tan, Qianchu Liu, Ying Jin, Sheng Zhang, Jinyu Wang, Rui Wang, Lei Song, Guanghui Qin, Naoto Usuyama, Cliff Wong, Hao Cheng, HoHin Lee, Praneeth Sanapathi, Sarah Hilado, Tristan Naumann, Javier Alvarez-Valle, Jiang Bian, Mu Wei, Khalil Malik, Lidong Zhou, Jianfeng Gao, Eric Horvitz, Matthew P. Lungren, Doug Burger, Eric Topol, Hoifung Poon, Paul Vozila

机构 * Scripps Research Translational Institute(斯克里普斯研究转化研究所)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过对抗性压力测试揭示了健康AI在现实应用中的鲁棒性和推理能力不足,强调了对AI系统责任和真实医疗需求的重视。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11558 2025-12-15 cs.CV cs.AI cs.CL 73%

DentalGPT: Incentivizing Multimodal Complex Reasoning in Dentistry

DentalGPT: 促进牙科多模态复杂推理的激励机制

Zhenyang Cai, Jiaming Zhang, Junjie Zhao, Ziyi Zeng, Yanchao Li, Jingyi Liang, Junying Chen, Yunjin Yang, Jiajun You, Shuzhi Deng, Tongfei Wang, Wanting Chen, Chunxiu Hao, Ruiqi Xie, Zhenwei Wen, Xiangyi Feng, Zou Ting, Jin Zou Lin, Jianquan Li, Guangjun Yu, Liangyi Chen, Junwen Wang, Shan Jiang, Benyou Wang

机构 * Shenzhen Stomatology Hospital (Pingshan) of Southern Medical University(南方医科大学深圳口腔医院(平山)) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) State Key Laboratory of Membrane Biology, Beijing Key Laboratory of Cardiometabolic Molecular Medicine, Institute of Molecular Medicine, National Biomedical Imaging Center, School of Future Technology, Peking University(北京大学膜生物学国家重点实验室、北京心代谢分子医学重点实验室、分子医学研究院、国家生物医学成像中心、未来技术学院) Freedom AI Division of Applied Oral Sciences & Community Dental Care Faculty of Dentistry, The University of Hong Kong(香港大学牙科学院应用口腔科学与社区牙科护理系) Beijing Institute of Collaborative Innovation(北京协同创新研究院) National Health Data Institute, Shenzhen(深圳国家健康数据研究院) Shenzhen Loop Area Institute(深圳河套学院) Shenzhen Institute of Big Data(深圳大数据研究院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 DentalGPT通过高质量数据和强化学习提升牙科多模态推理能力,实现优于现有模型的诊断性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11464 2025-12-15 cs.CV cs.AI cs.LG 73%

Exploring MLLM-Diffusion Information Transfer with MetaCanvas

探索MLLM-扩散信息传输与MetaCanvas

Han Lin, Xichen Pan, Ziqi Huang, Ji Hou, Jialiang Wang, Weifeng Chen, Zecheng He, Felix Juefei-Xu, Junzhe Sun, Zhipeng Fan, Ali Thabet, Mohit Bansal, Chu Wang

机构 * Meta Superintelligence Labs(Meta 超智能实验室) New York University(纽约大学) Nanyang Technological University(南洋理工大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 MetaCanvas通过使MLLMs在潜在空间中推理和规划,提升多模态生成的精确度和结构化控制。

Comments Project page: https://metacanvas.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11463 2025-12-15 cs.AI 70%

Motif-2-12.7B-Reasoning: A Practitioner's Guide to RL Training Recipes

Motif-2-12.7B-Reasoning: 一个实践者在强化学习训练配方中的指南

Junghwan Lim, Sungmin Lee, Dongseok Kim, Taehyun Kim, Eunhwan Park, Jeesoo Lee, Jeongdoo Lee, Junhyeok Lee, Wai Ting Cheung, Dahye Choi, Minsu Ha, Jaeheui Her, Jaeyeon Huh, Hanbin Jung, Changjin Kang, Beomgyu Kim, Minjae Kim, Taewhan Kim, Youngrok Kim, Hyukjin Kweon, Haesol Lee, Kungyu Lee, Dongpin Oh, Yeongjae Park, Bokki Ryu, Dongjoo Weon

机构 * Motif Technologies(Motif技术公司)

专题命中 推理与问题求解 :language model(abstract);SFT(abstract);分类 cs.AI

AI总结 Motif-2-12.7B-Reasoning通过综合训练配方,在复杂推理和长上下文理解中实现性能媲美更大参数模型,提供开源模型和可扩展的推理能力蓝图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10313 2025-12-15 cs.AI cs.CY 70%

EpiPlanAgent: Agentic Automated Epidemic Response Planning

EpiPlanAgent:基于代理的自动化疫情响应规划

Kangkun Mao, Fang Xu, Jinru Ding, Yidong Jiang, Yujun Yao, Yirong Chen, Junming Liu, Xiaoqin Wu, Qian Wu, Xiaoyan Huang, Jie Xu

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Center For Disease Control and Prevention(上海市疾病预防控制中心)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 EpiPlanAgent利用大语言模型和多代理框架,实现自动化疫情响应规划,显著提升计划完整性并减少开发时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12963 2025-12-15 cs.AI 70%

MedRule-KG: A Knowledge-Graph--Steered Scaffold for Reliable Mathematical and Biomedical Reasoning

MedRule-KG: 一种基于知识图谱的可靠数学和生物医学推理框架

Crystal Su

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 MedRule-KG通过知识图谱框架和轻量验证器,提升科学推理和药物发现的可靠性与准确性。

Comments This paper is withdrawn due to issues with attribution and citation accuracy

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16309 2025-12-15 cs.AI 70%

MedRule-KG: A Knowledge-Graph--Steered Scaffold for Mathematical Reasoning with a Lightweight Verifier

MedRule-KG:一种由知识图谱引导的轻量级验证器支持的数学推理框架

Crystal Su

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 MedRule-KG通过结合知识图谱和轻量级验证器,提升数学推理的准确性和规则一致性。

Comments This paper is withdrawn due to issues with attribution and citation accuracy

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11109 2025-12-15 cs.LG 70%

Limits and Gains of Test-Time Scaling in Vision-Language Reasoning

视觉语言推理中测试时扩展的极限与收益

Mohammadjavad Ahmadpour, Amirmahdi Meighani, Payam Taebi, Omid Ghahroodi, Amirmohammad Izadi, Mahdieh Soleymani Baghshah

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究探讨了测试时扩展在视觉语言推理中的效果,发现其在不同任务和模型上表现不一,需根据具体需求定制策略。

Comments Mohammadjavad Ahmadpour and Amirmadhi Meighani contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11680 2025-12-15 cs.CV 67%

Cross-modal Context-aware Learning for Visual Prompt Guided Multimodal Image Understanding in Remote Sensing

跨模态上下文感知学习:用于遥感中视觉提示引导的多模态图像理解

Xu Zhang, Jiabin Fang, Zhuoming Ding, Jin Yuan, Xuan Liu, Qianjun Zhang, Zhiyong Li

机构 * College of Computer Science and Electronic Engineering, Hunan University(计算机科学与电子工程学院,湖南大学) School of Robotics and the National Engineering Research Center of Robot Visual Perception and Control Technology, Hunan University(机器人学院及机器人视觉感知与控制技术国家工程研究中心,湖南大学) School of Computing and Artificial Intelligence, Southwest Jiaotong University(计算与人工智能学院,西南交通大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 CLV-Net通过跨模态上下文感知学习,利用视觉提示引导遥感多模态图像理解,提升目标识别精度和用户意图对齐能力。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21546 2025-12-15 cs.CV cs.AI cs.CL cs.LG 67%

Counterfactual Segmentation Reasoning: Diagnosing and Mitigating Pixel-Grounding Hallucination

反事实分割推理:诊断和缓解像素接地幻觉

Xinzhuo Li, Adheesh Juvekar, Jiaxun Zhang, Xingyou Liu, Muntasir Wahed, Kiet A. Nguyen, Yifan Shen, Tianjiao Yu, Ismini Lourentzou

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出反事实分割推理任务,通过反事实微调训练模型减少分割幻觉,实验表明其在减少幻觉和提升分割性能方面效果显著。

Comments Project webpage: https://plan-lab.github.io/hallusegbench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11271 2025-12-15 cs.AI 57%

TriFlow: A Progressive Multi-Agent Framework for Intelligent Trip Planning

TriFlow:一种渐进式多智能体框架用于智能行程规划

Yuxing Chen, Basem Suleiman, Qifan Chen

机构 * The University of Sydney(悉尼大学) University of New South Wales(新南威尔士大学)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

AI总结 TriFlow通过检索、规划和治理三阶段流程,实现了在严格约束下高效生成个性化行程的智能规划框架。

Comments 4 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11272 2025-12-15 cs.CV cs.AI 57%

Enhancing Supervised Composed Image Retrieval via Reasoning-Augmented Representation Engineering

通过推理增强的表示工程提升监督性复合图像检索

Jun Li, Hongjian Dou, Zhenyu Zhang, Kai Li, Shaoguo Liu, Tingting Gao

机构 * Jun Li(李俊) Hongjian Dou(董宏健) Zhenyu Zhang(张振宇) Kai Li(李凯) Shaoguo Liu(刘少国) Tingting Gao(高婷婷)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 本文提出PMTFR框架,通过推理增强的表示工程提升监督性复合图像检索性能,实验表明其优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11167 2025-12-15 cs.CV cs.AI 57%

Image Tiling for High-Resolution Reasoning: Balancing Local Detail with Global Context

图像分块用于高分辨率推理:在局部细节与全局上下文之间取得平衡

Anatole Jacquin de Margerie, Alexis Roger, Irina Rish

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 本文通过图像分块技术实现高分辨率图像理解,验证了局部细节恢复的有效性,并探讨了全局上下文对模型性能的影响。

Comments Accepted in AAAI 2025 Workshop on Reproducible AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11067 2025-12-15 cs.DB cs.AI 57%

KathDB: Explainable Multimodal Database Management System with Human-AI Collaboration

KathDB:具有人机协作的可解释多模数据库管理系统

Guorui Xiao, Enhao Zhang, Nicole Sullivan, Will Hansen, Magdalena Balazinska

机构 * University of Washington(华盛顿大学)

专题命中 推理与问题求解 :foundation model(abstract);分类 cs.AI

AI总结 KathDB是一种结合关系语义和基础模型推理能力的多模数据库管理系统,通过人机协作实现查询解析、执行和结果解释的可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11490 2025-12-15 cs.CV cs.IR 50%

VLM2GeoVec: Toward Universal Multimodal Embeddings for Remote Sensing

VLM2GeoVec:迈向通用遥感多模态嵌入

Emanuel Sánchez Aimar, Gulnaz Zhambulova, Fahad Shahbaz Khan, Yonghao Xu, Michael Felsberg

机构 * Linköping University(_linköping大学)

专题命中 推理与问题求解 :language model(abstract)

AI总结 VLM2GeoVec通过单编码器对比学习实现遥感多模态嵌入,统一可扩展检索与区域推理,提升遥感场景分析的连贯性。

Comments 21 pages, 7 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21451 2025-12-15 cs.CV 50%

MM-SeR: Multimodal Self-Refinement for Lightweight Image Captioning

MM-SeR: 多模态自反思用于轻量级图像描述

Junha Song, Yongsik Jo, So Yeon Min, Quanting Xie, Taehwan Kim, Yonatan Bisk, Jaegul Choo

机构 * KAIST(韩国科学技术院) UNIST(全南国立大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理与问题求解 :language model(abstract)

AI总结 MM-SeR通过轻量级多模态自反思框架,在减少计算成本的同时,实现了与大规模模型相当的图像描述性能,并扩展到长距离视频问答任务。

Comments Project page: https://sites.google.com/view/junha/mm-ser

详情

展开后加载摘要…

URL PDF HTML 收藏