arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 26465 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7494 篇

2602.20639 2026-02-25 cs.AI 79%

Grounding LLMs in Scientific Discovery via Embodied Actions

通过具身动作 grounding LLMs 在科学发现中

Bo Zhang, Jinfeng Zhou, Yuxuan Chen, Jianing Yin, Minlie Huang, Hongning Wang

机构 * Tsinghua University, Beijing, China(清华大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

AI总结 通过具身动作框架,LLMs在科学发现中实现更稳定的物理模拟和更高的建模准确性。

Comments 24 pages, 7 figures, 7 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19768 2026-02-25 cs.CV 79%

TraceVision: Trajectory-Aware Vision-Language Model for Human-Like Spatial Understanding

TraceVision: 一种具有轨迹感知能力的视觉-语言模型,用于类人空间理解

Fan Yang, Shurong Zheng, Hongyin Zhao, Yufei Zhan, Xin Li, Yousong Zhu, Chaoyang Zhao Ming Tang, Jinqiao Wang

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV

AI总结 TraceVision通过整合轨迹感知的空间理解,实现了类人空间认知,提升视觉-语言模型在轨迹引导任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13961 2026-02-17 cs.CV astro-ph.IM cs.CL 79%

MarsRetrieval: Benchmarking Vision-Language Models for Planetary-Scale Geospatial Retrieval on Mars

MarsRetrieval: 用于火星尺度地理空间检索的视觉-语言模型基准测试

Shuoyuan Wang, Yiran Wang, Hongxin Wei

机构 * Department of Statistics and Data Science(统计与数据科学系) Department of Earth and Space Sciences(地球与空间科学系)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV

AI总结 MarsRetrieval提出了一种用于评估视觉-语言模型在火星地理空间发现中检索能力的基准测试,强调领域特定微调对可推广发现的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13195 2026-02-16 cs.CV 79%

Conversational Image Segmentation: Grounding Abstract Concepts with Scalable Supervision

对话式图像分割:通过可扩展监督将抽象概念具象化

Aadarsh Sahoo, Georgia Gkioxari

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 本文提出对话式图像分割方法,通过可扩展监督将抽象概念转化为精确掩码,并引入ConverSeg基准和ConverSeg-Net模型提升分割性能。

Comments Project webpage: https://glab-caltech.github.io/converseg/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07388 2026-02-16 cs.AI 79%

Invert4TVG: A Temporal Video Grounding Framework with Inversion Tasks Preserving Action Understanding Ability

Invert4TVG: 一种具有逆向任务的时序视频定位框架,以保持动作理解能力

Zhaoyu Chen, Hongnan Lin, Yongwei Nie, Fei Ma, Xuemiao Xu, Fei Yu, Chengjiang Long

机构 * Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室) School of Computer Science and Engineering, South China University of Technology(华南理工大学计算机科学与工程学院) ByteDance Inc.(字节跳动公司)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

AI总结 Invert4TVG通过引入逆向任务保持动作理解能力,提升时序视频定位的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07827 2026-02-10 cs.CV 79%

Open-Text Aerial Detection: A Unified Framework For Aerial Visual Grounding And Detection

开放文本航空检测:面向航空场景理解的统一框架

Guoting Wei, Xia Yuan, Yang Zhou, Haizhao Jing, Yu Liu, Xianbiao Qi, Chunxia Zhao, Haokui Zhang, Rong Xiao

机构 * Nanjing University of Science and Technology(南京理工大学) Northwestern Polytechnical University(西北工业大学) Zhejiang Lab(浙江实验室)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 OTA-Det提出一个统一框架,整合开放词汇航空检测与遥感视觉定位,通过任务重述和密集语义对齐策略实现细粒度语义理解和多目标检测,达到最佳性能并保持实时推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05215 2026-02-06 cs.CV 79%

E.M.Ground: A Temporal Grounding Vid-LLM with Holistic Event Perception and Matching

E.M.Ground: 一种具有整体事件感知和匹配的时序地面视频大语言模型

Jiahao Nie, Wenbin An, Gongjie Zhang, Yicheng Xu, Yap-Peng Tan, Alex C. Kot, Shijian Lu

机构 * Interdisciplinary Graduate Programme, Nanyang Technological University, Singapore(南洋理工大学交叉学科研究生项目) Xi’an Jiaotong University, China(西安交通大学) Alibaba DAMO Academy, Singapore(阿里巴巴达摩院) Institute of Science Tokyo, Japan(东京科学研究院) VinUniversity, Vietnam(文大学) Nanyang Technological University, Singapore(南洋理工大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 E.M.Ground通过引入事件标记、平滑处理和多粒度特征聚合,提升了时序视频地面任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17729 2026-02-05 cs.AI 79%

M^3-Bench: Multi-Modal, Multi-Hop, Multi-Threaded Tool-Using MLLM Agent Benchmark

M^3-Bench: 多模态、多跳、多线程工具使用 MLLM agent 评估基准

Yang Zhou, Mingyu Zhao, Zhenting Wang, Difei Gu, Bangwei Guo, Ruosong Ye, Ligong Han, Can Jin, Dimitris N. Metaxas

机构 * Rutgers University(新泽西罗格斯大学)

专题命中 视觉定位与Grounding :MLLM(title);grounding(abstract);分类 cs.AI

AI总结 M^3-Bench是首个评估多模态工具使用下模型上下文协议的基准,通过多跳、多线程工作流和可追溯的一对一对应关系,揭示了多模态大语言模型在论点保真度和结构一致性方面的持续差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03071 2026-02-05 cs.CV 79%

Finding Optimal Video Moment without Training: Gaussian Boundary Optimization for Weakly Supervised Video Grounding

无需训练即可找到最优视频片段:用于弱监督视频定位的高斯边界优化

Sunoh Kim, Kimin Yun, Daeho Um

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 本文提出GBO方法,通过解决优化问题提升弱监督视频定位的定位性能,无需训练且兼容多种提案架构。

Comments Accepted in IEEE TMM

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03361 2026-02-04 cs.CV 79%

Z3D: Zero-Shot 3D Visual Grounding from Images

Z3D:从图像实现零样本3D视觉定位

Nikita Drozdov, Andrey Lemeshko, Nikita Gavrilov, Anton Konushin, Danila Rukhovich, Maksim Kolodiazhnyi

机构 * Lomonosov Moscow State University(罗蒙诺索夫莫斯科国立大学) Higher School of Economics(高等经济学院) M3L Lab, Institute of Mechanics, Armenia(阿塞拜疆力学研究所M3L实验室)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 Z3D通过先进的零样本3D实例分割和基于提示的推理,实现了从多视角图像中无需几何监督的零样本3D视觉定位。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09981 2026-02-03 cs.CV 79%

DR$^2$Seg: Decomposed Two-Stage Rollouts for Efficient Reasoning Segmentation in Multimodal Large Language Models

DR$^2$Seg: 分解式两阶段 rollout 用于多模态大语言模型中的高效推理分割

Yulin He, Wei Chen, Zhikang Jian, Tianhang Guo, Wenjuan Zhou, Minglong Li, Shaowu Yang, Wenjing Yang

机构 * School of Computer, National University of Defense Technology, Changsha, China(计算机学院,国防科技大学,中国长沙)

专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);分类 cs.CV

AI总结 DR$^2$Seg通过分解式两阶段rollout策略提升多模态大语言模型中的推理效率和分割准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00070 2026-02-03 cs.CY cs.CL cs.LG 79%

FoundationalASSIST: An Educational Dataset for Foundational Knowledge Tracing and Pedagogical Grounding of LLMs

FoundationalASSIST: 一个用于基础知识追踪和LLM教学基础的教育数据集

Eamon Worden, Cristina Heffernan, Neil Heffernan, Shashank Sonkar

机构 * Worcester Polytechnic Institute(沃斯特理工大学) The ASSISTments Foundation(ASSISTments基金会) University of Central Florida(中央佛罗里达大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.LG

AI总结 FoundationalASSIST 是首个为研究LLM在教育中的应用而设计的英文教育数据集,提供完整问题文本、学生实际回答和对齐标准,用于评估LLM在知识追踪和教学基础方面的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09114 2026-02-03 cs.LG 79%

TRACE: Grounding Time Series in Context for Multimodal Embedding and Retrieval

TRACE: 在上下文中对时间序列进行建模以实现多模态嵌入与检索

Jialin Chen, Ziyu Zhao, Gaukhar Nurbek, Aosong Feng, Ali Maatouk, Leandros Tassiulas, Yifeng Gao, Rex Ying

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.LG

AI总结 TRACE通过在上下文中对时间序列进行建模,实现多模态嵌入与检索,提升下游任务的预测精度和可解释性,同时作为强大的独立编码器优化上下文感知表示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22666 2026-02-02 cs.CV 79%

ExpAlign: Expectation-Guided Vision-Language Alignment for Open-Vocabulary Grounding

ExpAlign:基于期望引导的视觉-语言对齐用于开放词汇接地

Junyi Hu, Tian Bai, Fengyi Wu, Wenyan Li, Zhenming Peng, Yi Zhang

机构 * Department of Automation, Tsinghua University, China(清华大学自动化系) University of Electronic Science and Technology of China, China(电子科技大学) University of Copenhagen, Denmark(哥本哈根大学) Lingsu Lab, China(灵素实验室)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 ExpAlign通过理论指导的多实例学习框架,实现开放词汇接地任务中隐式token和实例选择,提升检测和分割性能,尤其在长尾类别上表现突出。

Comments 20 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20433 2026-02-02 cs.CV 79%

MARE: Multimodal Alignment and Reinforcement for Explainable Deepfake Detection via Vision-Language Models

MARE: 多模态对齐与强化学习用于通过视觉-语言模型的可解释深度伪造检测

Wenbo Xu, Wei Lu, Xiangyang Luo, Jiantao Zhou

机构 * School of Computer Science and Engineering, MoE Key Laboratory of Information Technology, Guangdong Province Key Laboratory of Information Security Technology, Sun Yat-sen University, Guangzhou 510006, China(计算机科学与工程学院,信息技术MOE实验室,广东省信息安全技术重点实验室,中山大学,广州510006,中国) State Key Laboratory of Mathematical Engineering and Advanced Computing(数学工程与先进计算国家重点实验室) Department of Computer and Information Science, University of Macau.(计算机与信息科学系,澳门大学)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV

AI总结 MARE通过多模态对齐和强化学习提升视觉-语言模型在深度伪造检测中的准确性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16532 2026-01-27 cs.CV 79%

AnchoredDream: Zero-Shot 360° Indoor Scene Generation from a Single View via Geometric Grounding

AnchoredDream: 通过几何约束从单视角生成零样本360°室内场景

Runmao Yao, Junsheng Zhou, Zhen Dong, Yu-Shen Liu

机构 * School of Software, Tsinghua University(清华大学软件学院) Wuhan University(武汉大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 AnchoredDream通过几何约束和外观-几何互促机制,实现从单视角零样本生成高质量360°室内场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15871 2026-01-27 cs.CV cs.MM 79%

Zero-Shot Visual Grounding in 3D Gaussians via View Retrieval

通过视图检索实现3D高斯体的零样本视觉定位

Liwei Liao, Xufeng Li, Xiaoyun Zheng, Boning Liu, Feng Gao, Ronggang Wang

机构 * Peking University(北京大学) Peng Cheng Laboratory(鹏城实验室) City University of Hongkong(香港城市大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 本文提出GVR框架,通过视图检索将3DVG转化为2D检索任务,实现零样本3DGS的视觉定位,无需每场景训练和3D标注。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17588 2026-01-27 cs.AI cs.CL 79%

Intelligence Requires Grounding But Not Embodiment

智能需要具身但不需要身体

Marcus Ma, Shrikanth Narayanan

机构 * University of Southern California(南加州大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

AI总结 本文提出智能需要基础性而非具身,通过定义智能的四个属性并论证非具身智能体可实现这些属性,从而得出结论:基础性是智能的必要条件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06515 2026-01-27 cs.CV 79%

BigTokDetect: A Clinically-Informed Vision-Language Modeling Framework for Detecting Pro-Bigorexia Videos on TikTok

BigTokDetect: 一种临床指导的视觉-语言建模框架,用于检测TikTok上促进大肌肉畸形行为的视频

Minh Duc Chu, Kshitij Pawar, Zihao He, Roxanna Sharifi, Ross Sonnenblick, Magdalayna Curry, Laura D'Adamo, Lindsay Young, Stuart B Murray, Kristina Lerman

机构 * USC Information Sciences Institute(USC信息科学研究所) Keck School of Medicine, USC(USC凯克医学院) Department of Clinical Psychology, Drexel University(德雷塞尔大学临床心理学系) Department of Psychiatry and Biobehavioral Sciences, UCLA(UCLA精神病学与生物行为科学系)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV

AI总结 BigTokDetect通过临床指导的视觉-语言模型,检测TikTok上促进大肌肉畸形行为的视频,建立了可扩展的有害内容缓解框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08905 2026-01-27 cs.AI cs.CL 79%

Grounding Synthetic Data Evaluations of Language Models in Unsupervised Document Corpora

在无监督文档语料中使语言模型的合成数据评估接地

Michael Majurski, Cynthia Matuszek

机构 * University of Maryland Baltimore County(马里兰大学巴尔的摩县分校)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

AI总结 本研究提出了一种自动化方法,利用文档语料生成事实性合成数据评估,以提高语言模型在无监督文档中的评估效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16108 2026-01-23 cs.AI 79%

Multimodal Climate Disinformation Detection: Integrating Vision-Language Models with External Knowledge Sources

多模态气候虚假信息检测:整合视觉-语言模型与外部知识源

Marzieh Adeli Shamsabad, Hamed Ghodrati

机构 * CRIM

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.AI

AI总结 本文提出整合视觉-语言模型与外部知识源,以提升多模态气候虚假信息检测的准确性与实时性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15711 2026-01-23 cs.CV 79%

Zero-Shot Product Attribute Labeling with Vision-Language Models: A Three-Tier Evaluation Framework

基于视觉-语言模型的零样本产品属性标注:一种三级评估框架

Shubham Shukla, Kunal Sonalkar

机构 * Nordstrom(诺德斯特拉姆)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出一种三级评估框架,评估视觉-语言模型在多属性服装任务中的零样本属性标注性能,发现高效模型在成本较低时能实现接近旗舰级性能,揭示了属性适用性检测是关键瓶颈。

Comments Accepted to WACV 2026 Workshop on Physical Retail AI (PRAW)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13634 2026-01-21 cs.AI 79%

V2P: Visual Attention Calibration for GUI Grounding via Background Suppression and Center Peaking

V2P: 通过背景抑制和中心峰值校准实现GUI定位的视觉注意力校准

Jikai Chen, Long Chen, Dong Wang, Qinglin Su, Zhixuan Chu, Bingguang Hao, Leilei Gan, Chenyi Zhuang, Jinjie Gu

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

AI总结 V2P通过背景抑制和中心峰值校准提升GUI元素定位精度,解决注意力漂移和中心边缘区分问题,实现高精度GUI接地任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06899 2026-01-19 cs.AI 79%

V2P: Visual Attention Calibration for GUI Grounding via Background Suppression and Center Peaking

V2P: 通过背景抑制和中心峰值校准实现GUI定位的视觉注意力校准

Jikai Chen, Long Chen, Dong Wang, Qinglin Su, Zhixuan Chu, Bingguang Hao, Leilei Gan, Chenyi Zhuang, Jinjie Gu

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

AI总结 V2P通过背景抑制和中心峰值校准方法提升GUI元素定位精度,实现更精确的GUI交互。

Comments This work was intended as a replacement of arXiv:2508.13634 and any subsequent updates will appear there

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17493 2026-01-14 cs.AI cs.LO 79%

Automated Hybrid Grounding Using Structural and Data-Driven Heuristics

基于结构和数据驱动启发式的自动化混合接地

Alexander Beiser, Markus Hecher, Stefan Woltran

机构 * Univ. Artois, CNRS, UMR8188, Computer Science Research Center of Lens (CRIL), Lens, France(阿托瓦大学、法国国家科学研究中心、UMR8188、Lens计算科学研究中心(CRIL)、Lens)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

AI总结 本文提出基于结构和数据驱动启发式的自动化混合接地方法,通过分割算法优化接地策略,提升难接地场景的性能并接近当前最佳水平。

Journal ref Theory and Practice of Logic Programming 25 (2025) 489-506

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22533 2026-01-12 cs.CL cs.AI 79%

CliCARE: Grounding Large Language Models in Clinical Guidelines for Decision Support over Longitudinal Cancer Electronic Health Records

CliCARE: 在纵向癌症电子健康记录上基于临床指南 grounding 大型语言模型以支持决策

Dongchen Li, Jitao Liang, Wei Li, Xiaoyu Wang, Longbing Cao, Kun Yu

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

AI总结 CliCARE 通过将纵向癌症 EHRs 转换为时序知识图谱并结合临床指南,为肿瘤科医生提供证据支持的决策支持。

Comments Accepted in AAAI Conference on Artificial Intelligence (AAAI-26, Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18693 2026-01-09 cs.CV 79%

MVT: Mask-Grounded Vision-Language Models for Taxonomy-Aligned Land-Cover Tagging

MVT:基于分类对齐的土地覆盖标签的掩码导向视觉-语言模型

Siyi Chen, Kai Wang, Weicong Pang, Ruiming Yang, Ziru Chen, Renjun Gao, Alexis Kai Hon Lau, Dasa Gu, Chenchen Zhang, Cheng Li

机构 * HKUST(香港科技大学) JHU(约翰·霍普金斯大学) CUHKSZ(香港中文大学) NUS(新加坡国立大学) MUST(穆斯林大学)

专题命中 视觉定位与Grounding :vision-language model(title);MLLM(abstract);分类 cs.CV

AI总结 MVT通过三阶段框架结合类无关掩码证据与基于分类的场景解释,提升遥感土地覆盖标签的准确性和信息性。

Comments The project is available at https://charlescsyyy.github.io/MVT

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04201 2026-01-09 cs.CL cs.AI cs.CY cs.HC 79%

Collective Narrative Grounding: Community-Coordinated Data Contributions to Improve Local AI Systems

集体叙事 grounding:社区协调的数据贡献以改进本地 AI 系统

Zihan Gao, Mohsin Y. K. Yousufi, Jacob Thebault-Spieker

机构 * Information Science University of Wisconsin-Madison(信息科学大学威斯康星大学麦迪逊分校) Digital Media Georgia Tech(数字媒体佐治亚理工学院)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

AI总结 本文提出集体叙事 grounding 协议,通过社区协调的数据贡献,改进本地 AI 系统,解决社区特定查询的问答问题。

Comments 9 pages, 2 figures, Presented at the NeurIPS 2025 ACA Workshop accepted-papers.html" target="_blank" rel="noopener">https://acaworkshop.github.io/accepted-papers.html,

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03850 2026-01-08 cs.AI 79%

Investigating the Grounding Bottleneck for a Large-Scale Configuration Problem: Existing Tools and Constraint-Aware Guessing

探讨大规模配置问题中的 grounding 阻塞问题:现有工具与约束感知猜测

Veronika Semmelrock, Gerhard Friedrich

机构 * Department of Artificial Intelligence(人工智能系) Cybersecurity University of Klagenfurt, Austria(克雷根弗特大学网络安全学院)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

AI总结 本文探讨了ASP在大规模配置问题中的grounding瓶颈,提出约束感知猜测方法以减少内存需求。

Comments In Proceedings ICLP 2025, arXiv:2601.00047

Journal ref EPTCS 439, 2026, pp. 482-495

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02677 2026-01-07 cs.LG q-fin.RM q-fin.ST 79%

Uni-FinLLM: A Unified Multimodal Large Language Model with Modular Task Heads for Micro-Level Stock Prediction and Macro-Level Systemic Risk Assessment

Uni-FinLLM:一种具有模块化任务头的统一多模态大语言模型,用于微观层面的股票预测和宏观层面的系统性风险评估

Gongao Zhang, Haijiang Zeng, Lu Jiang

专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);分类 cs.LG

AI总结 Uni-FinLLM通过统一多模态大语言模型,结合模块化任务头,实现了对股票预测和系统性风险评估的高效联合建模,显著提升了预测准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏