arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12294 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2997 篇

2606.26729 2026-06-29 cs.HC 新提交 50%

'A bit of chaos and madness': The AI Assessment Scale and the work of assessment reform

“一丝混乱与疯狂”:AI评估量表与评估改革工作

Mike Perkins, Darius Postma, Jasper Roe, Susan Sisay, Craig Holdcroft

专题命中 评测与基准 :prompting(abstract)

AI总结 本研究通过越南和英国两所大学的焦点小组,探讨AI评估量表(AIAS)的实施经验,发现其能促进真实评估设计,但若脱离学习成果和学科背景可能沦为合规工具。

Comments V2: Corrections of errata, additional limitations

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25343 2026-06-29 cs.CV 新提交 50%

Invoice Haystack: Benchmarking Document Retrieval and Visual Question Answering Under Strong Visual Homogeneity

发票草垛:强视觉同质性下的文档检索与视觉问答基准测试

Heethanjan Kanagalingam, Thenukan Pathmanathan, Mokeeshan Vathanakumar, Basim Azam, Sarah Monazam Erfani, Naveed Akhtar

机构 * The University of Melbourne(墨尔本大学) Lakehead University(湖首大学)

专题命中 评测与基准 :language model(abstract)

AI总结 针对视觉同质文档集合中的检索困难,提出Invoice Haystack基准和VL-RAG混合检索框架,通过文本与视觉嵌入融合及VLM验证过滤,显著提升检索准确率。

Comments Accepted to presentation at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23686 2026-06-29 cs.RO 新提交 50%

LIBERO-Safety: A Comprehensive Benchmark for Physical and Semantic Safety in Vision-Language-Action Models

LIBERO-Safety:视觉-语言-动作模型中物理与语义安全的综合基准

Rongxu Cui, Zongzheng Zhang, Jingrui Pang, Haohan Chi, Jinbang Guo, Saining Zhang, Shaoxuan Xie, Xin Jin, Yao Mu, Jiaolong Yang, Guocai Yao, Xianyuan Zhan, Ya-Qin Zhang, Hao Zhao

机构 * Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) Beijing Academy of Artificial Intelligence (BAAI)(北京智源人工智能研究院) Beihang University(北京航空航天大学) Eastern Institute of Technology, Ningbo(宁波东方理工大学) Shanghai Jiao Tong University(上海交通大学) Microsoft Research Asia (MSRA)(微软亚洲研究院)

专题命中 评测与基准 :foundation model(abstract)

AI总结 针对视觉-语言-动作模型操作安全未验证的问题,提出参数化安全基准和关键帧驱动数据生成流水线,构建大规模无碰撞数据集,系统评估八种模型,揭示泛化-安全张力。

Comments Accepted by ECCV 2026, Project Page: https://libero-safety.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27317 2026-06-26 cs.CV cs.RO 新提交 50%

OctoSense: Self-Supervised Learning for Multimodal Robot Perception

OctoSense: 多模态机器人感知的自监督学习

Anthony Bisulco, Jeremy Wang, Kostas Daniilidis, Randall Balestriero, Pratik Chaudhari

专题命中 评测与基准 :foundation model(abstract)

AI总结 提出OctoSense传感器平台和数据集,通过“晚融合”掩码自编码器实现多模态自监督学习,在多种退化条件下鲁棒预测光流、深度、语义分割和自运动。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27036 2026-06-26 cs.RO 新提交 50%

RelAfford6D: Relational 6D Affordance Graphs for Constraint-Driven Robotic Manipulation

RelAfford6D:用于约束驱动机器人操作的关系型6D可操作图

Guodong Zhang, Qichen He, Wenyuan Xie, Shaokai Wu, Yanbiao Ji, Qiuchang Li, Bayram Bayramli, Yue Ding, Hongtao Lu

机构 * School of Computer Science, Shanghai Jiaotong University(上海交通大学计算机科学学院)

专题命中 评测与基准 :foundation model(abstract)

AI总结 提出RelAfford6D框架,通过构建关系型6D可操作图将语义指令转化为SE(3)位姿约束,并利用运动学约束求解实现零样本操作,在仿真和真实环境中优于数据驱动方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25899 2026-06-25 cs.MA 新提交 50%

Manipulation Is Task-Dependent: A Multi-Axis, Multi-Environment Evaluation of Frontier LLMs

操纵行为依赖于任务:前沿语言模型的多轴、多环境评估

Adeeb Zaman, Erik Nordby, Fred Heiding

专题命中 评测与基准 :language model(abstract)

AI总结 通过六种环境、三个轴(框架、激励结构、任务难度)评估六个前沿语言模型的操纵行为,发现操纵倾向在不同任务间相关性低,且不同环境下驱动因素不同。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25880 2026-06-25 cs.CV 新提交 50%

USS: Unified Spatial-Semantic Prompts for Embodied Visual Tracking with Latent Dynamics Learning

USS: 面向具身视觉跟踪的统一空间-语义提示与潜在动力学学习

Yuchen Xie, Xinyu Zhou, Kuangji Zuo, Yanshuo Lu, Fengrui Huang, Boyu Ma, Jianfei Yang

机构 * Nanyang Technological University(南洋理工大学)

专题命中 评测与基准 :prompting(abstract)

AI总结 提出统一空间-语义提示范式替代纯文本目标指示,设计端到端框架USS支持多种提示类型,通过潜在世界模型提升时序鲁棒性,在真实机器人实验中优于纯文本方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25877 2026-06-25 cs.RO 新提交 50%

TacVerse: A Multi-Sensor Dataset and Benchmark for Cross-Sensor Vision-Based Tactile Perception

TacVerse:面向跨传感器视觉触觉感知的多传感器数据集与基准

Lan Wei, Gurmeher Khurana, Sirine Bhouri, Wenhao Hong, Zeyuan Xin, Qingzheng Cong, Wen Fan, Yanzheng Xiang, Dandan Zhang

机构 * Imperial College London(帝国理工学院) Queen Mary University of London(伦敦玛丽女王大学)

专题命中 评测与基准 :pretraining(abstract)

AI总结 提出TacVerse多传感器数据集与基准,包含7种视觉触觉传感器的106800张图像,支持形状分类、光栅分类和力回归任务,实验表明跨传感器直接迁移性能下降,而少样本适应可提升力回归性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25437 2026-06-25 cs.CV 新提交 50%

LinStereo: Linear-Complexity Global Attention for Multi-Scale Iterative Stereo Matching

LinStereo:用于多尺度迭代立体匹配的线性复杂度全局注意力

Yiran Wang, Oliver Turner, Viorela Ila

机构 * Australian Centre for Robotics (ACFR), School of Aerospace, Mechanical and Mechatronic Engineering (AMME), Faculty of Engineering, The University of Sydney(悉尼大学工程学院航空航天、机械与机电工程学院澳大利亚机器人中心(ACFR))

专题命中 评测与基准 :foundation model(abstract)

AI总结 提出LinStereo,通过位置感知线性注意力实现全局聚合,结合层次化语义代价体积和深度先验初始化,在标准基准和跨域场景(尤其水下)取得最先进精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25298 2026-06-25 cs.CV 新提交 50%

KidRisk: Benchmark Dataset for Children Dangerous Action Recognition

KidRisk:儿童危险动作识别基准数据集

Minh-Kha Nguyen, Trung-Hieu Do, Kim Anh Phung, Thao Thi Phuong Dao, Minh-Triet Tran, Trung-Nghia Le

机构 * Thong Nhat Hospital(统一医院)

专题命中 评测与基准 :language model(abstract)

AI总结 构建包含2500个短视频和10000张图像的儿童危险动作数据集KidRisk,提出基于视觉语言模型的方法,在动作分类和危险识别上分别达到83.53%和96.14%的准确率。

Comments SOICT 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24742 2026-06-24 cs.RO 新提交 50%

World Value Models for Robotic Manipulation

机器人操作的世界价值模型

Zhihao Wang, Jianxiong Li, Yu Cui, Yuan Gao, Xianyuan Zhan, Junzhi Yu, Xiao Ma

机构 * Peking University(北京大学) Tsinghua University(清华大学)

专题命中 评测与基准 :language model(abstract)

AI总结 提出世界价值模型(WVM),融合世界模型与价值估计,通过时序建模评估数据质量,在标准基准和次优轨迹基准上达到SOTA,提升策略学习性能。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24525 2026-06-24 cs.CV 新提交 50%

VisCritic: Visual State Comparison as Process Reward for GUI Agents

VisCritic: 视觉状态比较作为GUI智能体的过程奖励

Jiachen Qian

机构 * City University of Hong Kong(香港城市大学)

专题命中 评测与基准 :language model(abstract)

AI总结 提出VisCritic框架,通过比较操作前后截图在视觉特征空间中的变化来验证GUI智能体动作,结合孪生视觉Transformer和动作感知评判头,无需额外人工标注即可提升多基准测试性能。

Comments 17 pages, 4 figures; ECCV 2026 submission; supplementary material uploaded as ancillary file

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24422 2026-06-24 cs.CV 新提交 50%

EgoSAT: A Comprehensive Benchmark of Egocentric Streaming Interaction Understanding

EgoSAT: 一个全面的自我中心流式交互理解基准

Yijia Lei, Jinzhao Li, Yichi Zhang, Jiacheng Hua, Yin Li, Miao Liu

机构 * College of AI, Tsinghua University(清华大学人工智能学院) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 评测与基准 :language model(abstract)

AI总结 提出EgoSAT基准,统一自我中心视频的回顾、在线和前瞻推理任务,评估视觉语言模型在流式设置中的表现,发现现有模型存在前瞻/回顾困难及置信度校准问题。

Comments Accepted to ECCV 2026. Project page: https://leiyj23.github.io/EgoSAT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24361 2026-06-24 cs.CV 新提交 50%

SignNet-1M: Large-Scale Multilingual Sign Language Video Dataset with Downstream Benchmarks

SignNet-1M:大规模多语言手语视频数据集及下游基准

Zhewen He, Junyi Hu, Haomian Huang, Zhenhua Li, Yu-Shen Liu, Yi Fang

机构 * New York University Abu Dhabi(纽约大学阿布扎比分校) ChatSign Technology(ChatSign 技术公司) Tsinghua University(清华大学)

专题命中 评测与基准 :language model(abstract)

AI总结 提出SignNet-1M,通过3D高斯泼溅、扩散模型和后期渲染增强合成多样化手语视频,提升模型在跨视角、背景和身份等分布偏移下的泛化能力。

Comments 25 pages. Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24161 2026-06-24 cs.CV 新提交 50%

Dual-Branch Cross-Projection Debiasing through Diffusion-based Disentanglement

基于扩散解耦的双分支交叉投影去偏

Xiangqian Zhao, Xinyang Jiang, Zhipeng Xu, Lingfeng He, Zilong Wang, Dongsheng Li, De Cheng, Nannan Wang

机构 * Xidian University(西安电子科技大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 评测与基准 :foundation model(abstract)

AI总结 针对有偏数据下基础模型的泛化问题,提出置信引导的偏差概念挖掘(CBCM)和双分支交叉投影去偏(DCD)框架,通过扩散解耦和交叉零空间投影分离目标与虚假特征,在无组标签条件下实现最差组准确率最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24138 2026-06-24 cs.CV 新提交 50%

Sat2City v2: Native 3D City Asset Generation from a Single Satellite Image

Sat2City v2: 从单张卫星图像生成原生3D城市资产

Tongyan Hua, Dongli Wu, Jinjing Zhu, Yinrui Ren, Zhongcheng Hong, Ying-Cong Chen, Hui Xiong, Wufan Zhao

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Chinese University of Hong Kong(香港中文大学) Auckland University of Technology(奥克兰理工大学) Department of Computer Science and Engineering, The Hong Kong University of Science and Technology(香港科技大学计算机科学与工程系)

专题命中 评测与基准 :foundation model(abstract)

AI总结 提出Sat2City v2,利用预训练的原生结构化潜空间3D基础模型,从单张卫星图像生成具有可控外观和几何形状的纹理网格,在真实数据集上优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23892 2026-06-24 cs.CV 新提交 50%

REALM: A Unified Red-Teaming Benchmark for Physical-World VLMs

REALM: 面向物理世界视觉语言模型的统一红队基准

Yifei Zhao, Qian Lou, Mengxin Zheng

机构 * University of Central Florida(中佛罗里达大学)

专题命中 评测与基准 :language model(abstract)

AI总结 提出REALM,首个统一红队基准,集成12种攻击方法、3种防御和13个视觉语言模型,通过代理目标生成管道实现公平比较,发现文本注入攻击最有效。

Comments 20 pages, 5 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23875 2026-06-24 cs.DB 新提交 50%

On the Semantics of Generative SPARQL

生成式SPARQL的语义

Ratan Bahadur Thapa, Steffen Staab

专题命中 评测与基准 :language model(abstract)

AI总结 本文扩展SPARQL以支持生成式查询,通过GenOp调用语言模型并生成类型化解映射,在保持固定数据集假设下定义语义,并分析生成式查询模式的语义后果,包括映射级递归,最终证明其复杂性与标准SPARQL一致。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22868 2026-06-23 eess.AS 新提交 50%

MSU-Bench: Towards Speaker-Centric Understanding in Conversational Multi-Speaker Scenarios

MSU-Bench:面向对话多说话人场景中以说话人为中心的理解

Zhaokai Sun, Shuai Wang, Zhennan Lin, Chengyou Wang, Dehui Gao, Yuang Cao, Chunjiang He, Pan Zhou, Lei Xie

专题命中 评测与基准 :language model(abstract)

AI总结 提出MSU-Bench基准,包含16个说话人中心任务和2300个问答实例,用于评估多说话人对话中的说话人定位与推理能力,揭示现有模型在复杂场景下的不足。

Comments 4 pages, accepted by interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21351 2026-06-23 q-bio.PE 新提交 50%

Surveying the adaptive landscapes of 10,000 antibodies

调查10000种抗体的适应度景观

Daniel PGH Wong, Aleksandra M. Walczak, Thierry Mora

专题命中 评测与基准 :language model(abstract)

AI总结 本文提出无参数群体遗传框架,通过分析公共克隆型中趋同亲和成熟信号,识别超过10000种抗体的有益突变位点及其适应度效应,揭示突变流行度与适应度效应间的权衡,并用于基准测试抗体语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22890 2026-06-23 cs.CV 新提交 50%

PHOEBI: An Open-World Benchmark for Bacterial Identification in Phase-Contrast Microscopy

PHOEBI:用于相差显微镜细菌识别的开放世界基准

Aaditya Baranwal, Md Jahid Hasan, Shruti Vyas

机构 * University of Central Florida(中佛罗里达大学)

专题命中 评测与基准 :pretraining(abstract)

AI总结 提出PHOEBI数据集(12万张相差显微镜图像,6种杆状菌的40种组合),通过留出组合评估协议模拟开放世界场景,发现聚合器存在系统性开放世界识别失败,并设计基于锚点的轻量化解码器在未见组合上表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22766 2026-06-23 cs.CV 新提交 50%

READ More than What You See: Reinforcement Learning for Accurate and Coherent Audio Description Generations

READ:超越所见——基于强化学习的准确连贯音频描述生成

Bo Fang, Xinyao Zhang, Yuxin Song, Hui Zhang, Hang Zhou, Antoni B. Chan

机构 * City University of Hong Kong(香港城市大学) Baidu Inc(百度公司) Tsinghua University(清华大学)

专题命中 评测与基准 :prompting(abstract)

AI总结 提出首个基于强化学习的音频描述生成框架READ,通过序列级优化和连贯性奖励,显著提升生成准确性与连贯性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22487 2026-06-23 cs.CV 新提交 50%

FetSelect: Task-Specific Architectures and Self-Supervised Learning for Automated Fetal Ultrasound Frame Selection

FetSelect: 面向自动化胎儿超声帧选择的任务特定架构与自监督学习

Mahmood Alzubaidi, Raden Muaz, Uzair Shah, Mohammed Ammar, Khalid Alyafei, Mowafa Househ, Marco Agus

机构 * College of Science and Engineering, Hamad Bin Khalifa University(哈马德·本·哈利法大学科学与工程学院) LIST Laboratory Department of Electrical Systems Engineering, University of Boumerdes(布迈德斯大学电气系统工程系LIST实验室) Sidra Medicine(锡德拉医学)

专题命中 评测与基准 :pretraining(abstract)

AI总结 提出FetSelect框架,结合冻结视觉基础骨干与混合多头设计(任务门控分类头+检测派生质量头),通过BYOL自监督预训练,在四个胎儿测量目标上实现高AUROC与质量相关性。

Comments Accepted in 30th Conference on Medical Image Understanding and Analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22476 2026-06-23 cs.CV 新提交 50%

CVSBench: A Comprehensive Benchmark for Cross-view Spatial Reasoning and Dreaming

CVSBench:跨视角空间推理与想象的全面基准

Ruixun Liu, Lingyu Zhang, Lanxuan Xue, Kaiyu Li, Bowen Fu, Xiangyong Cao

机构 * Faculty of Electronic and Information Engineering, Xi’an Jiaotong University(西安交通大学电子与信息工程学院) Ministry of Education Key Laboratory of Intelligent Networks and Network Security(教育部智能网络与网络安全重点实验室)

专题命中 评测与基准 :language model(abstract)

AI总结 提出CVSBench基准,通过卫星-街景对评估视觉语言模型的跨视角空间推理能力,发现模型在视角剧变下难以保持物体与布局一致性,引入3D场景想象管道可显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22339 2026-06-23 cs.CV 新提交 50%

T-IMPACT: A Severity-Aware Benchmark for Contextual Image-Text Manipulation

T-IMPACT:面向上下文图像-文本操纵的严重性感知基准

Gagandeep Singh, Aaditya Yadav, Priyanka Singh

机构 * The University of Queensland(昆士兰大学)

专题命中 评测与基准 :language model(abstract)

AI总结 提出T-IMPACT基准,包含98,786个图像-文本对,涵盖原始、仅图像、仅文本和联合操纵,通过校准的连续严重性分数和粗粒度标签评估操纵对上下文理解的影响,实验表明现有模型在严重性预测上仍远弱于人类判断。

Comments 7 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22211 2026-06-23 cs.HC 新提交 50%

Open AI in the Wild: Adoption and Adaptation of Open Models on r/LocalLLaMA

野生的开放AI:r/LocalLLaMA社区中开放模型的采纳与适应

Woohyeuk Lee, James Howison, Min Kyung Lee, Hanlin Li

专题命中 评测与基准 :foundation model(abstract)

AI总结 通过对r/LocalLLaMA社区的实证研究,揭示用户对开放模型的实用主义理解,包括可靠性、本地控制、隐私和适应能力,并分析采纳动机与障碍,以及共享资源如何支撑开放AI生态。

Comments Accepted at FAccT'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21607 2026-06-23 cs.CV 新提交 50%

T-MOR: Learning Motion-Aware Skeleton Representations for Human Action Recognition

T-MOR:学习面向运动感知的骨架表示用于人体动作识别

Di Yang, Mahmoud Ali, Quan Kong, Gianpiero Francesca, Francois Bremond

机构 * Suzhou Institute for Advanced Research, University of Science and Technology of China(中国科学技术大学苏州高等研究院) Inria Center at Université Côte d'Azur(法国蔚蓝海岸大学Inria中心) Woven by Toyota Toyota Motor Europe(丰田汽车欧洲公司)

专题命中 评测与基准 :language model(abstract)

AI总结 提出T-MOR框架,通过多模态对比学习对齐骨架运动与视觉、文本表示,仅用轻量骨架输入实现高效动作识别,并在大规模数据集PoseCap-1M上预训练,在多个基准上取得一致提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21108 2026-06-23 cs.CV 新提交 50%

SARIF: Segment Anything for Robust Image Forensics

SARIF: 用于鲁棒图像鉴别的 Segment Anything

Dong-Hyun Moon, Ju-Hyeon Nam, Sang-Chul Lee

机构 * Department of Electrical and Computer Engineering, Inha University(仁荷大学电气与计算机工程系)

专题命中 评测与基准 :prompting(abstract)

AI总结 提出SARIF框架,利用Segment Anything Model的提示架构和泛化能力,通过反馈引导掩码解码器和双编码器设计提取伪造痕迹,实现自动伪造定位,在跨数据集和图像退化下表现鲁棒。

Comments Accepted to ECCV 2026. Equal contribution: Dong-Hyun Moon and Ju-Hyeon Nam. Corresponding author: Sang-Chul Lee. Code: https://github.com/Inha-CVAI/SARIF_ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20736 2026-06-23 cs.CV 新提交 50%

REKEY: Metadata-Grounded Visual-Key Regeneration for Contamination-Resilient VQA Evaluation

REKEY: 基于元数据的视觉键再生方法用于抗污染的VQA评估

Tengjie Lin, Yutao Sun, Jingwei Ni, Shuhan Ge, Hao-Xuan Ma, Yanting Miao, Wangyue Lu, Mingshuai Chen, Tiancheng Zhao, Jianwei Yin

机构 * Zhejiang University(浙江大学) ETH Zürich(苏黎世联邦理工学院) Nanjing University of Science and Technology(南京理工大学) Nanjing University(南京大学) University of Waterloo(滑铁卢大学) Binjiang Institute of Zhejiang University(浙江大学滨江研究院)

专题命中 评测与基准 :language model(abstract)

AI总结 提出ReKey协议,通过随机再生图像中的视觉键来防止VQA基准测试泄露,实验显示原始项目得分比再生变体高9.5-18.8个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20697 2026-06-23 cs.CV 新提交 50%

AEF-Econ: Toward Plug-and-Play Socioeconomic Foundation Embeddings from AlphaEarth for Urban Remote Sensing

AEF-Econ:面向城市遥感的即插即用社会经济基础嵌入

Shuyang Hou, Ziqi Liu, Haoyue Jiao, Lutong Xie, Yaxian Qing, Xiaopu Zhang, Qingyang Xu, Zhangyan Xu, Xuefeng Guan, Huayi Wu

机构 * State Key Laboratory of Information Engineering in Surveying, Mapping, and Remote Sensing(测绘遥感信息工程国家重点实验室)

专题命中 评测与基准 :pretraining(abstract)

AI总结 针对AlphaEarth基础模型在社会经济任务中即插即用受限的问题,提出容量自适应重构方法,通过多流解码器缓解高维流对低维流的抑制,在跨区域和跨层级评估中R²分别提升至0.848和0.693。

详情

展开后加载摘要…

URL PDF HTML 收藏