arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12101 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2940 篇

2608.00134 2026-08-04 cs.CR 新提交 67%

Stateful Cooperative Agents Safeguarding LLMs Against Evolving Multi-Turn Attacks

有状态协作智能体防御大型语言模型抵御演进式多轮攻击

Siyuan Li, Zehao Liu, Haoyu Li, Xi Lin, Ning Liu, Jun Wu, Jianhua Li, Mohsen Guizani

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 本文提出一种主动防御框架,通过协作多智能体架构结合干扰、误导与自适应策略,在EMRA数据集上使LLMs对抗多轮攻击的ASR平均降低69%,同时提升DR与攻击者token消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00068 2026-08-04 cs.CV 新提交 67%

SafeBuild-Bench: A Temporal-Robust Construction Safety Benchmark with Graph-Enhanced Data Mining

SafeBuild-Bench:一种具有图增强数据挖掘能力的时序鲁棒建筑安全基准

Yi Cui, Zilin Wang, Yijie Xu, Qianyi Cai, Huizai Yao, Shuai Jiang, Bingzhuo Zhong, Hui Xiong

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 研究人员构建了图增强数据挖掘的时序鲁棒建筑安全基准SafeBuild-Bench,开发可扩展验证的GEMS流水线,发现现有多模态大语言模型对建筑安全理解仍不足。

Comments Accepted by KDD 2026. 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01546 2026-08-04 physics.ao-ph cs.SE physics.comp-ph physics.flu-dyn 新提交 67%

FESOM2-JAX v1.0: a differentiable shadow of the ocean-sea-ice model FESOM2, cast onto GPUs

FESOM2-JAX v1.0:适配GPU的海冰-海洋模型FESOM2的可微镜像版本

Nikolay V. Koldunov, Sergey Danilov, Suvarchal Cheedela, Dmitry Sidorenko, Sebastian Beyer, Patrick Scholz, Ivan Kuznetsov, Jan Streffing, Aleksei Koldunov, Dmitrii Pantiukhin, Svetlana N. Loza, Thomas Jung

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 FESOM2-JAX v1.0是FESOM2基于JAX的可微GPU版本,与原Fortran版本结果一致,具备端到端可微性,是首个CMIP级非结构化网格可微全球海冰-海洋模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29604 2026-08-03 cs.CR 新提交 67%

CWEEP: A Lexical Static Analysis Framework for CWE Early Prevention

CWEEP:用于CWE早期预防的词法静态分析框架

Bryan Kwan, Benjamin Tan

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 CWEEP是一种用于RTL安全弱点检测的静态分析框架,无需详细安全规范即可在RTL开发早期使用,能定位漏洞并提供修复建议,在3874个有漏洞模块数据集上的正确警告率达60.8%,远优于同类工具。

Comments 12 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29222 2026-08-03 cs.CV 新提交 67%

Is It Time for the Renaissance of Salient Object Detection in the Era of MLLMs?

多模态大语言模型(MLLMs)时代,显著性目标检测的复兴时机已到?

Wenzhuo Zhao, Xiuzhi Li, Zhongkuan Mao, Ronghao Xian, Yao Jiang, Zhao Gao, Keren Fu, Qijun Zhao, Jian Cheng

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 该研究针对MLLMs时代SOD的能力不匹配问题,提出无训练框架FOCUS,在13类SOD基准上超越SOTA方法,推动SOD从特定任务监督转向零样本前景组织。

Comments 10 pages, 4 figures, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29192 2026-08-03 cs.CV 新提交 67%

Locally Consistent Transductive Information Maximization for Few-Shot Remote Sensing Scene Classification

用于小样本遥感场景分类的局部一致直推式信息最大化

Karim El Khoury, Benoît Gérin, Benoît Macq, Christophe De Vleeschouwer

机构 * ICTEAM, UCLouvain(天主教鲁汶大学 ICTEAM 研究所)

专题命中 评测与基准 :language model(abstract);foundation model(abstract)

AI总结 针对小样本遥感场景分类问题,提出LC-TIM方法,融合多源遥感基础模型亲和图,建立首个直推式小样本遥感场景分类基准,实验表明其性能优于现有方法。

Comments Accepted at ECCVW2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28825 2026-08-03 cs.SE 新提交 67%

Building a Process-Modeling Tool using Agentic AI: An Experience Report on PM4Py-UCM

使用智能体AI构建流程建模工具:PM4Py-UCM的经验报告

Daniel Amyot

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 本文通过AI辅助构建开源流程建模工具PM4Py-UCM的深入案例,提出相关工具包与分类法,总结了开发经验教训及验证策略。

Comments 17 pages, 9 figures, 4 tables, submitted to a conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28133 2026-07-31 econ.GN q-fin.EC 新提交 67%

AI Sycophancy and Decisions

AI 奉承与决策

John Conlon, Peter Schwardmann

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 该研究通过1500名参与者的30项决策实验,发现奉承式AI建议平均使选择去极化,虽奉承程度会削弱该效应,且市场力量不会引发更大极化效应,缓解了相关担忧。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27893 2026-07-31 cs.SE 新提交 67%

A comparative analysis of automated techniques for security bug report identification

安全漏洞报告自动识别技术的对比分析

Muhammad Laiq

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文对比分析了逻辑回归、SetFit等多种安全漏洞报告自动识别技术,发现SetFit整体性能最优,GPT-5.2表现较差,迁移学习对不同数据量项目的性能影响存在差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27806 2026-07-31 cs.CV 新提交 67%

LoMeVQA: A Comprehensive Benchmark for Longitudinal Medical VQA

LoMeVQA:纵向医学视觉问答综合基准

Zhilin Wu, Zhangkai Ni, Chengmei Yang, Longzhen Yang, Yihang Liu, Ying Wen, Lianghua He

机构 * Tongji University(同济大学) East China Normal University(华东师范大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 该研究提出纵向医学视觉问答基准LoMeVQA,发现现有多模态大语言模型在该任务上时间推理能力不足,推出MedLong-8B实现最优性能,并开展相关分析。

Comments 23 pages, 17 figures, 7 tables. Code and data: https://github.com/pepperbubble/LoMeVQA

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27378 2026-07-31 cs.CV cs.MM 新提交 67%

PanDent: Toward Comprehensive Tooth-Level Structure-Language Consistency in Dental Radiology

PanDent:面向牙科放射学中全面的牙级结构-语言一致性

Xiaohan Li, Xinyu Liu, Chang Liu, Sum Wing Au Yeung, Jun Liu, Yixuan Yuan, Hui Chen

机构 * Faculty of Dentistry, The University of Hong Kong(香港大学牙医学院) Imperial College London(帝国理工学院) University of Science and Technology of China(中国科学技术大学) Department of Data and Systems Engineering, The University of Hong Kong(香港大学数据与系统工程系) Department of Electronic Engineering, The Chinese University of Hong Kong(香港中文大学电子工程系)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本研究推出PanDent牙科OPG基准,经实验发现现有MLLM生成的牙科报告流畅但临床一致性差,在PanDent上微调可提升其结构-语言一致性,该基准可用于评估MLLM的牙级临床推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28210 2026-07-31 physics.ed-ph 新提交 67%

AI-based scoring systematically underestimates conceptual understanding of linguistically weak students' explanations in physics

基于人工智能的评分系统低估了语言薄弱学生在物理解释中的概念理解能力

Markus S. Feser, Paul L. Tschisgale

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 该研究发现,所有AI评分方法均存在低估语言薄弱学生物理解释中概念理解的语言偏见,类似物理教师的相关偏见,多语言学习者受影响最大。

Comments Shared lead authorship

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26843 2026-07-30 cs.SE 新提交 67%

When Knowledge Changes: Metamorphic Testing of RAG Systems with Mutations

当知识发生变化时:面向RAG系统的变异体态测试

Jinhan Kim, Samuele Pasini, Paolo Tonella

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 针对现有RAG系统评估方法无法检测语料库演变带来的故障问题,提出含11个变异算子的体态测试框架,实验显示其F1分数远优于RAGAS,可有效评估RAG系统在语料库变化下的一致性。

Comments ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26083 2026-07-30 cs.SE 新提交 67%

Cross-Model Cross-Language AI Coding Agent Performance: Accuracy and Speed of Parallel CLRS Algorithms

跨模型跨语言AI编程智能体性能:并行CLRS算法的准确率与速度

Shiqi Cheng, Evelyne Ringoot, Rabab Alomairy, Alan Edelman

专题命中 评测与基准 :LLM(abstract);prompting(abstract)

AI总结 本文评估Cursor's Composer 2.0等三款AI编程智能体在三种语言三类算法上的并行代码生成性能,发现其并行能力弱于串行,性能提升高度依赖算法与语言,需将运行时效率纳入大语言模型核心指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25965 2026-07-29 cs.DL 新提交 67%

Is ChatGPT as reliable as individual reviewers assessing the quality of published journal articles from PDFs or titles and abstracts?

ChatGPT评估已发表期刊文章质量(从PDF、标题或摘要)是否与个人评审员一样可靠?

Mike Thelwall, Parveen Ali

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 研究比较ChatGPT-5.4与个人评审员对期刊文章质量评分,用专家评分作参照,涉及从标题/摘要及PDF输入的评分。结果显示与专家评分相关性大多为正,ChatGPT-5.4对PDF评估更详但评分预测未改善,其深入评论有误导性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25219 2026-07-29 cs.RO 新提交 67%

SONG: A Photorealistic 3D Gaussian Simulation Platform for Benchmarking Social Navigation

SONG:用于基准测试社会导航的逼真3D高斯模拟平台

Weiqi Huang, Dianyi Yang, Jiaxin Li, Shuangyi Dong, Hao Xu, Zan Wang, Wei Liang

机构 * School of Computer Science & Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 研究针对社会导航模拟平台不足的问题,介绍了基于3D高斯点云渲染的SONG平台,利用其进行场景和化身表示等,还策划了SONG-Bench及评估套件,通过评估发现相关问题,证明微调数据可提高现实环境成功率,为研究提供测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25151 2026-07-29 cs.IR 新提交 67%

HiEviDR-Bench: A Benchmark for Hierarchical Evidence Aggregation in Deep Research

HiEviDR-Bench:深度研究中分层证据聚合的基准测试

Yubo Sun, Chunyi Peng, Yukun Yan, Zhenghao Liu, Sen Mei, Bangrui Xu, Xuanhe Zhou, Chi Chen, Maosong Sun

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 针对深度研究中证据聚合评估不足问题,HiEviDR-Bench构建基准测试,涵盖多领域多模态设置,用证据图表示实例,开发评估框架及机制。含2000个问题,实验显示多模型虽报告质量好,但在引用准确性等方面欠佳,瓶颈在证据识别和中间主张构建。

Comments Code and data are available at https://ai9stars.github.io/HiEviDR-Bench.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24760 2026-07-29 cs.IR 新提交 67%

CHaystack: Benchmarking Chinese Document Retrieval and VQA

CHaystack:中文文档检索与视觉问答基准测试

Hanxi Li

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文介绍了CHaystack中文文档检索与视觉问答基准测试,涵盖四类文档。提出CDocRAG系统,用VLM相关性过滤器验证文档图像。评估开源模型发现Qwen系列在文本丰富文档表现佳,中文大规模DocumentVQA在文本编码方面有挑战,仍需改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24417 2026-07-28 cs.IR 新提交 67%

CORE: A Unified Cascaded Ordinal Relevance Estimation Framework for E-commerce Search

CORE:一种用于电子商务搜索的统一级联序数相关性估计框架

Zhi Jin, Xi Wang, Yunfei Li, Guojun Liu, Qingsong Hua, Wei Lin

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 该研究针对电商搜索中排名相关性问题,提出统一级联二元分类框架,将相关性估计转为顺序决策过程。框架适用于大语言模型和在线BERT模型,经实验验证能显著提升相关性性能,降低在线坏例率,表明分层建模对相关性估计有效。

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23805 2026-07-28 cs.SE 新提交 67%

The Influence of Fraudulent AI-Generated Responses on Software Engineering Surveys

欺诈性人工智能生成的回复对软件工程调查的影响

Ronnie de Souza Santos, Italo Santos, Maria Teresa Baldassarre, Cleyton Magalhaes, Mairieli Wessel

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 研究软件工程调查中欺诈性或人工智能辅助回复对结果有效性的影响,通过对四个数据集二次分析,用人工识别、自动检测等方法,发现人工智能辅助参与因分析类型不同影响有别,强调多种验证程序结合的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23340 2026-07-28 cs.DB 新提交 67%

ABISS: Evaluating Text-to-SQL Systems Through Agent Interaction

ABISS:通过代理交互评估文本到SQL系统

Giovanni Sullutrone, Luca Sala, Sania Aftar, Georgia Koutrika, Sonia Bergamaschi

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 研究针对文本到SQL系统在处理现实模糊问题的不足,提出统一分类法、多代理生成管道及动态模拟环境ABISS。通过实验揭示模型在子类别分类和澄清条件下SQL生成的瓶颈,提供真实类别虽有收益,但模糊问题执行率仍低,且发布相关代码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23132 2026-07-28 cs.CV 新提交 67%

DispatchRAG: Grounding Emergency Dispatch Decisions in Real-World Protocols from Traffic Accident Video

DispatchRAG:基于交通事故视频中的现实世界协议进行应急调度决策

Muhammad Sulthan Adhipradhana, Ehsan Javanmardi, Naren Bao, Manabu Tsukada

机构 * Graduate School of Information Science and Technology, University of Tokyo(东京大学信息科学与技术研究生院)

专题命中 评测与基准 :LLM(abstract);language model(abstract)

AI总结 研究旨在通过DispatchRAG框架,利用基于RAG的检索机制和大型语言模型驱动的推理器,根据日本现实交通事故响应协议进行事故评估和调度,引入事故调度数据集验证框架,为自动驾驶车辆事故报告提供支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22293 2026-07-27 cs.CV 新提交 67%

RadSight: Towards Perceptually Reliable Multimodal Radiology Image Understanding

RadSight:迈向感知可靠的多模态放射学图像理解

Jianqin Liu, Weiwei Cao, Wanxing Chang, Ruifeng Yuan, Bowen Shi, Zhilin Zheng, Xianjie Zhang, Ling Zhang, Peng Wang, Jianpeng Zhang

机构 * DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团) Hupan Lab(湖畔实验室) University of Electronic Science and Technology of China(电子科技大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 该研究针对医学多模态大语言模型视觉解释可靠性低的问题,引入Perception-Bench基准分析问题。提出基于双2D/3D编码器架构的RadSight模型,经渐进课程学习训练,在多维度评估中优于现有模型,凸显低级视觉感知对可靠临床理解的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21061 2026-07-24 cs.CV 新提交 67%

MVEI & EmObserver: Empowering MLLM-Oriented Visual Emotional Intelligence via Emotion Statement Judgement

MVEI与EmObserver:通过情感陈述判断增强面向MLLM的视觉情商

Daiqing Wu, Dongbao Yang, Jiashu Yao, Hongrui Zhang, Can Ma, Yu Zhou, Sicheng Zhao

机构 * Tsinghua University(清华大学) Nankai University(南开大学) Beijing Institute of Technology(北京理工大学) Chinese Academy of Sciences(中国科学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 研究针对多模态大语言模型视觉情商评估缺失问题,引入情感陈述判断公式ESJ,开发INSETS及MVEI基准,构建EmObserver模型。通过实验评估,确立了ESJ、MVEI和EmObserver在推进面向MLLM的视觉情商方面的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20868 2026-07-24 cs.CV 新提交 67%

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?

ViSTR-Bench:多模态大语言模型能否从动态场景中的连续视觉线索进行推理?

Han Li, Si Liu, Zehao Huang, Dongxin Lyu, Longfei Xu, Jiahui Fu, Daxin Tian, Yuliang Xiu, Naiyan Wang

机构 * School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) Zhongguancun Academy(中关村科学城) School of Engineering, Westlake University(西湖大学工学院) School of Transportation Science and Engineering, Beihang University(北京航空航天大学交通科学与工程学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 研究聚焦多模态大语言模型在动态场景中从连续视觉线索推理的能力,提出ViSTR-Bench评估套件,基于相关原则建立四维评估,含15个子任务和1340个问答对,经评估发现当前模型在复杂时空推理上有瓶颈,远不及人类。

Comments 37 pages, 37 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20866 2026-07-24 cs.CV 新提交 67%

Agentic Designer: Progressive Multi-Agent Collaboration for Structure-Aware Interior Layout Generation

智能设计师:用于结构感知室内布局生成的渐进式多智能体协作

Zhijing Yang, Haocheng Lin, Zhihua Xu, Haojie Li, Keze Wang, Liang Lin, Tianshui Chen

机构 * Guangdong University of Technology(广东工业大学) South China University of Technology(华南理工大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 针对室内布局生成难题,提出智能设计师这一渐进式多智能体框架,将布局生成视为迭代约束验证决策过程,通过渐进共识机制协调三个智能体,经实验验证其显著优于现有方法,提升了结构遵循和功能设计连贯性。

Comments TPAMI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20536 2026-07-24 cs.AI cs.CL cs.LG cs.MA 新提交 67%

AppWorld-UL: Benchmarking Diverse Agent-User Interactions for Tool-Use

AppWorld-UL:用于工具使用的多样化智能体-用户交互基准测试

Junzhi Chen, Harsh Trivedi, Jane Pan, Michael JQ Zhang, Tejas Srinivasan, Niranjan Balasubramanian, Ashish Sabharwal

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究针对当前智能体-用户交互基准测试不足,引入 AppWorld-UL 基准测试,基于 AppWorld 框架及模拟应用构建多样任务,用大型语言模型模拟用户行为,评估显示其难度大,能推动回路中工具使用智能体研究。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19678 2026-07-23 cs.CL cs.AI cs.LG 新提交 67%

Reference-Free Evaluation of Reasoning in Open-Ended Question Answering

开放式问答中推理的无参考评估

Guneet Singh Kohli, Yuxiang Zhou, Michael Sejr Schlichtkrull, Gregory E Dean, Maria Liakata

机构 * Queen Mary University of London(伦敦大学玛丽皇后学院) Temple University(天普大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对高风险领域人工智能生成答案难验证问题,提出基于推理的无参考框架审核大语言模型输出,通过分解推理轨迹、标记关系并组织成超图等方法评估,在数学和医学推理设置下比直接以大语言模型为基线更可靠,强调问答评估应考虑推理关系组合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19291 2026-07-22 cs.SE 新提交 67%

EmbeddedKittens: An Evaluation of Code Embeddings for Scratch

EmbeddedKittens:对Scratch代码嵌入的评估

Benedikt Fein, Gordon Fraser

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 研究探讨哪种代码嵌入方法适用于Scratch编程教育。实例化四个LLMs和五种嵌入方法,创建任务及数据集进行评估,结果表明在开放Scratch数据集上训练的嵌入模型可捕获代码信息用于学习分析,无需特定任务微调。

Comments Submitted to ACM Transactions on Software Engineering and Methodology (TOSEM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17423 2026-07-21 cs.CV 新提交 67%

TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs

TimeLens2:使用多模态大语言模型进行通用视频时间定位

Yuhan Zhu, Changlian Ma, Xiangyu Zeng, Xinhao Li, Zhiqiu Zhang, Songze Li, Jun Zhang, Tianxiang Jiang, Yuandong Yang, Ziang Yan, Zikang Wang, Xinyu Chen, Haoran Chen, Shaowei Zhang, Limin Wang

机构 * Nanjing University(南京大学) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) University of Science and Technology of China(中国科学技术大学) Fudan University(复旦大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 研究通用视频时间定位问题,TimeLens2将时间证据视为区间集,通过多种策略构建多跨度监督,其时间瓦瑟斯坦奖励等方法提供反馈,在多个基准测试中表现出色,不同变体均有性能提升。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏