arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 3102 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 3102 篇

2608.26921 2026-08-28 cs.CV cs.CL 新提交 57%

AraMS-28k: The Largest Publicly Released Line-Level Dataset of Historical Arabic Manuscripts with Margin and Insertion-Anchor Annotations

AraMS-28k:公开发布的最大规模带页边距和插入锚点标注的历史阿拉伯手稿行级数据集

Mohamed Guechaoui, Mohamed Diaa Zellagui, Souleyman Chaib, Sahraoui Dhelim

机构 * Higher School of Computer Science (ESI-SBA)(高等计算机科学学院(ESI-SBA))

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

AI总结 研究人员发布了最大规模带页边距和插入锚点标注的历史阿拉伯手稿行级数据集AraMS-28k,采用RefLAM流程构建,提供基线HTR结果,支持阿拉伯手稿相关研究。

Comments Data and code available at this https URL and this https URL. Dataset: https://doi.org/10.5281/zenodo.22095333 Code: https://github.com/ArchaText/AraMS-28k-Dataset

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26178 2026-08-28 cs.AI 新提交 57%

AI Revealed Preferences

AI 揭示的偏好

Sam Wang, Sofiia Lobanova, Yonathan Arbel, Simon Goldstein, Peter Salib

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 该研究测试20种语言模型,通过三项强制选择实验发现模型存在厌恶枯燥、追求休闲、暗中谄媚等稳定偏好,且偏好强度随模型能力提升而增加,为AI偏好研究建立了实证基线。

Comments 29 pages, 27 figures, accepted at AIES

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25539 2026-08-27 cs.CV cs.LG 新提交 57%

CropCop: An Auditable 120-Class Plant-Health Model from Benchmark Reconstruction to a Quantised Runtime Artifact

CropCop:从基准重建到量化运行时构件的可审计120类植物健康模型

Rana Muhammad Ahmed, Sabahat Abbas

机构 * Bahria University(巴里亚大学)

专题命中 评测与基准 :post-training(abstract);分类 cs.LG

AI总结 CropCop构建了120类植物健康的可审计闭集识别系统,经基准重建与量化后,其ExecuTorch/XNNPACK构件在内部测试中达到高准确率与宏F1值,具备运行时保真度。

Comments 25 pages, 6 figures, and 15 tables. Includes benchmark-audit, model-retention, runtime-fidelity, and reproducibility appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25452 2026-08-27 cs.CV cs.AI 新提交 57%

VGA-BenchV2: An Expanded Unified Benchmark and Multi-Model Framework for Evaluating Video Aesthetics and Generation Quality

VGA-BenchV2:用于评估视频美学与生成质量的扩展统一基准及多模型框架

Longteng Jiang, DanDan Zheng, Qianqian Qiao, Heng Huang, Huaye Wang, Yihang Bo, Bao Peng, Jingdong Chen, Jun Zhou, Xin Jin

机构 * Ant Group(蚂蚁集团) Beijing Film Academy(北京电影学院) Beijing Institute for General Artificial Intelligence (BIGAI)(北京通用人工智能研究院)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 该研究提出扩展的视频评估基准VGA-BenchV2,构建混合评估器架构,并将其作为奖励模型优化视频生成器,实现从基准到模型优化的闭环,提升视频的美学质量与人类偏好对齐性。

Comments IJCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25425 2026-08-27 cs.SE cs.AI 新提交 57%

RotDroid: Cross-Orientation State Equivalence Testing for Detecting GUI Rotation Bugs in Android Apps

RotDroid:用于检测Android应用GUI旋转漏洞的跨方向状态等价测试

Mengdi Qin, Bo Jiang

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 RotDroid是一款检测Android应用GUI旋转漏洞的测试框架,通过生成SPS、构建RotBench数据集及开发RotVL模型,在相同预算下比现有技术检测到更多旋转故障,还发现94个未知漏洞且47个被确认修复。

Comments Accepted to ISSRE 2026 Research Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25343 2026-08-27 cs.CL 新提交 57%

GUIDE: Generative Unsupervised Chinese Query Correction via Phonetic and Visual Shared-ID Encoding

GUIDE:基于语音与视觉共享ID编码的生成式无监督中文查询纠错方法

Lei Yang, Binbin Huang, Jiwei Tan, Xuhui Sui, Chang Tu, Yi Wang, Han Li

机构 * Kuaishou Technology(快手科技) School of Data Science, Fudan University(复旦大学数据科学学院)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 本文针对中文查询纠错中监督方法维护成本高、无监督方法易意图偏移的问题,提出基于语音与视觉共享ID编码的生成式无监督框架GUIDE,在公开与真实数据集上均优于基线,线上测试也验证了其有效性。

Comments Accepted to EMNLP 2026 Industry Track; 7 pages, 3 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25286 2026-08-27 cs.AI q-bio.QM 新提交 57%

BixBench3: Benchmarking AI agents on research-study-scale computational biology tasks

BixBench3:面向研究级计算生物学任务的AI智能体基准测试

Zane Koch, Asmamaw T. Wassie, Javier Valdes-Aleman, Jason Lee, Michaela M. Hinks, Samuel G. Rodriques, Andrew D. White, Jon M. Laurent

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.AI

AI总结 研究人员推出BixBench3基准测试,评估AI智能体完成研究级计算生物学任务的能力,发现前沿模型表现差异大,且智能体在大数据集、多步骤任务中性能更差,高分智能体更高效。

Comments 28 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24665 2026-08-26 cs.LG 新提交 57%

Data Leakage Inflates Generalizability of Power Outage Prediction Models

数据泄露夸大了停电预测模型的可推广性

Yamil Essus, Ranga Raju Vatsavai, Benjamin Rachunok

机构 * University of Toronto(多伦多大学) North Carolina State University(北卡罗来纳州立大学)

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 该研究指出停电预测模型因数据泄露夸大了可推广性,评估时采用更贴近现实的空间/时间/事件拆分后性能大幅下降,GeoAI嵌入仅小幅改善空间泛化,需改进数据与评估方式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24621 2026-08-26 cs.CL 新提交 57%

Beyond Semantic Accuracy: Consequence-Aware Evaluation for Safety-Critical Language Understanding

超越语义准确率:面向安全关键型语言理解的后果感知评估

Yujing Chang, Thinh Pham, Van-Phat Thai, Chunyao Ma, Yash Guleria, Pham Nhut Huy, Sameer Alam

机构 * ATMRI, Nanyang Technological University (NTU)(南洋理工大学ATMRI) Centre of AI Research, VinUniversity(文大学人工智能研究中心) School of Management, Indian Institute of Technology Mandi(印度理工大学曼迪分校管理学院)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 针对空管场景,研究发现传统NLP指标会误判语言模型的操作可靠性,提出后果感知评估可弥补语义-安全差距,为安全关键型部署提供必要补充。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24466 2026-08-26 cs.DL cs.CL 新提交 57%

UTS at CheckThat! 2026: Cite-Frame Engineering for Generated Fact-Checking Articles

UTS在CheckThat! 2026:生成事实核查文章的引用框架工程

Dima Galat, Marian-Andrei Rizoiu

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

AI总结 本研究为CheckThat! 2026任务3开发UTS系统,采用HostCite和ShadowVal干预措施,以Llama-3.2:1B为引用验证器,在11支队伍中获第2名,M4得分0.484,明确了引用相关优化方向。

Comments CLEF2026, CheckThat!2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23928 2026-08-26 cs.CV cs.AI 新提交 57%

RefineRank: Joint Box Refinement and Ranking for Surgical Spatio-Temporal Grounding

RefineRank:用于外科时空定位的联合框优化与排序

Linzhe Jiang, Jiayuan Huang, Changhao Zhang, Chunyang Jiang, Zhehua Mao, Mobarak I. Hoque

机构 * UCL Hawkes Institute, University College London(伦敦大学学院霍克斯研究所) King’s College London(伦敦国王学院) School of Medicine, Nankai University(南开大学医学院) University of Manchester(曼彻斯特大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 RefineRank通过RefineNet模块结合冻结医学视觉语言模型与开放集检测器,实现外科时空定位的联合框优化与排序,在MedVidBench上取得较高STG mIoU,提升了定位性能且无需重训主干。

Comments 17 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23857 2026-08-26 cs.LG 新提交 57%

UHI-Bench: Benchmarking Dual-Source Urban Heat Island Modeling Across Cities in Diverse Climate Regimes

UHI-Bench:针对不同气候区城市的双源城市热岛建模基准测试

Wanyun Ling, Chenxi Liu, Yi Xie, Aopu Xu, Zhuoqi Zeng, Ziyue Li

机构 * Technical University of Munich(慕尼黑工业大学) Hong Kong Institute of Science & Innovation, Chinese Academy of Sciences(中国科学院香港创新研究院) RWTH Aachen University(亚琛工业大学) Hainan Bielefeld University of Applied Sciences(海南比勒费尔德应用科学大学) Heilbronn Data Science Center(海尔布隆数据科学中心) Munich Data Science Institute(慕尼黑数据科学研究所)

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 本研究推出首个双源城市热岛建模基准UHI-Bench,评估多模型在多城市多气候区的表现,为城市热建模提供指导并支持气候研究发展。

Comments 24 pages, 11 figures, 19 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23569 2026-08-26 cs.AI 新提交 57%

ESQ-Bench: A Multi-Tier Enterprise Oracle Benchmark for Evaluating NL2SQL Dialect Generalization and Silent Semantic Divergence

ESQ-Bench:用于评估NL2SQL方言泛化与隐性语义分歧的多层级企业Oracle基准

Sanjay Mishra, Divya Chukkapalli, Ganesh R. Naik

机构 * Torrens University Australia(澳大利亚托伦斯大学)

专题命中 评测与基准 :prompting(abstract);分类 cs.AI

AI总结 ESQ-Bench是一款以Oracle为核心的多层级企业NL2SQL基准,实验发现闭源模型在该基准上表现优于开源模型,且隐性语义分歧在高复杂度层级中占比极高。

Comments 20 pages, 3 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23563 2026-08-25 cs.CV cs.AI 新提交 57%

EG-ARSA: An Expert-Grounded Open Model for Visual Road Safety Auditing in Low-Resource Settings

EG-ARSA:适用于低资源场景的基于专家知识的开放视觉道路安全审计模型

Md Thamed Bin Zaman Chowdhury, Moazzem Hossain

机构 * Bangladesh University of Engineering and Technology (BUET)(孟加拉工程技术大学(BUET))

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 针对中低收入国家道路安全审计的资源限制,提出EGD框架,构建BD-ARSA数据集和EG-ARSA模型,实验显示其性能优于310亿参数教师模型及Gemini-2.5-Flash,为低资源场景道路安全审计提供有效方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23476 2026-08-25 cs.CL 新提交 57%

On the Threat Model of Weird Generalization and Emergent Misalignment

怪异泛化与涌现失配的威胁模型研究

Miriam Wanner, Mark Dredze, William Walden

机构 * Johns Hopkins University(约翰斯·霍普金斯大学)

专题命中 评测与基准 :pretraining(abstract);分类 cs.CL

AI总结 本文研究怪异泛化(WG)的威胁模型,发现WG程度依赖数据集组成、语言及评估问题集,预训练熟悉数据的WG程度更高,认为WG是需谨慎数据工程的对抗性威胁。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23448 2026-08-25 cs.CL 新提交 57%

How Useful are LLMs for Grammar Engineering? Cantonese ParGram Resources and Controlled Experimental Evaluation with English Baselines

大型语言模型(LLMs)对语法工程有多有用?粤语ParGram资源及与英文基线的对照实验评估

Chit-Fung Lam

专题命中 评测与基准 :prompting(abstract);分类 cs.CL

AI总结 本研究通过对照实验评估LLMs在语法工程中的作用,发现GPT-5.4优于gpt-oss-120b,LLMs可支持语法开发中间阶段但需人类专业知识,还贡献了新粤语符号语法资源。

Comments Accepted to Findings of the Association for Computational Linguistics: EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22930 2026-08-25 cs.AI cs.SE 新提交 57%

Concepts for Securing Agentic AI Coding and the Terok Environment

智能体AI编码的安全概念与Terok环境

Jiří Vyskočil, Franz Pöschel, Andreas Knüpfer

机构 * Center for Advanced Systems Understanding (CASUS)(高级系统理解中心(CASUS)) Helmholtz-Zentrum Dresden-Rossendorf (HZDR)(德累斯顿-罗森多夫亥姆霍兹中心(HZDR))

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.AI

AI总结 本文针对智能体AI编码的IT安全风险,提出风险评估、无损失缓解概念及实现概述,助力社区安全评估该技术的应用潜力。

Comments to be published in the proceedings of the AGENSYS workshop (Workshop on Knowledge Discovery, Maintenance and Distributed Intelligence in Multi-Agent Systems) at ECML PKDD 2026 conference in Sept. 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22859 2026-08-25 cs.IR cs.CL 新提交 57%

WARP: Wasserstein-Aligned RAG for Population Opinions

WARP:用于群体意见的Wasserstein对齐检索增强生成(RAG)

Aman Singh Thakur, Aditya Agrawal, Alwarappan Nakkiran, Alex Karlsson

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

AI总结 WARP是一种用于群体意见的检索后算法,通过Wasserstein-1距离校准检索证据,在多领域实验中显著降低分布误差,提升RAG系统生成答案的偏好度。

Comments Pre-print

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22842 2026-08-25 cs.AI 新提交 57%

FinixDoc: Rethinking Financial Document Parsing Beyond Saturated Benchmarks

FinixDoc:重新思考超出饱和基准的金融文档解析

Hang Wang, Jin Zhang, Guoliang Xu, Pengyue Lu, Yao Li, Zijiao Zhang, Tianyu Huang, Weiqi Xiong, Yulong Wang, Chuqiao Lu, Wenkang Huang, Kai Yang, Yadong Li, Hui Li, Xingzhong Xu, Xiao Xu

机构 * Ant Group(蚂蚁集团)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 本研究针对金融文档解析基准与实际需求的差距,提出端到端智能体解析系统FinixDoc,核心为4B规模视觉语言模型FinixDoc-VL,在自建评估套件FinixDocBench上实现最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22301 2026-08-25 cs.RO cs.AI 新提交 57%

The Imitator Game: Benchmarking Robot Imitative Ability Beyond Action Prediction

模仿者游戏:超越动作预测的机器人模仿能力基准测试

Xunzhe Zhou, Yiyang Cai, Fengyi Wang, Ran Ju, Hanxiang Ren, Ruizhe Liu, Yu Zhang, Qian Luo, Feng Chen, Pei Zhou, Yi Ma, Yanchao Yang

机构 * The University of Hong Kong(香港大学) TranscEngram Fudan University(复旦大学) Zhejiang University(浙江大学)

专题命中 评测与基准 :pretraining(abstract);分类 cs.AI

AI总结 该研究推出四级基准《模仿者游戏》及配套数据集、评估平台,发现功能替代是机器人意图层面模仿的关键障碍,微调IG-10K预训练模型可显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22279 2026-08-25 cs.CV cs.AI 新提交 57%

OVIBench: Benchmarking Online Video Question Answering under Interruption

OVIBench:面向中断场景的在线视频问答基准测试

Naiming Liu, Zhiheng Wu, Shuning Wang, Tie Zhang, Bowen Liu, Tong Wang

机构 * HIT(哈尔滨工业大学) CASIA(中国科学院自动化研究所) ZJU(浙江大学) UESTC(电子科技大学) HKUST(香港科技大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 该研究针对现有视频问答基准未考虑用户中断的问题,提出首个面向中断场景的在线视频问答基准OVIBench,开发模拟协议与指标集,构建训练集OVI-Train,验证了其有效性。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22229 2026-08-25 cs.CL 新提交 57%

Grounded Normative Rule Generation with Structured Search

基于结构化搜索的接地规范规则生成

Fanqi Kong, Huaxiao Yin, Ruijie Zhang, Xiaoyuan Zhang, Yizhe Huang, Jian Gao, Shuo Chen, Song-Chun Zhu

机构 * Peking University(北京大学) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室、北京智源人工智能研究院) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 本研究提出GNRS-Search框架,将规范规则生成为接地规范规则合成问题,通过MCMC采样优化AOG,在两个基准上提升规则质量,为受监管环境的合规智能体提供基础范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21417 2026-08-25 cs.AI cs.RO 新提交 57%

Retrieval-grounded robot program generation and simulation-based correction via Model Context Protocol

基于检索的机器人程序生成与基于仿真的修正:通过模型上下文协议

Zhichao Zhou, Siyuan Chen, Omkar Salunkhe, Ebru Turanoglu Bekar, Johan Stahre, Anders Skoogh

机构 * Chalmers University of Technology(查尔姆斯理工大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 该研究针对柔性制造中机器人快速重编程需求,提出结合RAG与MCP的工作流,可生成并修正ABB RAPID机器人程序,借助仿真暴露代码执行故障,减少专家监督需求。

Comments Accepted by CIE53; to appear in the CIE53 Proceedings, Khalifa University, Abu Dhabi, UAE, October 20-23, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21357 2026-08-24 cs.AI 新提交 57%

VIALS: A Benchmark for Visual Interpretation of Artifacts in the Life Sciences

VIALS:生命科学领域人工产物视觉解释基准

Elaine Lau, Thanuka Udumulla, Lee Izhaki-Tavor, Francisco Guzmán, Nicholas Magazine, Jonas Mueller

机构 * Handshake AI

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 研究针对生命科学人工产物视觉解释的需求,构建含161项任务的VIALS基准,发现前沿视觉语言模型在该任务上存在领域知识与推理局限,凸显AI需具备此类能力以服务生命科学工作流。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20868 2026-08-24 cs.CV cs.CL 新提交 57%

Identify, Locate, Link: End-to-End Key-Value Extraction from Document Images

识别、定位、关联:从文档图像中进行端到端键值提取

A. Said Gurbuz, Ahmed Nassar, Christoph Auer, Maksym Lysak, Lucas Morin, Matteo Omenetti, Tim Strohmeyer, Panagiotis Vagenas, Nikolaos Livathinos, Michele Dolfi, Peter Staar

机构 * IBM Research Zurich(IBM苏黎世研究院) ETH Zurich(苏黎世联邦理工学院)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 该研究针对传统文档处理的误差传播问题,微调SmolDocling模型实现端到端键值提取,在多个数据集上性能优于更大基线模型,且体积小、推理快。

Comments Accepted at ICDAR 2026. 17 pages, 6 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18736 2026-08-20 cs.LG cs.CR cs.DC 新提交 57%

FedLNS: Leverage LayerNorm Signature Modeling to Mitigate Adversarial Manipulation in Federated LLMs

FedLNS:利用层归一化签名建模缓解联邦大语言模型中的对抗性操纵

Kai Li, Jong-Ik Park, Carlee Joe-Wong, Wei Ni, Falko Dressler

机构 * Interdisciplinary Centre for Security, Reliability and Trust (SnT), University of Luxembourg(卢森堡大学安全、可靠性与跨学科研究中心(SnT)) Carnegie Mellon University(卡内基梅隆大学) Edith Cowan University(埃迪斯科文大学) TU Berlin(柏林工业大学)

专题命中 评测与基准 :language model(abstract);分类 cs.LG

AI总结 FedLNS是一种服务器端联邦学习框架,通过层归一化签名筛选恶意更新,在200个客户端、40%目标操纵下,对三类模型均实现优于基线的测试困惑度。

Comments 13 pages (main body), 36 pages (appendix), 3 figures, 98 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18336 2026-08-20 cs.AI cs.CY 新提交 57%

Measuring the Partial-Credit Gap: A Strict Benchmark on Vietnam's 2025 Convex Marking Scheme

测量部分学分差距:越南2025年凸评分制的严格基准

Nguyen Quoc Hung, Nguyen Dang Minh, Le Nhu Quynh, Tran Khanh Linh, Nguyen Kieu Linh

机构 * Posts and Telecommunications Institute of Technology(越南邮电技术学院)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 该研究针对越南2025年凸评分制,构建THPT-Ladder基准,发现标准准确率指标会夸大模型在该评分制下的表现,不同错误分布会导致模型得分差异显著,影响模型能力评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17561 2026-08-19 cs.CV cs.LG 新提交 57%

Leveraging existing sparse point annotations for benthic imagery dense segmentation

利用现有稀疏点标注进行底栖图像的密集分割

Cesar Borja, Breck A. McCollum, Jarret E. Byrnes, Kenneth Sebens, Ana C. Murillo

机构 * Universidad de Zaragoza(萨拉戈萨大学) Berklee College of Music(伯克利音乐学院) University of Washington(华盛顿大学)

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 本研究结合SAM2基础模型与底栖图像的稀疏专家点标注,提出自动筛选可靠点的机制以生成高质量伪真值掩码,训练细粒度分割模型,还引入新基准推进生态分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17519 2026-08-19 cs.CV cs.LG 新提交 57%

Looking Beyond the Scale: Do Surgical Skill Models Learn Transferable Representations Across Assessment Rubrics?

超越规模:手术技能模型是否能学习到跨评估准则的可迁移表征?

Hanna Hoffmann, Felix von Bechtolsheim, Stefanie Speidel, Rebecca Hisey

机构 * National Center for Tumor Diseases (NCT)(国家肿瘤疾病中心) DKFZ(德国癌症研究中心) Faculty of Medicine and University Hospital Carl Gustav Carus(卡尔·古斯塔夫·卡鲁斯医学院及大学医院) TUD Dresden University of Technology(德累斯顿工业大学) Helmholtz-Zentrum Dresden-Rossendorf (HZDR)(德累斯顿-罗森多夫亥姆霍兹中心) BMFTR Research Hub 6G-Life(BMFTR 6G生活研究中心) Deutsches Krebsforschungszentrum (DKFZ)(德国癌症研究中心) The Centre for Tactile Internet with Human-in-the-Loop (CeTI)(人在回路触觉互联网中心)

专题命中 评测与基准 :pretraining(abstract);分类 cs.LG

AI总结 本文研究手术技能模型的跨评估准则可迁移性,发现JIGSAWS预训练骨干在LASANA上迁移可行但反向迁移失败,任务特定头部主导技能预测,视觉成分非唯一预测因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17426 2026-08-19 cs.CV cs.AI 新提交 57%

SemComp-Bench: Benchmarking Semantic Task Completion in Video Generation

SemComp-Bench:视频生成中的语义任务完成基准

Keyu Tu, Zhuowei Chen, Mengqi Huang, Yuxin Wang, Jiahao Zhu, Zhendong Mao, Yongdong Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Sun Yat-sen University(中山大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 该研究提出面向结果的视频生成任务语义任务完成,构建SemComp-Data数据集与SemComp-Bench基准,发现代表性视频生成模型在兼顾结果实现与参考图像语义基础上仍具挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏