arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-20 至 2026-08-20 共收录 283 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 72 篇

2608.18131 2026-08-20 cs.AI cs.CL cs.CY 新提交 73%

Safety Alignment Illusion: The Cross-Lingual Safety Gap in LLMs

安全对齐错觉:大语言模型中的跨语言安全差距

Namya Bhatnagar

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对 LLMs 安全对齐以英语为中心导致的跨语言偏见问题,提出多语言评估基准 INCLUDE,评估十款 LLMs 后发现孟加拉语在开源模型中偏见最高、英语在开源与闭源模型中偏见表现反转的现象。

Comments 7 pages, 8 figures, submitted to IEEE SLT (Spoken Language Technology) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18102 2026-08-20 cs.CL cs.LG stat.ML 新提交 73%

Stability-Aware Feature Design for Robust Watermark Detection in Machine-Generated Text

面向机器生成文本鲁棒水印检测的感知稳定性特征设计

Sina Mansouri, Mohit Marvania, Abolfazl Safikhani

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 该研究针对机器生成文本水印检测在多次释义及短文本场景下性能骤降的问题,提出PSS检测框架,结合多类特征与稳定性得分,在多基准数据集和多模型测试中显著提升检测AUC,且通用分类器跨域泛化性强。

Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026), Seoul, South Korea. 20 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16645 2026-08-20 cs.AI cs.CL cs.MA 版本更新 73%

Reconstruction: A Blind Benchmark for Recovering Research Ideas from Pre-Publication Bibliographies

重构:从预发表参考文献中恢复研究思路的盲基准

Shaolong Chen, Yanlin Fei, Nazhou Liu, Xinmiao Yu, Lei Li, Rahul Thapa, Madalina Ciobanu, Qingqing Mao, Ritankar Das

机构 * Stanford University(斯坦福大学) Titan Holdings(泰坦控股公司) Prentis AI(普伦蒂斯人工智能公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出Reconstruction盲基准,测试语言模型从预发表参考文献恢复论文思路的能力,发现多智能体流水线可将匹配率提升约2.4倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19002 2026-08-20 cs.AI 新提交 70%

A Theory of Post-hoc Debate Judgement

事后辩论评判理论

Xiang Yin, Adam Dejl, Antonio Rago, Lihu Chen, Francesca Toni

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出适用于智能体辩论场景的事后辩论评判理论,探究两种评判方法的属性满足情况,发现辩论语义是辩论驱动型AI原则性评判者的理想候选。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18740 2026-08-20 cs.AI 新提交 70%

A Multi-Agent Platform for Automated Enterprise Analytics and Insight Generation

用于自动化企业分析与洞察生成的多智能体平台

Manoj N M, Vijayakrishna S, Manjunath Srinivas, Rohit Pahan

机构 * Rakuten India Enterprise Private Limited(乐天印度企业私人有限公司)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出基于CrewAI的多智能体框架,含五个专业智能体,经300个测试用例验证,功能准确率95.3%,较单智能体基线提升显著,可用于自动化企业分析与洞察生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18726 2026-08-20 cs.CL 新提交 70%

Execution-grounded evaluation reveals hidden failures in language-model calculations for environmental science

基于执行的评估揭示语言模型在环境科学计算中的隐藏失败

Maohao Ran, Chendong Ma, Yanting Zhang, Dailing Jiang, Yusen Huang, Meng Gao, Jun Song

机构 * Department of Geography, Hong Kong(香港地理系)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究构建了环境科学计算基准AtmosCoder-Bench,发现现有评估未观测计算过程,多项选择格式会虚高准确率,模型多因未一致应用公式失败,前沿模型仍需专家监督。

Comments 29 pages, 4 figures, 2 tables, plus supplementary materials. Maohao Ran and Chendong Ma contributed equally. Corresponding author: Jun Song (junsong@hkbu.edu.hk). Code: https://github.com/acodercat/AtmosCoder-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18719 2026-08-20 cs.AI 新提交 70%

Competence, Not Accuracy: A Diagnostic for Reference-Free Judge Gates in Skill Optimization

能力而非准确率:技能优化中无参考评判门的诊断方法

Chenle Chen, Yangbo Wei, Chao Yao, Shaoqiang Lu, Junhong Qian, Chen Wu, Lei He

机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校) Shanghai Jiao Tong University(上海交通大学) Arizona State University(亚利桑那州立大学) Eastern Institute of Technology(东方理工学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 该研究提出技能优化中无参考评判门的预部署诊断方法,发现评判器能力需超1/k才具可用性,其基准准确率高估关键能力,可预测门控错误。

Comments 9 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18586 2026-08-20 cs.CV cs.AI 新提交 70%

OmniHandwritingOCR: A Diagnostic Benchmark for Evaluating Multimodal LLMs in Handwritten OCR Scenarios

OmniHandwritingOCR:用于评估多模态大语言模型在手写OCR场景中表现的诊断基准

Zinuo Guo, Min Zhang, Bo Jiang

机构 * East China Normal University(华东师范大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究推出OmniHandwritingOCR手写OCR诊断基准,评估13个多模态模型,发现其在复杂公式上表现差且存在幻觉,为诊断模型失效模式提供测试平台。

Comments CIKM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18579 2026-08-20 cs.CV cs.AI 新提交 70%

MR-IQA-2: Faithful Image Quality Reflection via Fine-Grained Credit Assignment

MR-IQA-2:通过细粒度信用分配实现真实的图像质量反映

Yuan li, Youyuan Lin, Chenhui Chu, Shin'ya Nishida

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究针对现有盲图像质量评估(IQA)中推理真实性不足的问题,提出MR-IQA-2框架,通过解耦推理与评分的细粒度信用分配,在IQA基准上实现了与人类评分的竞争性对齐,还能提供更丰富的视觉理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30497 2026-08-20 cs.CL 版本更新 70%

CanLegalRAGBench: Evaluating Retrieval-Augmented Generation on Canadian Case Law

CanLegalRAGBench:评估加拿大判例法上的检索增强生成

Ethan Zhao, Maksym Taranukhin, Wei Cui, Moira Aikenhead, Vered Shwartz

机构 * Department of Computer Science, University of British Columbia(不列颠哥伦比亚大学计算机科学系) Vector Institute(向量研究所) CIFAR AI Chair Peter A. Allard School of Law, University of British Columbia(不列颠哥伦比亚大学彼得·A·艾尔德法学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 针对法律RAG系统中幻觉问题及加拿大法律评估不足,提出基于真实查询和专家标注的加拿大法律QA基准CanLegalRAGBench,发现检索性能受设计选择影响、开源嵌入模型与闭源模型竞争力相当,但自动评估存在局限且生成答案常偏离黄金标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13068 2026-08-20 cs.CV cs.LG 版本更新 70%

Eyes on the Image: Gaze Supervised Multimodal Learning for Chest X-ray Diagnosis and Report Generation

聚焦图像:用于胸部X光诊断与报告生成的注视监督多模态学习

Tanjim Islam Riju, Shuchismita Anwar, Saman Sarker Joy, Farig Sadeque, Swakkhar Shatabda

机构 * Department of Computer Science and Engineering, Brac University(计算机科学与工程系,布拉克大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本研究基于MIMIC-Eye数据集构建两阶段多模态框架,引入注视监督提升胸部X光诊断准确率与报告空间可解释性,为该领域提供了可复现的新基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18227 2026-08-20 cs.RO 新提交 67%

Revisiting the "Push-T" Robot Manipulation Task with Agentic Robotics

用智能体机器人技术重新审视“Push-T”机器人操作任务

Shuangyu Xie, Kaiyuan Chen, Ken Goldberg

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 该研究在智能体机器人技术背景下,借助带Fable 5的Claude Code编码智能体,无需演示数据解决Push-T等机器人操作任务,其策略成功率达100%,步骤比基准扩散策略少46%,还支持多字母操作及跨实体机械臂仿真。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19116 2026-08-20 cond-mat.mtrl-sci 新提交 67%

JANUS: A Multi-modal Foundation Neural Sampler for Disordered Materials

JANUS:面向无序材料的多模态基础神经采样器

Denis Blessing, Mouyang Cheng, Maximilian Schebek, Jutta Rogal, Mingda Li, Carles Domingo-Enrich, Yuanqi Du

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 研究人员开发JANUS多模态神经采样器,用于无序材料的热力学采样,其以远少于传统方法的能量评估次数重现平衡性质,可用于合金逆设计及半导体缺陷探索,为相关研究提供了基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19192 2026-08-20 astro-ph.SR 新提交 67%

JW-SSD: A Multimodal Benchmark Dataset for Fine-Grained Sunspot Classification

JW-SSD:用于细粒度太阳黑子分类的多模态基准数据集

Hui Wang, Mingfu Shao, Luyang Li, Jiaben Lin, Liyue Tong, Chen Yang, Zhanji Wei

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 该研究提出用于太阳黑子细粒度磁型分类的多模态基准数据集JW-SSD,经质量控制后含36553对图像,可用于训练多种模型,包括取得高准确率的JW-SunSpot。

Comments 15 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16603 2026-08-20 cs.CY 版本更新 67%

Characterizing Agentic Flooding of Government Services

刻画政府服务的智能体泛滥问题

Chris Schmitz, Lewis Hammond, Alan Chan

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 该研究定义了政府服务的智能体泛滥问题,基于84起案例数据集分析其广泛存在性,开发风险矩阵评估高风险服务,梳理政府应对措施并推荐兼顾公平的缓解方案。

Comments To appear in the proceedings of the 9th AAAI Conference on AI, Ethics, and Society (AIES), October 12-14, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04160 2026-08-20 eess.AS cs.SD eess.SP 67%

AffectSpeech: A Large-Scale Emotional Speech Dataset with Fine-Grained Textual Descriptions for Speech Emotion Captioning and Synthesis

AffectSpeech: 一个带有精细文本描述的大型情感语音数据集,用于语音情感描述和合成

Tianhua Qi, Wenming Zheng, Björn W. Schuller, Zhaojie Luo, Haizhou Li

机构 * School of Biological Science and Medical Engineering, Southeast University(东南大学生物科学与医学工程学院) Key Laboratory of Child Development and Learning Science (Southeast University), Ministry of Education(教育部儿童发展与学习科学重点实验室(东南大学)) Chair of Health Informatics (CHI), Technical University of Munich(慕尼黑工业大学健康信息学教席) Group on Language, Audio, & Music (GLAM), Imperial College London(帝国理工学院语言、音频与音乐组) Shenzhen Loop Area Institute(深圳河套学院) Shenzhen Research Institute of Big Data, School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen(深圳市大数据研究院,香港中文大学(深圳)人工智能学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 本文提出AffectSpeech数据集,通过精细文本描述提升语音情感建模的表达能力,采用人机协作标注方法,实验表明其在情感描述和合成任务中表现优异。

Comments Submitted to IEEE Transactions

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19140 2026-08-20 cs.AI cs.CY cs.LG cs.SE 新提交 62%

Grouping the Stochastic Machine: Precision, Not Capability, as the Frontier Metric for AI Systems

分组随机机:将精度而非能力作为AI系统的前沿度量标准

George Andrikopoulos

专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出将精度而非能力作为AI系统的前沿度量,指出当前基准测试未测量精度,定义了分组度量方法,其测量结果可指导决策,且该方法需通过实际工作测量验证规范价值。

Comments 6 pages, 3 figures. Companion to "Tuning the Stochastic Machine", submitted concurrently

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18096 2026-08-20 cs.CL cs.LG 新提交 62%

MAVEN: A Macro-Societal Value Evaluation Framework of Multimodal Content with Compact Aligned Evaluators

MAVEN:基于紧凑对齐评估器的多模态内容宏观社会价值评估框架

Zijuan Zhao, Zheren Fu, Hou Xia, Licheng Zhang, Yi Liu, Zhendong Mao

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 评测与基准 :preference optimization(abstract);分类 cs.CL、cs.LG

AI总结 针对多模态内容宏观社会价值评估难题,提出MAVEN分层框架,构建相关基准与指标,优化评估器,实验表明其2B评估器表现接近前沿闭源VLMs,提供了可扩展评估路径。

Comments 18 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04546 2026-08-20 cs.RO cs.AI cs.CV cs.LG 版本更新 62%

Mask2Real-WM: Segmentation Masks as a Sim-to-Real Bridge for Controllable Dexterous World Models

Mask2Real-WM:作为可控灵巧世界模型的模拟到现实桥梁的分割掩码

Riccardo O. Feingold, Davide Liconti, Chenyu Yang, Robert K. Katzschmann

机构 * Soft Robotic Lab, Department of Mechanical and Process Engineering ETH Zurich, Switzerland(苏黎世联邦理工学院机械与过程工程系软机器人实验室)

专题命中 评测与基准 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 提出Mask2Real-WM,一种用于灵巧操纵的两阶段动作条件世界模型,将像素预测解耦为动力学和渲染模型,利用分割空间较小的模拟到现实差距,通过合成数据预训练和真实演示微调实现各自由度动作可控。

Comments 23 pages, 24 figures, 4 tables. Preprint. Project page: https://srl-ethz.github.io/Mask2Real-WM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06422 2026-08-20 cs.CL cs.AI cs.CV 版本更新 62%

When to Call an Apple Red: Humans Follow Introspective Rules, VLMs Don't

何时称苹果为红色:人类遵循内省规则,而视觉语言模型却不遵循

Jonathan Nemitz, Carsten Eickhoff, Junyi Jessy Li, Kyle Mahowald, Michal Golovanevsky, William Rudman

机构 * University of Tübingen(蒂宾根大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校) Brown University(布朗大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了视觉语言模型(VLMs)在何时会表现出意外行为,以及模型是否能可靠预测自身行为,发现VLMs系统性违反内省规则,而人类则遵循规则。

Comments Accepted at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18736 2026-08-20 cs.LG cs.CR cs.DC 新提交 57%

FedLNS: Leverage LayerNorm Signature Modeling to Mitigate Adversarial Manipulation in Federated LLMs

FedLNS:利用层归一化签名建模缓解联邦大语言模型中的对抗性操纵

Kai Li, Jong-Ik Park, Carlee Joe-Wong, Wei Ni, Falko Dressler

机构 * Interdisciplinary Centre for Security, Reliability and Trust (SnT), University of Luxembourg(卢森堡大学安全、可靠性与跨学科研究中心(SnT)) Carnegie Mellon University(卡内基梅隆大学) Edith Cowan University(埃迪斯科文大学) TU Berlin(柏林工业大学)

专题命中 评测与基准 :language model(abstract);分类 cs.LG

AI总结 FedLNS是一种服务器端联邦学习框架,通过层归一化签名筛选恶意更新,在200个客户端、40%目标操纵下,对三类模型均实现优于基线的测试困惑度。

Comments 13 pages (main body), 36 pages (appendix), 3 figures, 98 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18336 2026-08-20 cs.AI cs.CY 新提交 57%

Measuring the Partial-Credit Gap: A Strict Benchmark on Vietnam's 2025 Convex Marking Scheme

测量部分学分差距:越南2025年凸评分制的严格基准

Nguyen Quoc Hung, Nguyen Dang Minh, Le Nhu Quynh, Tran Khanh Linh, Nguyen Kieu Linh

机构 * Posts and Telecommunications Institute of Technology(越南邮电技术学院)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 该研究针对越南2025年凸评分制,构建THPT-Ladder基准,发现标准准确率指标会夸大模型在该评分制下的表现,不同错误分布会导致模型得分差异显著,影响模型能力评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15265 2026-08-20 cs.AI 版本更新 57%

VibeWorlding: Can Multimodal Agents Construct 3D Open Worlds End-to-End?

VibeWorlding:多模态智能体能否端到端构建3D开放世界?

Yansong Ning, Jingwen Ye, Zhongkai Wu, Yang Sun, Yiqin Zhu, Xingyi Li, Weidong Zhang, Hao Liu

机构 * HKUST(GZ)(香港科技大学(广州)) Tencent(腾讯) AI Thrust TEG AIPD

专题命中 评测与基准 :post-training(abstract);分类 cs.AI

AI总结 该研究提出VibeWorlding框架,构建VWE-BENCH基准与VibeWorlding-Gym框架,发现当前前沿MLLMs在3D开放世界构建任务中表现不佳,经RL训练的VibeWorlder模型可提升性能,旗舰模型VibeWorlder-30B-A3B表现最优。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14905 2026-08-20 cs.CL 版本更新 57%

How Do Agents Fail on AutoResearch: End-to-End Diagnostic Evaluation on 100 Real-World Frontier Research Tasks

智能体在自动研究(AutoResearch)中如何失败?针对100项真实前沿研究任务的端到端诊断评估

Yanlin Fei, Nazhou Liu, Xinmiao Yu, Shaolong Chen, Lei Li, Rahul Thapa, Madalina Ciobanu, Qingqing Mao, Ritankar Das

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.CL

AI总结 本研究推出AutoResearchEval评估平台,构建含45种失效模式的ARFT分类体系,发现当前智能体缺乏元认知循环是核心缺陷,公开发布相关资源以推动自主科学发现研究。

Comments *Equal Contribution (alphabetical order by last name)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06495 2026-08-20 cs.CL 版本更新 57%

ConstructCIE: A Dataset for Extracting Causal Information from Construction Accident Narratives

ConstructCIE:用于从施工事故叙述中提取因果信息的数据集

Hung Nguyen, Jaehoon Lee, Namgyun Kim, Kuan-Hao Huang

机构 * Texas A&M University(德克萨斯农工大学)

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.CL

AI总结 该研究构建了用于提取施工事故因果信息的ConstructCIE数据集,评估了相关模型的性能,发现模型在精确跨度提取上存在局限,需强化领域基础与证据提取。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09560 2026-08-20 cs.LG 版本更新 57%

The Diffusion-Attention Connection

扩散与注意的联系

Julio Candanedo

机构 * SparseTrace.ai, Appleton, Wisconsin, USA(SparseTrace.ai,美国威斯康星州阿普尔顿)

专题命中 评测与基准 :language model(abstract);分类 cs.LG

AI总结 本文揭示Transformer、扩散图和磁拉普拉斯为单一马尔可夫几何的不同模式,通过定义QK双向发散实现注意力、扩散图和磁扩散的统一。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01684 2026-08-20 cs.IR cs.CL 版本更新 57%

LACONIC: Dense-Level Effectiveness for Scalable Sparse Retrieval via a Two-Phase Training Curriculum

LACONIC: 通过双阶段训练课程实现可扩展稀疏检索的密集级有效性

Zhichao Xu, Shengyao Zhuang, Crystina Zhang, Xueguang Ma, Yijun Tian, Maitrey Mehta, Jimmy Lin, Vivek Srikumar

机构 * University of Utah(犹他大学) The University of Queensland(昆士兰大学) University of Waterloo(滑铁卢大学) University of Notre Dame(圣约翰大学)

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.CL

AI总结 LACONIC通过双阶段训练课程实现高效稀疏检索,以更少的计算资源达到与密集模型相当的检索效果。

Comments SIGIR 2026 camera ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18367 2026-08-20 eess.IV cs.CV 新提交 50%

Optic Disc Segmentation in Fundus Images: From Classical Image Processing and Deformable Models to Modern AI

眼底图像中的视盘分割:从经典图像处理与可变形模型到现代人工智能

Buket D. Barkana

专题命中 评测与基准 :foundation model(abstract)

AI总结 本综述梳理视盘分割技术从经典方法到现代AI方法的发展,总结核心原则,指出边界模糊等持续挑战,为该领域研究提供方法学参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18993 2026-08-20 cs.CV 新提交 50%

ForeSightGuide: An Anticipatory Framework toward Accurate and Low-Redundancy Guidance for the Visually Impaired

ForeSightGuide:面向视障人士的精准低冗余前瞻式导航框架

Zhiyuan Wang, Xu Li, Shikang Guo, Wei Meng, Quan Liu, Jie Zuo

专题命中 评测与基准 :language model(abstract)

AI总结 该研究针对视障人士出行的信息过载问题,提出前瞻式导航框架ForeSightGuide,结合语义理解与危险预测,在新数据集及公共基准上实现最优性能,冗余警报与漏险率表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18711 2026-08-20 cs.CV eess.SP 新提交 50%

EgoHRV: Continuous Heart Rate Variability Estimation from Egocentric Systems for Autonomic Response and Skill Assessment

EgoHRV:用于自主神经反应与技能评估的自我中心式系统的连续心率变异性估计

Berken Utku Demirel, Christian Holz

机构 * ETH Zürich(苏黎世联邦理工学院)

专题命中 评测与基准 :pretraining(abstract)

AI总结 本文提出EgoHRV方法,利用自我中心头戴设备的凝视摄像头结合3D骨干网络与低-高分解模块等,实现从凝视视频中连续估计HRV与HR,在HR/HRV估计中达最优准确率,集成后使EgoExo4D熟练度估计器准确率提升17.8%

Comments Accepted to the European Conference on Computer Vision (ECCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏