arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-24 至 2026-08-24 共收录 310 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 92 篇

2608.19515 2026-08-24 cs.CL 版本更新 77%

Hear2Act: Benchmarking When Prosody Should Change What an Assistant Does

Hear2Act:对韵律应何时改变助手行为的基准测试

Xinyi Liu, Hooshang Nayyeri, Dilek Hakkani-Tur, Emine Yilmaz, Joo-Kyung Kim, Yifei Zhang, Charith Peris, Hari Thadakamalla

机构 * Amazon(亚马逊公司) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University College London(伦敦大学学院)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);分类 cs.CL

AI总结 该研究推出 Hear2Act 基准,评估发现词汇证据不足时韵律对助手决策很重要,具备音频能力的 LLM 能从语音恢复信息但需显式中间表示才能可靠转化为行动。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20574 2026-08-24 cs.AI cs.CY cs.LG cs.SE 新提交 76%

FlavourBench: Ranking Frontier Language Models with Executable Culinary Ground Truth

FlavourBench:基于可执行烹饪基准真值的前沿语言模型排名

Josef Chen, Erim Hayretci

机构 * Imperial College London(帝国理工学院)

专题命中 评测与基准 :language model(title);分类 cs.AI、cs.LG

AI总结 FlavourBench是一款自动化语言模型排名基准,以可执行烹饪系统为基准真值,评估27个前沿语言模型,发现Grok 4.6表现最优,可有效消除排行榜差异缺失,结果可靠。

Comments 10 pages, 5 figures. Evaluation of 27 frontier language-model endpoints on 534 identical tasks per model, comprising 14,418 scored model-task cells. Code: this https URL (https://github.com/josefchen/flavourbench) Dataset: this https URL (https://huggingface.co/datasets/josefchen/flavourbench) Interactive leaderboard: this https URL (https://huggingface.co/spaces/josefchen/flavourbench)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21951 2026-08-24 cs.IR cs.CR 版本更新 75%

SIREN (Luring LLMs onto the Rocks): PAIR-Driven Preference Manipulation in Web-RAG Recommenders

SIREN(诱使大语言模型陷入困境):网页增强型大语言模型推荐系统中基于配对驱动的偏好操纵

Evan Caville, Spencer Kayser, Siamak Layeghy, Billy Sung, Sara Dolnicar, Marius Portmann

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究网页增强型大语言模型推荐系统中排序推荐的对抗操纵问题,提出SIREN方法,利用23种内容中毒技术迭代编辑检索到的网页,在两个Claude模型上实验,使选定实体多次达排名第1,验证了声明性排名等方式的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20392 2026-08-24 cs.CL cs.AI 新提交 73%

Evaluation-as-Search: Adaptive Discovery of Grounding Failures in Meeting Assistants

评估即搜索:会议助手接地故障的自适应发现

Sami Khairy, Yasaman Hosseinkashi, Vishak Gopal, Ross Cutler

机构 * Microsoft(微软公司)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出EaS方法构建MeetingProbe基准,发现会议助手故障多源于话语语用挑战,其自适应搜索比随机探测的故障发现率高2.5倍,且公开了该基准以支持可复现评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20381 2026-08-24 cs.CL cs.AI cs.HC 新提交 73%

EditPPT: Faithful Long-Deck Slide Editing via Structured Tool-Using Multi-Agent with Dual-Modal Validators

EditPPT:基于结构化工具使用多智能体与双模态验证器的忠实长文档幻灯片编辑

Jiheon Kim, Kyudan Jung, Jaegul Choo

机构 * KAIST AI(韩国科学技术院人工智能学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出EditPPT多智能体框架,通过PowerPoint COM接口执行局部操作并结合双模态验证,在DeckEdit-Bench基准上实现高执行率等指标,解决长文档幻灯片编辑的级联错误问题。

Comments 30 pages, 7 figures, 17 tables, EMNLP 2026 submitted, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20349 2026-08-24 cs.CL cs.AI 新提交 73%

Beyond Prompt Engineering: A Systematic Analysis of Prompt Lexical Sensitivity and Its Impacts on Quality

提示工程之外:提示词词汇敏感性及其对质量影响的系统性分析

Qipeng Xie, Zi Liang, Jiafei Wu, Yufei Chen, Weizheng Wang, Wenao Ma, Zhong Ming, Haiqin Yang, Kaishun Wu

机构 * Shenzhen Technology University(深圳技术大学) The Hong Kong Polytechnic University(香港理工大学) Zhejiang Lab(之江实验室) The Chinese University of Hong Kong(香港中文大学) HKUST (Guangzhou)(香港科技大学(广州))

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对大型语言模型的提示词词汇敏感性开展大规模机制分析,揭示提示词性能稳定性缩放定律,提出自动化提示词优化智能体,可降低代码生成任务性能方差40.7%,为鲁棒提示工程提供可解释框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21310 2026-08-24 cs.SE 新提交 71%

Beyond Fault Localization: A Trajectory-Level Study of LLM Agents for Microservice Root Cause Analysis

超越故障定位:面向微服务根本原因分析的大语言模型智能体的轨迹级研究

Qisheng Lu, Aoyang Fang, Junjielong Xu, Jin'ao Shang, Songhan Zhang, Yifan Yang, Xiaochuan Yan, Pinjia He

专题命中 评测与基准 :LLM(title)

AI总结 本研究针对微服务根本原因分析,提出轨迹级评估框架,发现智能体答案正确性与诊断质量脱节,构建DiagGuard架构提升了RCA的Acc@1指标,为自动化RCA改进提供指导。

Comments 13 pages, 7 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21249 2026-08-24 cs.CL 新提交 70%

Benchmarking Patent Drafting from Inventor-Style Disclosures

从发明人风格的披露文件进行专利撰写的基准测试

Lekang Jiang, Wenjun Sun, Stephan Goetz

机构 * University of Cambridge(剑桥大学) Chinese Academy of Sciences(中国科学院) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究针对从发明人风格披露文件生成专利申请的现实需求,构建了Dis2Pat数据集,并提出可本地部署的多智能体框架Patent-MAF,实验表明该框架在专利撰写任务上表现优于多数开源模型且可与闭源模型竞争。

Comments Accepted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21140 2026-08-24 cs.CV cs.AI 新提交 70%

A Modular Agent for Reliable and Auditable Spatial Relation Verification in CT Scans

用于CT扫描中可靠且可审计的空间关系验证的模块化智能体

Simon Vincent Abel, Heiko Hillenhagen, Michael Götz, Timo Ropinski, Ayhan Can Erdur, Daniel Santak Wolf

机构 * Ulm University(乌尔姆大学) Ulm University Hospital(乌尔姆大学医院) Technical University of Munich (TUM)(慕尼黑工业大学(TUM)) TUM University Hospital(慕尼黑工业大学医院) Department of Radiation Oncology, TUM University Hospital(慕尼黑工业大学医院放射肿瘤科)

专题命中 评测与基准 :language model(abstract);prompting(abstract);分类 cs.AI

AI总结 针对医学视觉-语言模型空间推理薄弱的问题,提出模块化医学影像智能体,通过分阶段处理实现CT扫描空间关系验证,性能优于端到端基线,可作为未来医学影像智能体的构建块。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21087 2026-08-24 cs.CL 新提交 70%

Jokes Aside: Measuring the Semantic Distance of Double Meanings

玩笑之外:测量双重含义的语义距离

Fabio De Ponte

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究基于词嵌入重新审视现有幽默指标并引入对称性指标,在三个数据集上验证后发现,基于这些指标训练的模型预测幽默评分表现不佳,但对称性指标与高分笑话相关。

Comments The paper was submitted to ISHS (International Society for Humor Studies) conference held in Kraków, Poland on 7-11 July 2025. It was awarded the GSA AWARD and was presented during a special plenary session (see the section Graduate Student Awards, 2006-2025 of the webpage this https URL (https://www.humorstudies.org/ConferCenter.htm) )

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20984 2026-08-24 cs.CV cs.CL cs.CY 新提交 70%

MigrationNarrate: A Dataset for Detection of Migration Narratives in YouTube Videos

MigrationNarrate:用于检测YouTube视频中移民叙事的数据集

Fatima Haouari, Carolina Scarton, Kalina Bontcheva

机构 * University of Sheffield(谢菲尔德大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究推出首个用于检测英国移民叙事的多模态数据集MigrationNarrate,包含1115个YouTube视频字幕,结合预训练编码器与大语言模型开展基准测试,为移民叙事检测研究提供关键资源。

Comments This work was accepted to the main conference of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20786 2026-08-24 cs.AI cs.IR 新提交 70%

Structure for Reading, Prose for Writing: Asymmetric Structural Conditioning in Multi-Agent Document Authoring

阅读用结构,写作用散文:多智能体文档创作中的非对称结构条件作用

Cheng Yu, Nikhil Mathew, Zhengjie Wang

机构 * ML Research Labs(ML研究实验室)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 该研究针对多智能体文档创作系统,发现结构条件作用存在不对称性,结构利于阅读但不利于写作,还揭示了信息可用性对系统性能的关键影响。

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20614 2026-08-24 cs.AI 新提交 70%

Evaluating Skills, Not Just Agents: Agentic Continuous Evaluation of Skills

评估技能,而非仅评估智能体:智能体驱动的技能持续评估

Christopher Kevin, Narendran Raghavan, Jean-Francois Puget, Roshni Malani, Meghana Puvvadi, Moshe Abramovitch, Mohit Gupta, Rama Akkiraju, Subodh Prabhu, Yogesh Dangi, Wei Luo, Seong Hee Lee

机构 * NVIDIA(英伟达)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 该研究提出ACES框架,通过配对实际 trials等方式评估技能附加价值,实验表明其能发现扫描式审核无法观测的信号,开源实现已在NVIDIA SkillEvaluator中提供。

Comments 15 pages. Extended preprint incorporating versions accepted at Agent Skills '26 (ACM CAIS 2026) and the KDD 2026 Workshop on Enterprise AI Agents: From Prototypes to Production (oral presentation). Open-source implementation: this https URL (https://github.com/NVIDIA/SkillEvaluator)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20485 2026-08-24 cs.AI cs.SE 新提交 70%

Terminal Agents: A Survey of AI Agents in Command-Line Environments

终端智能体:命令行环境下的AI智能体综述

Yi Bin, Xiaoyang Yuan, Haoxi Zeng, Wencheng Ye, Wenqi Shao, Chen Qian, Wei Ye, Yujuan Ding, Zheng Wang, Pengpeng Zeng, Jingkuan Song, Heng Tao Shen

机构 * Shanghai Innovation Institute(上海创新研究院) Shanghai Jiao Tong University(上海交通大学) The Hong Kong Polytechnic University(香港理工大学) Tongji University(同济大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文将终端智能体定义为行动-观察循环由终端介导的系统,通过七维轮廓关联架构等模块,揭示其行为影响因素与评估不均衡问题,为相关研究提供统一框架。

Comments 52 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11238 2026-08-24 cs.AI 版本更新 70%

Towards Query-Agnostic RAG Evaluation via Query Coverage and Claim Verifiability

面向查询不可知的RAG评估:基于查询覆盖率与声明可验证性

Jeonghwan Choi, Taewon Yun, Minjeong Ban, Gyeonghun Sun, Jae-Gil Lee, Hwanjun Song

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出Q-CARE框架,通过分解查询与答案实现RAG的细粒度评估,在8个数据集的基准测试中,其评估结果与人工判断的相关性优于现有4种RAG评估指标。

Comments Accepted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09487 2026-08-24 cs.CL 版本更新 70%

SlidesGen-Bench: Evaluating Slides Generation via Computational and Quantitative Metrics

SlidesGen-Bench: 通过计算和定量指标评估幻灯片生成

Yunqiao Yang, Wenbo Li, Houxing Ren, Zimu Lu, Ke Wang, Zhiyuan Huang, Zhuofan Zong, Mingjie Zhan, Hongsheng Li

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 SlidesGen-Bench通过计算和定量指标评估幻灯片生成,提出统一框架和可重复的量化指标,构建人类偏好对齐数据集,提升与人类判断的一致性。

Comments 37 pages, 34 figures, EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20932 2026-08-24 cs.CV 新提交 67%

OccluRank: Controllable Occlusion-Aware Layout-to-Image Generation by Adding Just an Ordinal Rank

OccluRank:仅添加序数秩的可控遮挡感知布局到图像生成

Wenyang Hong, Yuan Wang, Yanbin Hao, Lanqing Xue, Ke Wang, Xiang Wang, Kuien Liu, Richang Hong

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 提出OccluRank框架,仅添加序数秩实现可控遮挡感知布局到图像生成,构建相关数据集与基准,实验表明其能可靠保留实例、遵循布局并实现期望遮挡关系,性能相当。

Comments 16 pages, 7 figures. Code: this https URL (https://github.com/Wenyang-hong/OccluRank)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20903 2026-08-24 cs.SE 新提交 67%

Generation of Web Apps with Agentic IDEs: An Empirical Assessment

智能体集成开发环境(Agentic IDE)生成网页应用:一项实证评估

Manuel Marceca, Maria Teresa Rossi, Leonardo Mariani

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 本文通过对比Copilot、Cursor、Windsurf三款智能体IDE生成五个全栈网页应用的表现,发现其在生成常见模式时成熟度高,但生成分布式架构错误多,无法替代开发者,仅能辅助开发者构建软件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20713 2026-08-24 cs.CV 新提交 67%

AGIDefect-4K: A Richly Annotated Dataset for AI-Generated Image Defect Detection, Localization and Explanation

AGIDefect-4K:用于AI生成图像缺陷检测、定位与解释的富标注数据集

Xiangfei Sheng, Weidong Zou, Tianjiao Gu, Zhichao Yang, Pengfei Chen, Leida Li

机构 * Xidian University(西安电子科技大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文推出含4000张图像的AGIDefect-4K数据集,并提出基于多模态大语言模型的AGIDA基准框架,用于AGI缺陷检测、定位、解释及质量预测,凸显了AGI缺陷理解研究的价值。

Comments 8 pages, 6 figures. Accepted by ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20707 2026-08-24 cs.IR 新提交 67%

Towards Faithful Simulation of Human Shopping Behavior

面向人类购物行为的忠实模拟

Jiakai Tang, Yan Mi, Jing Yu, Yang Zhang, See-Kiong Ng, Qi Cao, Fei Sun, Xu Chen, Wen Chen, Jian Wu, Han Zhu, Bo Zheng

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 本文针对现有用户购物行为模拟器的记忆与优化挑战,提出分层记忆的RecVerse智能体,结合轨迹级RL优化,发布USB数据集,在模拟性能上显著优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20697 2026-08-24 cs.DL 新提交 67%

From citation intent to knowledge contribution: Classifying what cited papers actually contribute

从引用意图到知识贡献:对被引论文实际贡献的分类

Zhibang Quan, Zhentao Liang, Ming Ma, Jinyu Wei, Gang Li, Jin Mao

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 该研究提出知识贡献分类体系KCT及双路径融合模型,实现被引论文知识贡献分类,其准确率达85.5%,且在研究评估、学术传播预测中表现优于传统引用意图分类。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08164 2026-08-24 cs.CV 版本更新 67%

Continual Test-Time Adaptation in Computer Vision: Methods, Benchmarks, and Future Directions

计算机视觉中的持续测试时间适应:方法、基准和未来方向

Sarthak Kumar Maharana, Shambhavi Mishra, Yunbei Zhang, Shuaicheng Niu, Taki Hasan Rafi, Jihun Hamm, Marco Pedersoli, Jose Dolz, Yunhui Guo

机构 * The University of Texas at Dallas(德克萨斯大学达拉斯分校) LIVIA ETS Montreal, ILLS International Laboratory on Learning Systems (ILLS)(蒙特利尔LIVIA ETS,学习系统国际实验室(ILLS)) Tulane University(路易斯安那州立大学) Nanyang Technological University(南洋理工大学) Hanyang University(翰阳大学)

专题命中 评测与基准 :foundation model(abstract);prompting(abstract)

AI总结 本文针对计算机视觉中训练与测试数据分布不同的问题,定义CTTA问题,分析持续域转移模式,提出分层分类法将现有方法分为三类,回顾代表性方法并展示实验结果,讨论局限性与新兴方向,为持续测试时间适应研究提供路线图。

Comments TMLR 2026 (July edition)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19100 2026-08-24 cs.SE 版本更新 67%

Reward Engineering for Software Tasks: A Survey of Reinforcement Learning Approaches

软件任务中强化学习的奖励工程

Md Rayhanul Masud, Azmine Toushik Wasi, Salman Rahman, Md Rizwan Parvez

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文系统综述了强化学习在软件任务中奖励工程的方法与挑战,旨在整合现有奖励设计方法并提供全面的指导。

Comments Accepted at EMNLP 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13400 2026-08-24 cs.CV 版本更新 67%

What Color Is the Text? A Benchmark for Hallucination Induced by Image-Embedded Prompt

文本是什么颜色?:一个用于评估图像嵌入提示引发幻觉的基准

Jinkun Zhao, Lei Huang, Haixin Ge, Wenjun Wu

机构 * SKLCCSE, Institute of Artificial Intelligence, Beihang University, Beijing, China(软件学院、人工智能研究院、北航、北京、中国) Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing, Beihang University, Beijing, China(未来区块链与隐私计算先进创新中心、北航、北京、中国)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 该研究提出Embedded Stroop范式,构建WCIT基准评估MLLMs的图像嵌入提示幻觉,发现语义可读性可主导其视觉颜色感知。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21357 2026-08-24 cs.AI 新提交 57%

VIALS: A Benchmark for Visual Interpretation of Artifacts in the Life Sciences

VIALS:生命科学领域人工产物视觉解释基准

Elaine Lau, Thanuka Udumulla, Lee Izhaki-Tavor, Francisco Guzmán, Nicholas Magazine, Jonas Mueller

机构 * Handshake AI

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 研究针对生命科学人工产物视觉解释的需求,构建含161项任务的VIALS基准,发现前沿视觉语言模型在该任务上存在领域知识与推理局限,凸显AI需具备此类能力以服务生命科学工作流。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20868 2026-08-24 cs.CV cs.CL 新提交 57%

Identify, Locate, Link: End-to-End Key-Value Extraction from Document Images

识别、定位、关联:从文档图像中进行端到端键值提取

A. Said Gurbuz (1 and 2), Ahmed Nassar (1), Christoph Auer (1), Maksym Lysak (1), Lucas Morin (1), Matteo Omenetti (1), Tim Strohmeyer (1), Panagiotis Vagenas (1), Nikolaos Livathinos (1), Michele Dolfi (1), Peter Staar (1) ((1) IBM Research Zurich, (2) ETH Zurich)

机构 * IBM Research Zurich(IBM苏黎世研究院) ETH Zurich(苏黎世联邦理工学院)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 该研究针对传统文档处理的误差传播问题,微调SmolDocling模型实现端到端键值提取,在多个数据集上性能优于更大基线模型,且体积小、推理快。

Comments Accepted at ICDAR 2026. 17 pages, 6 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06519 2026-08-24 cs.CL 版本更新 57%

MedRAGChecker: Claim-Level Verification for Biomedical Retrieval-Augmented Generation

MedRAGChecker: 用于生物医学检索增强生成的声明级验证

Yuelyu Ji, Min Gu Kwak, Hang Zhang, Xizhi Wu, Chenyu Li, Yanshan Wang

机构 * University of Pittsburgh(匹兹堡大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

AI总结 MedRAGChecker通过声明级验证和诊断框架,提高生物医学RAG生成答案的可靠性与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20413 2026-08-24 q-bio.GN 新提交 50%

BioFirewall: A genome-writing-native governance layer for design-stage biosecurity screening of agentic AI

BioFirewall:面向智能体AI设计阶段生物安全筛查的基因组写入原生治理层

Anees Ahmed Mahaboob Ali, Radhakrishnan Delhibabu, Everette Jacob Remington Nelson

专题命中 评测与基准 :foundation model(abstract)

AI总结 针对智能体AI基因组编辑设计阶段的生物安全管控缺口,提出BioFirewall中间件,其在多维度筛查中表现优于大模型,能有效抵御攻击且假拒绝率低,已开源并附带可复现基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21281 2026-08-24 cs.CV 新提交 50%

WildFin: An In-the-Wild Dataset for Fish Behavioral Recognition

WildFin:用于鱼类行为识别的野外数据集

Abigail G. Grassick, Jerome Tze-Hou Hsu, Ethan Lin, Ziang Liu, Max Whitton, Madelyn Hair, Liam Gutierrez, Haozheng Yu, Kristin Branson, Vivek Jayaraman, Michael A. Gil, Andrew M. Hein, Jennifer J. Sun

机构 * Cornell University(康奈尔大学) University of Colorado Boulder(科罗拉多大学博尔德分校) HHMI Janelia Research Campus(HHMI珍妮亚研究园区)

专题命中 评测与基准 :foundation model(abstract)

AI总结 针对复杂海洋环境中鱼类行为识别模型失效问题,推出WildFin野外数据集,经大规模整理标注后对视觉基础模型测试,发现其与现实需求存在显著差距。

Comments 31 pages, 4 figures ECCV Marine 26 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21098 2026-08-24 cs.CV 新提交 50%

When does fusing hand-crafted knowledge with learned representations pay? A cost-normalized benchmark of stacking, substitution, and interference

将手工知识与学习表示融合何时有效?一种针对堆叠、替代和干扰的成本归一化基准

Ahmad AlMughrabi, Albert Clop, Benjamin Busam, Ricardo Marques, Petia Radeva

机构 * Universitat de Barcelona(巴塞罗那大学) Technical University of Munich(慕尼黑工业大学) Universitat Pompeu Fabra(庞培法布拉大学)

专题命中 评测与基准 :pretraining(abstract)

AI总结 该研究以成本归一化基准分析手工知识与学习表示融合的效果,发现三种结果并提出可预测端到端增益的分解式。

详情

展开后加载摘要…

URL PDF HTML 收藏