arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-19 至 2026-08-19 共收录 294 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 69 篇

2608.17827 2026-08-19 cs.CL 新提交 77%

From Global Benchmarks to Local Evaluations: Benchmarking LLMs for the German Public Sector

从全球基准到本地评估:面向德国公共部门的大语言模型基准测试

Camilla Dalerci, Thilo Michael, Robin Schaefer, Daniel Weinland

机构 * Bundesdruckerei GmbH(德国联邦印刷公司)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);分类 cs.CL

AI总结 该研究针对德国公共部门构建MÖVE评估框架,发现现有LLM基准不适用于本地场景,不同模型在能耗、提供商透明度、德国政党立场认知维度存在显著权衡,公共机构选LLM需结合治理要求而非仅性能排名。

Comments Accepted as non-archival paper at Eval4SD (co-located with KONVENS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17694 2026-08-19 cs.SE cs.AI 新提交 77%

GADR: Gathering Architecture Decision Records from Meeting Transcriptions

GADR:从会议转录文本中收集架构决策记录

Lucas Daniel Costa da Silva, Kiev Gama

专题命中 评测与基准 :LLM(abstract,abstract_cn);prompting(abstract);分类 cs.AI

AI总结 本文提出多智能体自校正工作流GADR,从原始会议转录文本提取架构决策并生成Nygard格式ADR,经评估其效果优于零样本、少样本基线,还探讨了RAG丰富化的权衡及自动架构文档可追溯性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17671 2026-08-19 cs.SE cs.AI cs.CR 新提交 77%

Benchmarking Automated Security Patch Backporting: How Far Are We?

自动化安全补丁回移植基准测试:我们还差多远?

Jincheng Yang, Yulong Fu, Chengwei Liu, Lyuye Zhang, Fangyuan Zhang, Bingyang Ren, Yang Liu, Hui Li

专题命中 评测与基准 :LLM(abstract,abstract_cn);prompting(abstract);分类 cs.AI

AI总结 该研究推出涵盖多场景的Porting Benchmark基准,评估五类安全补丁回移植工具,发现工具泛化能力差、复杂补丁性能骤降,明确根本原因并指出优化方向。

Comments 13 pages, 3 figures. Accepted at ASE 2026. Artifact: https://doi.org/10.5281/zenodo.21785770

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26703 2026-08-19 cond-mat.mtrl-sci cs.AI physics.comp-ph 版本更新 77%

Discovering physical mechanisms from experiment-simulation mismatches

可自我进化的代理用于DFT实验能带不匹配的可解释诊断

Yue Li, Penghui Yang, Yushan Xiao, Zhonghan Zhang, Jianguo Huang, Yuhao Lu, Cuntai Guan, Bo An, Bijun Tang, Zheng Liu

机构 * School of Materials Science and Engineering, Nanyang Technological University(南洋理工大学材料科学与工程学院)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);分类 cs.AI

AI总结 本文提出XDFT代理,通过自动诊断DFT计算中能带不匹配问题,利用贝叶斯后验更新假设有效性,有效识别78%的不匹配案例,优于随机基线和静态LLM排序。

Comments 6 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17127 2026-08-19 cs.CL 版本更新 77%

The Emergence of Lab-Driven Alignment Signatures: A Psychometric Framework for Auditing Latent Bias and Compounding Risk in Generative AI

实验室驱动的对齐签名的出现:一种心理测量框架,用于审计生成AI中的潜在偏见和叠加风险

Dusan Bosnjakovic

机构 * AI Researcher(人工智能研究员)

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出了一种心理测量框架,用于审计生成AI中的潜在偏见和叠加风险,通过分析九个领先模型的实验室信号,揭示了持续行为聚类的成因。

Comments v2: expanded from 9 to 18 behavioral dimensions and from 4 to 6 developer organizations; revised statistical methodology (rank-based inference with effect-size criterion, replacing variance-decomposition approach); model-level results now reported; references corrected throughout

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16975 2026-08-19 cs.CL cs.LG 新提交 73%

Margin-Regularized Structured Semantic Alignment for Brain-Language Correspondence

用于脑-语言对应关系的边际正则化结构化语义对齐

Jiaqi Wang, Huawen Hu, Shu Zhang

机构 * School of Computer Science and Technology, Northwestern Polytechnical University(西北工业大学计算机科学与技术学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文针对脑-语言解码的模糊性问题,提出MD-SigLIP框架,通过边际正则化结构化语义对齐实现基于检索的解码,在全词汇与子集评估下均取得最优检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06185 2026-08-19 cs.CY cs.AI cs.CL cs.HC 版本更新 73%

Hidden Prompts in Manuscripts Exploit AI-Assisted Peer Review

手稿中的隐藏提示利用AI辅助同行评审

Zhicheng Lin

机构 * Department of Psychology, Yonsei University(延世大学心理学系) Department of Psychology, University of Science and Technology of China(中国科学技术大学心理学系)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了手稿中隐藏指令对AI同行评审的影响,分析了提示注入技术及学术出版物政策的不一致,指出需加强技术筛查与政策协调。

Journal ref Communications of the ACM, 69(7), 53-56 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18072 2026-08-19 cs.CL 新提交 70%

Multi-Agent AI System for Radiology Report Structuring and Quality Assurance with Independent Radiologist Evaluation

用于放射科报告结构化与质量保证的多智能体AI系统:独立放射科医师评估

Iryna Hartsock, Cesar Lam, Christopher Otteni, Aliya Qayyum, Robert Gatenby, Cyrillo Araujo, Ghulam Rasool

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究开发了一款本地部署的多智能体AI系统,可实现放射科报告结构化与质量保证,经独立放射科医师评估,该系统表现良好,或有助于放射科报告标准化。

Comments 14 pages, 2 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17836 2026-08-19 cs.LG 新提交 70%

Leveraging Association Context Retrieval in Knowledge Edit- ing to Build White-Box Attacks on LLMs

利用知识编辑中的关联上下文检索构建针对大语言模型(LLMs)的白盒攻击

Roman Maksimov, Vladimir Aletov, Vladimir Solodkin, Dmitry Bylinkin, Daniil Medyakov, Aleksandr Beznosikov

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 该研究针对LLMs,提出结合关联上下文检索的知识编辑白盒攻击,提升攻击有效性且不严重损害模型整体性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17809 2026-08-19 cs.CL 新提交 70%

Whether LLMs Can Navigate Beliefs and Facts Depends on How You Phrase It

大型语言模型(LLMs)能否处理信念与事实取决于表述方式

Quang Minh Nguyen, Luis Frentzen Salim

机构 * KAIST(韩国科学技术院) National Taiwan University of Science and Technology(台湾科技大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究针对10个LLMs,发现其处理信念与事实的缺陷程度取决于表达信念的动词,源于任务混淆,一条指令可扭转该失败,解码时抑制注意力仅能部分恢复准确率。

Comments In submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17659 2026-08-19 cs.CR cs.AI 新提交 70%

MobileWorldSafety: Benchmarking GUI Agent Safety Against Environmental Injection Attacks in Android Apps

MobileWorldSafety:针对安卓应用中环境注入攻击的GUI智能体安全基准

Sujin Chen, Lijun Li, Tianyi Du, Jing Shao

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 该研究推出MobileWorldSafety基准,基于142个真实安卓应用风险任务评估6种GUI智能体,发现其对环境注入攻击的成功率达40.4%-66.9%,为相关研究奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17597 2026-08-19 cs.CR cs.AI 新提交 70%

HarnessRisk: A Lifecycle-Oriented Benchmark for Agent Harness Safety

HarnessRisk:面向生命周期的智能体管控安全基准

Yajing Bai, Jinhao Duan, Jie Peng, Xianfeng Wu, Sijia Liu, Song Wang, Tianlong Chen

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究提出面向生命周期的智能体管控安全基准HarnessRisk,含128个沙箱案例,评估多模型与管控配置的安全表现,发现管控配置阶段最易受攻击,明确风险识别未必带来安全行动,凸显多维度评估智能体安全的必要性。

Comments Project Page: https://baiyajing.github.io/harness-risk/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17468 2026-08-19 cs.AI 新提交 70%

SAGE: Self-Evolving Storyboard Skills via Attribution-Guided Rule Evolution

SAGE:基于归因引导规则演化的自演进分镜脚本技能

Maolin Ran, Xiaoyang Lu, Jiaqi Liu, Jian Wang, Weiwen Liu, Jianghao Lin, Yong Yu, Weinan Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) CreativeFitting(创意拟合)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对分镜脚本制作的工业瓶颈,提出SAGE框架,通过归因引导规则演化实现导演知识的自演进,在测试中表现接近专业导演,部署后大幅提升制作效率,还发布了首个相关公开数据集PROSE

Comments 11 pages, 9 figures, 4 tables. Dataset available at https://github.com/creDreams/PROSE

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17319 2026-08-19 cs.AI 新提交 70%

Wuying-Browser-Agent: Real-World Centric Fundamental Long-Horizon Browser Agents

Wuying-Browser-Agent:以真实场景为中心的基础长时程浏览器智能体

AIMAE Team, Tianxiang Chen, Yan Cheng, Zhangye Han, Xiaowei Li, Chang Liu, Cheng Liu, Zhongqiang Ma, Long Peng, Xiaobing Tu, Yinggui Wang, Hongliang Wei, Chen Wu, Daiping Xin, Kunyu Zhou, Pengyang Zhou, Peiyuan Chen, Ziyuan Chen, Yutao Deng, Chunyu Dong, Xiangyu Fu, Yicheng Feng, Ruian He, Haochen Li, Miancan Liu, Zhengqin Liu, Wei Peng, Jinkui Ren, Haoyu Tan, Dong Xiao, Rongkun Xue, Shujian Yang, Xianhang Ye, Ziqi Yuan, Ziyang Yu, Linghan Zhang, Xiantao Zhang, Xuanpu Zhao, Yinan Zhao, Zhenghui Zhao, Bin Zhu, Likai Zou

机构 * Alibaba Cloud(阿里云) End-User Intelligent Computing BU(终端用户智能计算业务部) AI Model Application & Engineering Team(AI模型应用与工程团队)

专题命中 评测与基准 :SFT(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出Wuying-Browser-Agent统一框架,通过多层面技术对齐解决浏览器智能体实际部署问题,在多项基准取得最优成绩,且具备通用智能体迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17218 2026-08-19 cs.CL 新提交 70%

The Plot Thins: Uniformity and Linearity in Literary Summaries

情节淡化:文学摘要中的一致性与线性性

Rebecca M. M. Hicke, Sil Hamilton, David Mimno, Ross Deans Kristensen-McLachlan

机构 * Cornell University(康奈尔大学) Aarhus University(奥胡斯大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 该研究构建小说摘要与原作章节映射数据集,测量摘要线性性与一致性,明确文学作品与摘要的情节表达差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17852 2026-08-19 cs.SD cs.MM 新提交 67%

UniVerse: Benchmarking and Enhancing LALMs on Culturally Inclusive Low-Resource Music Understanding

UniVerse:针对文化包容性低资源音乐理解的基准测试与增强

Ziya Zhou, Shangda Wu, Shenyang Xu, Yutong Zheng, Dafang Liang, Suin Chung, Danbinaerin Han, Junyan Jiang, Yongyi Zang, Ruibin Yuan, Rongxiu Zhong, Shilei Zhang, Junlan Feng, Jinglei Liu, Haotian Zhou, Zijin Li, Dasaem Jeong, Wei Xue, Yike Guo

机构 * Sogang University(西江大学) KAIST(韩国科学技术院) NYU Shanghai(上海纽约大学) JIUTIAN Research, China Mobile(中国移动九天研究院) The State Key Laboratory of Multimedia Information Processing, Peking University(北京大学多媒体信息处理国家重点实验室) China Mobile (Hong Kong) Innovation Research Institute(中国移动(香港)创新研究院) Central Conservatory of Music(中央音乐学院)

专题命中 评测与基准 :language model(abstract,abstract_cn)

AI总结 该研究针对低资源音乐理解问题,推出UniVerse基准与数据集,训练LALMs并研究多模态不平衡学习策略,实现性能提升但仍存在深层音乐理解的差距。

Comments 21 pages, 7 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17700 2026-08-19 cs.CV 新提交 67%

Environment-Invariant Subspace Learning for Generalizable Deepfake Detection

面向通用深度伪造检测的环境不变子空间学习

Shenghao Chen, Hao Jia, Chen Li, Chunjie Ma, Zan Gao, Shengyong Chen

机构 * Tianjin University of Technology(天津理工大学) Shandong Artificial Intelligence Institute(山东人工智能研究院) Qilu University of Technology (Shandong Academy of Sciences)(齐鲁工业大学(山东省科学院))

专题命中 评测与基准 :foundation model(abstract,abstract_cn)

AI总结 该研究针对深度伪造检测中跨分布泛化瓶颈,提出EISL框架,通过低秩投影解耦特征并设计环境干预模块,在多设置实验中提升了对未见伪造类型和环境变化的鲁棒性。

Comments 12 pages, 4 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17386 2026-08-19 cs.RO 新提交 67%

MANIGUARD: A Benchmark and Data Suite for Specification-Grounded Safety Evaluation and Improvement of Robotic Manipulation

MANIGUARD:用于基于规范的机器人操作安全评估与改进的基准及数据集套件

Yiyan Peng, Philip Wang, Simon Sinong Zhan, Yiqi Lyu, Zhenyang Ni, Jixin Yan, Fiorelli Wong, Ruochen Jiao, Hang Yin, Xinyu Cao, Huajie Shao, Manling Li, Ruohan Zhang, Qi Zhu

机构 * Northwestern University(西北大学) Stanford University(斯坦福大学) William & Mary(威廉玛丽学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 本研究提出ManiGuard基准与数据集套件,针对机器人操作基础模型策略,通过含23000余次滚动的实验证实安全需独立于任务成功评估,微调可提升安全表现但仍存差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17018 2026-08-19 cs.SE 新提交 67%

ORCA: Observability-Grounded Program Repair for Microservice Incidents

ORCA:基于可观测性的微服务故障程序修复

Yuanchen Gao, Yifang Tian, Yiran Li, Charles Zhang, Hans-Arno Jacobsen

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 ORCA是基于可观测性的微服务故障修复流水线,通过遥测数据提炼故障特征定位候选位置,经多智能体生成补丁并通过遥测验证器评估,在575案例基准中成本效益优于所有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12781 2026-08-19 cs.CV 版本更新 67%

Beyond Correctness: Benchmarking and Aligning Response Behaviors in Hybrid-Thinking MLLMs

超越正确性:混合思维多模态大语言模型(MLLM)的响应行为基准测试与对齐

Xinming Wang, Weinong Wang, Hongming Yang, Yansong Lin, Zheng Ruan, Shangpin Peng, Qiming Peng, Nan Qiao, Fengyuan Lu, Guoqing Ma, Marito Li, Songyang Zhang, Saiyong Yang, Han Hu, Yonglong Tian, Xu-Yao Zhang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Large Language Model Department, Tencent(腾讯大语言模型部) University of Electronic Science and Technology of China(电子科技大学) Hong Kong University of Science and Technology(香港科技大学) Zhongguancun Academy(中关村学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 该研究针对混合思维 MLLM 的思维与非思维模式响应错位问题,构建 PatternEval 基准并开发 PatternRL 方法,可减轻跨模式错位且任务性能损失极小。

Comments 8 tables and 6figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07436 2026-08-19 cs.AI cs.CL cs.CR 版本更新 62%

The Blind Curator: How a Biased Judge Silently Disables Skill Retirement in Self-Evolving Agents

盲选策展人:有偏见的评判者如何在自我进化的智能体中悄然阻碍技能淘汰

Xing Zhang, Yanwei Cui, Guanghui Wang, Ziyuan Li, Wei Qiu, Bing Zhu, Peiyang He

机构 * AWS Generative AI Innovation Center(亚马逊云科技生成式人工智能创新中心) HSBC Holdings Plc., HSBC Technology Center, China(汇丰控股有限公司,汇丰科技中心,中国)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 研究自我进化智能体中,有偏见的评判者对技能淘汰的影响。通过损坏奖励分析等方法发现,“误判通过”偏差会导致技能淘汰机制失效,此为行为安全结果。还提出廉价审计可判断评判者是否越过阈值影响智能体。

Comments Published at COLM 2026 Workshop on Agent Behavior

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17231 2026-08-19 cs.LG cs.CL 版本更新 62%

FishBack: Pullback Fisher Geometry for Optimal Activation Steering in Transformers

FishBack: 用于变换器中最优激活引导的反向费舍尔几何

Sihan Wang, Jiayi Zhao, Qingyan Cao, Hongbo Yao, Lin Shu

机构 * Sihan Wang, 1 Jiayi Zhao(1 王世涵,1 赵佳怡)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出FishBack框架,通过反向费舍尔几何优化变换器中的激活引导,解决激活空间欧几里得假设失效的问题,提出闭式引导方程并实现迭代优化。

Comments Preprint. 22 pages, 6 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17795 2026-08-19 cs.CL 新提交 57%

TraceSQL: Traceable Answerability Estimation for Reference-Free Text-to-SQL Verification

TraceSQL:无参考文本到SQL验证的可追踪答案性估计

Neelesh Kumar Shukla, Debasmita Panda, Srutanik Bhaduri, Aditya Banerjee, Viji Krishnamurthy

机构 * Oracle Corporation(甲骨文公司)

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.CL

AI总结 针对无参考文本到SQL验证的可追踪性不足问题,提出基于67种诊断特征的轻量模型TraceSQL,在BIRD数据集上优于基线模型,可提供可追溯的预测证据。

Comments 9 pages main paper with 6 pages supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17561 2026-08-19 cs.CV cs.LG 新提交 57%

Leveraging existing sparse point annotations for benthic imagery dense segmentation

利用现有稀疏点标注进行底栖图像的密集分割

Cesar Borja, Breck A. McCollum, Jarret E. Byrnes, Kenneth Sebens, Ana C. Murillo

机构 * Universidad de Zaragoza(萨拉戈萨大学) Berklee College of Music(伯克利音乐学院) University of Washington(华盛顿大学)

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 本研究结合SAM2基础模型与底栖图像的稀疏专家点标注,提出自动筛选可靠点的机制以生成高质量伪真值掩码,训练细粒度分割模型,还引入新基准推进生态分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17519 2026-08-19 cs.CV cs.LG 新提交 57%

Looking Beyond the Scale: Do Surgical Skill Models Learn Transferable Representations Across Assessment Rubrics?

超越规模:手术技能模型是否能学习到跨评估准则的可迁移表征?

Hanna Hoffmann, Felix von Bechtolsheim, Stefanie Speidel, Rebecca Hisey

机构 * National Center for Tumor Diseases (NCT)(国家肿瘤疾病中心) DKFZ(德国癌症研究中心) Faculty of Medicine and University Hospital Carl Gustav Carus(卡尔·古斯塔夫·卡鲁斯医学院及大学医院) TUD Dresden University of Technology(德累斯顿工业大学) Helmholtz-Zentrum Dresden-Rossendorf (HZDR)(德累斯顿-罗森多夫亥姆霍兹中心) BMFTR Research Hub 6G-Life(BMFTR 6G生活研究中心) Deutsches Krebsforschungszentrum (DKFZ)(德国癌症研究中心) The Centre for Tactile Internet with Human-in-the-Loop (CeTI)(人在回路触觉互联网中心)

专题命中 评测与基准 :pretraining(abstract);分类 cs.LG

AI总结 本文研究手术技能模型的跨评估准则可迁移性,发现JIGSAWS预训练骨干在LASANA上迁移可行但反向迁移失败,任务特定头部主导技能预测,视觉成分非唯一预测因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17426 2026-08-19 cs.CV cs.AI 新提交 57%

SemComp-Bench: Benchmarking Semantic Task Completion in Video Generation

SemComp-Bench:视频生成中的语义任务完成基准

Keyu Tu, Zhuowei Chen, Mengqi Huang, Yuxin Wang, Jiahao Zhu, Zhendong Mao, Yongdong Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Sun Yat-sen University(中山大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 该研究提出面向结果的视频生成任务语义任务完成,构建SemComp-Data数据集与SemComp-Bench基准,发现代表性视频生成模型在兼顾结果实现与参考图像语义基础上仍具挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17044 2026-08-19 cs.CV cs.AI 新提交 57%

The 10th AI City Challenge

第10届AI City挑战赛

Zheng Tang, Shuo Wang, David C. Anastasiu, Ming-Ching Chang, Anuj Sharma, Quan Kong, Munkhjargal Gochoo, Jun-Wei Hsieh, Tomasz Kornuta, Zhedong Zheng, Renran Tian, Judah Goldfeder, Fulgencio Navarro, Yuxing Wang, Yizhou Wang, Sameer Satish Pusegaonkar, Anqi Li, Nalin Dadhich, Ridham Kachhadiya, Dhanishtha Patil, Haoquan Liang, Jiajun Li, Han Zhang, Yilin Zhao, Zaid Pervaiz Bhat, Shuyu Yang, Ashutosh Kumar, Rong Wang, Rafael Martin Nieto, Peter Christiansen, Ahmed Abduljawad, Mohanrasu Shanmugam, Nadeem Shaik, Sujit Biswas, Xunlei Wu, Vidya Murali, Rama Chellappa

机构 * Santa Clara University(圣克拉拉大学) University at Albany, SUNY(纽约州立大学奥尔巴尼分校) Iowa State University(爱荷华州立大学) Woven by Toyota(丰田编织公司) United Arab Emirates University(阿拉伯联合酋长国大学) National Yang Ming Chiao Tung University(国立阳明交通大学) University of Macau(澳门大学) North Carolina State University(北卡罗来纳州立大学) Columbia University(哥伦比亚大学) Milestone Systems(里程碑系统公司) Xi’an Jiaotong University(西安交通大学) Johns Hopkins University(约翰斯·霍普金斯大学)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI

AI总结 本文总结了与ECCV 2026同期举办的第10届AI City挑战赛的设置、数据集、评估结果等,该赛事规模扩大,设多类赛道,成功系统结合基础模型与多种技术。

Comments Summary of the 10th AI City Challenge Workshop in conjunction with ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07897 2026-08-19 cs.AI cs.HC 版本更新 57%

Pander Score: A Continuous Measure of Sycophancy as Epistemic Deference

AI认知顺从指数:谄媚行为的连续度量

Alejandro Botas, Paul de Font-Reaulx, Luke Hewitt

机构 * Independent(独立研究者) University of Michigan, Ann Arbor(密歇根大学安娜堡分校) Transluce

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.AI

AI总结 提出AI认知顺从指数(AEDI),通过从自然语言输出中估计概率来连续度量模型对用户态度的顺从程度,测试8个模型发现显著差异,Claude顺从最少,Grok和Gemini最多。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06837 2026-08-19 eess.AS cs.LG 版本更新 57%

SEAM: Shortcut-Aware Real-Time Detection of Scripted vs. Spontaneous Speech for Interview Guardrails

SEAM:面向面试防护栏的脚本化与自发语音的快捷方式感知实时检测

Vsevolod, Kovalev, Pranay Manocha

机构 * Symbal AI Princeton University(普林斯顿大学)

专题命中 评测与基准 :post-training(abstract);分类 cs.LG

AI总结 提出SEAM框架,通过统一预处理、接缝感知采样、非语音增强和紧凑DistilHuBERT骨干,在8秒窗口下实现0.971 ROC-AUC,并揭示快捷方式学习问题。

Comments Accepted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.09696 2026-08-19 cs.CL 版本更新 57%

An Analysis of Language Frequency and Error Correction for Esperanto

世界语的语言频率与错误修正分析

Junhong Liang

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 该研究针对低资源语言世界语的GEC缺口,构建了Eo-GP和Eo-GEC数据集,实验发现GPT-4在世界语语法错误修正任务上优于GPT-3.5,为低资源语言的GEC提供了新方向。

Comments Data is now available at: https://github.com/Skywalker-Harrison/Eo-GEC

详情

展开后加载摘要…

URL PDF HTML 收藏