arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12101 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2940 篇

2606.21735 2026-06-23 eess.AS cs.SD 新提交 67%

Bridging the Age Gap: Towards Detecting Neural Audio Codec Synthesized Elderly Speech Deepfake

弥合年龄差距:面向检测神经音频编解码器合成的老年语音深度伪造

Orchid Chetia Phukan, Girish, Mohd Mujtaba Akhtar, Chi-Chun Lee

机构 * BIIC Lab, NTHU, Taiwan(国立台湾大学BIIC实验室) UPES, India(印度UPES大学) VBSPU, India(印度VBSPU大学)

专题命中 评测与基准 :foundation model(abstract);pretraining(abstract)

AI总结 提出老年语音编解码伪造检测(ECFD)任务,发布中英文ECF数据集,发现现有检测器泛化差,利用多模态基础模型融合(BONSAI框架)实现1.66%平均等错误率,建立新基准。

Comments Accepted to INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23081 2026-06-23 cs.DB 新提交 67%

SemCEB: A Cardinality Estimation Benchmark for Semantic Operators

SemCEB:面向语义操作符的基数估计基准

Andreas Zimmerer, Claudius Kühn, Yang Li, Mihail Stoian, Renata Borovica-Gajic, Andreas Kipf

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 提出SemCEB基准,用于评估语义过滤和连接操作符的基数估计方法,基于真实多模态数据,评估采样和语义直方图方法的准确性、成本、延迟和内存开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22699 2026-06-23 cs.CV cs.MM 新提交 67%

Catching Lies Without Sending the Video: Privacy-Preserving Multimodal Deception Detection

无需发送视频即可识谎:隐私保护的多模态欺骗检测

Nikita Sharma, Pranav Sara, Karan Singla

机构 * University of California, San Diego(加州大学圣迭戈分校) Case Western Reserve University, Ohio(凯斯西储大学) WhissleAI, USA(WhissleAI(美国))

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 提出Whissle方法,通过设备端提取文本、情感、行为等紧凑摘要,在无需传输原始视频的情况下实现与云端模型相当的欺骗检测性能(AUC 0.741),并揭示先前75%准确率存在说话者泄露问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22274 2026-06-23 cs.CL cs.AI cs.LG 新提交 67%

From Speech to Text Corpora: Evaluating ASR-Based Data Acquisition for Low-Resource Fongbe and Hausa

从语音到文本语料库:评估基于ASR的低资源Fongbe和豪萨语数据采集

Mahounan Pericles Adjovi, Victor Olufemi, Roald Eiselen, Prasenjit Mitra

机构 * Carnegie Mellon University Africa(卡内基梅隆大学非洲分校) North-West University(北开普大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究利用ASR管道为低资源非洲语言Fongbe(声调语言)和豪萨语(非声调语言)扩展文本语料,通过微调MMS-300M和Whisper-Small模型,在Fongbe上实现9.48%的词错误率(相对降低78%),并评估转录质量,发现豪萨语接近可用而Fongbe需后处理。

Comments 10 pages, 1 figure, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21309 2026-06-23 cs.CV 新提交 67%

WildBox: A Dataset and Benchmark for Aerial Monocular 3D Detection of African Savanna Wildlife

WildBox: 非洲稀树草原野生动物航拍单目3D检测数据集与基准

Vandita Shukla, Kilian Meier, Lucie Laporte-Devylder, Camille Rondeau Saint-Jean, Jenna M. Kline, Blair R. Costelloe, Devis Tuia, Fabio Remondino, Benjamin Risse

机构 * D Optical Metrology Unit, Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会3D光学计量部) Computer Vision and Machine Learning Systems group, Institute for Geoinformatics, University of Muenster(明斯特大学地理信息学研究所计算机视觉与机器学习系统组) School of Civil, Aerospace and Design Engineering, University of Bristol(布里斯托大学土木、航空航天与设计工程学院) Department of Biology, University of Southern Denmark(南丹麦大学生物学系) The Ohio State University(俄亥俄州立大学) Department of Collective Behavior, Max Planck Institute of Animal Behavior(马克斯·普朗克动物行为研究所集体行为系) University of Konstanz(康斯坦茨大学) Centre for the Advanced Study of Collective Behaviour, University of Konstanz(康斯坦茨大学集体行为高级研究中心) Department of Biology, University of Konstanz(康斯坦茨大学生物学系) Environmental Computational Science and Earth Observation Laboratory, EPFL(瑞士联邦理工学院环境计算科学与地球观测实验室)

专题命中 评测与基准 :foundation model(abstract);pretraining(abstract)

AI总结 提出WildBox数据集,含23.7万3D框标注,评估两种开放词汇单目3D架构,发现零样本3D检测失败,微调后恢复性能,深度估计是主要瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20770 2026-06-23 cs.CL cs.AI cs.LG 新提交 67%

Beyond 'One Language, One Script': Quantifying Orthographic Bias in Multilingual VLMs with PuMVR

超越“一种语言,一种文字”:用PuMVR量化多语言视觉语言模型中的正字法偏差

Prabhjot Singh, Bhushan Pawar, Madhu Reddiboina

机构 * RediMinds Inc.(RediMinds公司) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出PuMVR基准,通过旁遮普语三种文字的图像推理任务,量化多语言视觉语言模型中的文字依赖偏差,发现文字一致性率低至24.8%,视觉输入无法消除偏差。

Comments 22 pages, 4 figures. Accepted to the 4th Workshop on Cross-Cultural Considerations in NLP (C3NLP) @ ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18671 2026-06-18 cs.HC 新提交 67%

HANSEL: Extracting Breadcrumbs from Web Agent Trajectories for Interactive Verification

HANSEL: 从Web智能体轨迹中提取面包屑用于交互式验证

Yujin Zhang, Daye Nam

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 提出HANSEL系统,从AI智能体轨迹中提取可交互验证的证据,减少用户审查负担,在基准测试中达到83.7%精确率和88.9%召回率,用户研究显示显著降低任务完成时间和感知努力。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06926 2026-06-18 cs.CV cs.MM 新提交 67%

SVHighlights: Towards Extremely Long Sport Video Highlight Detection

SVHighlights: 迈向极长体育视频精彩片段检测

Donggyu Lee, Youngbin Ki, Jeonghun Kang, Taehwan Kim

机构 * Ulsan National Institute of Science and Technology(釜山国立科学研究院)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 针对现有方法无法处理超长视频精彩片段检测的问题,提出首个基准SVHighlights(包含320个平均时长2小时的体育视频)以及无训练的分段方法TF-SELECTOR,通过大语言模型融合多模态信息预测片段级显著性分数,在多个指标上超越现有基线。

Comments Accepted to KDD 2026 (Datasets and Benchmarks Track). Project Page: https://leedongkyu2019.github.io/SVHighlights/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18198 2026-06-17 cs.CR cs.CV 新提交 67%

Seeing Is Not Screening: Multimodal Hidden Instruction Attacks on Agent Skill Scanners

看见不等于筛查:针对智能体技能扫描仪的多模态隐藏指令攻击

Xiaojun Jia, Jie Liao, Simeng Qin, Ke Ma, Wenbo Guo, Yebo Feng, Aishan Liu, Yang Liu

机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) Chongqing University, China(重庆大学) Northeastern University, China(东北大学) University of Chinese Academy of Sciences, China(中国科学院大学) Beihang University, China(北航大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 针对现有技能扫描仪忽视图像中恶意指令的盲点,提出SkillCamo多模态攻击将指令隐藏于图像,并设计ExecScan执行级扫描模块,通过意图提取、行为重建等检测隐藏指令,实验证明其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17458 2026-06-17 cs.CE 新提交 67%

ICBCBench: An Industry Consortium Benchmark for Financial Deep Research

ICBCBench:面向金融深度研究的行业联盟基准

Weiya Li, Zhiwei Tang, Yizhou He, Chenghao Wang, Liang Feng, Xiao Sun, Dongrui Liu, Zichen Wen, Hu Wei, Jinghang Wang, Yi Luo, Li Guo, Linfeng Zhang

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 针对金融领域深度研究代理评估标准缺失的问题,提出ICBCBench基准,采用客观任务与主观报告评估双轨范式,揭示当前模型在复杂推理、事实依据和报告质量上的显著差距。

Comments 33 pages, 14 figures. Preprint. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17449 2026-06-17 cs.CL cs.AI cs.CV cs.LG cs.MM 新提交 67%

MODE-RAG: Manifold Outlier Diagnosis and Energy-based Retrieval-Augmented Generation Evaluation

MODE-RAG: 基于流形异常诊断和能量的检索增强生成评估

Zehang Wei, Jiaxin Dai, Jiamin Yan, Xiang Xiang

机构 * School of Computer Science & Tech, Huazhong University of Science and Technology(华中科技大学计算机科学与技术学院) School of AI and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出MODE-RAG多智能体系统,利用变分自由能和内部注意力状态动态门控干预,结合蒙特卡洛树搜索和logit扰动减少多模态检索增强生成中的幻觉和逻辑捏造。

Comments To be presented at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10728 2026-06-17 cs.SE 新提交 67%

DeNovoSWE: Scaling Long-Horizon Environments for Generating Entire Repositories from Scratch

DeNovoSWE:扩展长时域环境以从零生成完整仓库

Jiale Zhao, Guoxin Chen, Fanzhe Meng, Wayne Xin Zhao, Ruihua Song, Ji-Rong Wen, Kai Jia

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 提出DeNovoSWE数据集,通过沙盒代理工作流自动构建4818个从文档生成完整仓库的实例,采用分治与批评修复策略及难度感知轨迹过滤,微调Qwen3-30B-A3B将BeyondSWE-Doc2Repo基准得分从5.8%提升至47.2%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16871 2026-06-16 cs.MA 新提交 67%

Human-on-the-Bridge: Scalable Evaluation for AI Agents

Human-on-the-Bridge: 可扩展的AI智能体评估方法

Fouad Bousetouane

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 提出Human-on-the-Bridge (HOB)范式,通过专家预先策划可复用的评估智能体(包括领域上下文、红队陷阱、陪审员角色等),结合ProofAgent测试框架进行多轮对抗评估,实现可扩展的AI智能体行为评估。

Comments 33 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16420 2026-06-16 cs.CR 新提交 67%

Transferable Self-Evolving Playbooks for Agentic Security Auditing

可迁移的自演化剧本用于智能体安全审计

Ziyue Wang, Cheuk Wang Maurice Ng, Chenchen Yu, Strick Sheng, Kaihua Qin, Liyi Zhou

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 提出EvoHunt框架,通过审计、评估和修订三个智能体循环演化空剧本,自动生成安全审计程序知识,开源演化可超越商业产品,且演化后的剧本可迁移至弱智能体提升其能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16255 2026-06-16 cs.CV 新提交 67%

UniDDT: Unifying Multimodal Understanding and Generation with Decoupled Diffusion Transformer

UniDDT: 使用解耦扩散变换器统一多模态理解与生成

Shuai Wang, Liang Li, Yang Chen, Ruopeng Gao, Yao Teng, Limin Wang

机构 * Nanjing University(南京大学) ByteDance Seed(字节跳动Seed) University of Hong Kong(香港大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 提出UniDDT模型,通过噪声ViT编码器统一视觉语义表示,并采用解耦扩散解码器分离扩散与文本解码,平衡多模态理解与生成任务,在多个基准上取得优异性能。

Comments This work was completed in \textbf{November 2025}

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16198 2026-06-16 cs.CV 新提交 67%

GRACE: Boosting Video MLLMs with Grounded Action-Centric Evidence for Viewer Sentiment Prediction

GRACE: 基于接地动作中心证据增强视频多模态大语言模型用于观众情感预测

Ruoxuan Yang, Tieyuan Chen, Xiaofeng Huang, Haibing Yin, Jun Wang, Xiping Chen, Jun Yin, Xuesong Gao, Weiyao Lin

机构 * Shanghai Jiao Tong University(上海交通大学) Hangzhou Dianzi University(杭州电子科技大学) The 52nd Research Institute of China Electronics Technology Group Corporation(中国电子科技集团公司第五十二研究所) Hangzhou Bywin Technology Co., Ltd.(杭州百威科技有限公司) Zhejiang Dahua Technology Co., Ltd.(浙江大华技术股份有限公司) School of Information Science and Engineering, Shandong University(山东大学信息科学与工程学院) Haihe Laboratory of Information Technology Application Innovation(海河信息技术应用创新实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 提出GRACE框架,通过提取时间有序的主谓宾三元组和视觉实体裁剪,增强视频MLLM对细粒度情感线索的提取与推理,在Pitts数据集上提升Qwen2.5-VL和Qwen3-VL性能。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15320 2026-06-16 cs.CV 新提交 67%

Conditional Multi-Event Temporal Grounding in Long-Form Video

长视频中的条件多事件时间定位

Yuanhao Zou, Arthad Kulkarni, Lucas Tonanez, Lincoln Spencer, Guangyu Sun, Tianxingjian Ding, Andong Deng, Yi Li, Shuangjun Liu, Yuan Li, Dashan Gao, Ning Bi, Taotao Jing, Shuai Zhang, Chen Chen

机构 * University of Central Florida(中佛罗里达大学) Qualcomm AI Research(高通人工智能研究院)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 提出CoMET-Bench基准和CoMET-Agent框架,解决长视频中基于组合时空条件定位所有事件的任务,F1@0.5提升6.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15139 2026-06-16 cs.GT cs.RO 新提交 67%

Self-Driving Negotiator: An interactive, verifiable benchmark for social negotiation and theory of mind under hidden intent

自动驾驶谈判者:一个在隐藏意图下进行社会谈判和心理理论的交互式可验证基准

Ashutosh Kumar

机构 * Owl Autonomous Imaging, Inc(Owl 自动成像公司)

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 提出一个文本多轮程序化生成环境,用于衡量自动驾驶中基于隐藏意图推断的隐式社会协调能力,通过特权模拟器状态计算奖励和诊断,当前最佳模型平均成功率仅0.68。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14616 2026-06-15 cs.SE 新提交 67%

GitHub Template Repositories: Served Domains, Maintenance, and Practitioner Guidelines

GitHub 模板仓库:服务领域、维护与从业者指南

Leuson Da Silva, Altaf Allah Abbassi, Imen Trabelsi, Paulo Borba, Foutse Khomh

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 通过对五种主流编程语言的 GitHub 模板仓库进行大规模实证研究,分析了模板的服务领域、维护特征及质量问题,并提出了设计和管理模板的实用指南。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14025 2026-06-15 cs.CV 新提交 67%

GarmentSketch: Large-scale Sketch-to-Fashion Benchmark

GarmentSketch:大规模草图到时尚基准

Duong-Duy-Khang Bui, Minh-Tan Pham, Tam V. Nguyen, Minh-Triet Tran, Trung-Nghia Le

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 为解决时尚草图到图像合成缺乏大规模配对数据的问题,构建了包含26249对草图-文本描述的GarmentSketch数据集,并基于多模态大模型与人工精炼生成描述,评估了现有生成模型的性能。

Comments ICCCI 2026. Project page: https://khangbdd.github.io/garmentsketch

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13477 2026-06-12 cs.LG cs.AI cs.CL 新提交 67%

SupraBench: A Benchmark for Supramolecular Chemistry

SupraBench: 超分子化学基准

Tianyi Ma, Yijun Ma, Zehong Wang, Weixiang Sun, Ziming Li, Connor R. Schmidt, Chuxu Zhang, Matthew J. Webber, Yanfang Ye

机构 * University of Notre Dame(圣母大学) University of Connecticut(康涅狄格大学)

专题命中 评测与基准 :pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 为评估大语言模型在超分子化学推理中的能力,与领域专家合作发布了首个超分子基准SupraBench,包含四个基本任务和一个辅助视觉任务,并提供了16M令牌的语料库SupraPMC。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12469 2026-06-12 cs.CR 新提交 67%

Influence Factors on RAG Poisoning

RAG投毒的影响因素

Pedro Pereira, Eva Maia, Isabel Praça, Adrien Bécue

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 通过432种配置的全因子实验,研究数据集、检索器类型、检索深度、数据库组成、分块策略和生成模型对RAG系统投毒鲁棒性的影响,发现检索器架构、数据集和检索深度是主要因素,且投毒脆弱性源于多组件交互。

Comments 10 pages, 3 figures, 2 Tables, conference KES-2026 30th International Conference on Knowledge-Based and Intelligent Information & Engineering Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12125 2026-06-11 cs.CV 新提交 67%

Q-Fold: Query-Aware Focus-Context Spatio-Temporal Folding for Long Video Understanding

Q-Fold: 查询感知的焦点-上下文时空折叠用于长视频理解

Biao Tang, Xu Chen, Shuxiang Gou, Jingyi Yuan, Yuhan Zhang, Chenqiang Gao

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Shenzhen Institute for Advanced Study, University of Electronic Science and Technology of China(电子科技大学深圳高等研究院)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 提出Q-Fold,一种无需训练的长视频输入构建框架,通过查询引导将相关片段保留为高保真焦点帧,不相关片段折叠为上下文布局,在固定预算下提升多模态大模型的长视频理解性能。

Comments 10 pages, 5 figures, 8 tables. Code will be made publicly available

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10051 2026-06-10 cs.CY cs.HC 新提交 67%

The Empirically Grounded Adaptive Virtual Patient for Psychotherapy Training: Disclosure That Responds to Therapist Micro-Skills

基于经验的自适应虚拟患者用于心理治疗培训:对治疗师微技能做出反应的披露

Angela Chen, Siwei Jin, Catherine Bao, Canwen Wang, Robert E. Kraut, Tongshuang Wu, Haiyi Zhu

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 提出自适应虚拟患者(AVP),基于近2000小时真实治疗转录的结构方程模型,动态调整披露水平以响应治疗师共情和探索技能,在80次会话评估中优于纯提示基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08568 2026-06-09 cs.CY 新提交 67%

Regulating the AI Tutor: Intentions, Help-Seeking, and Self-Regulated Learning in Adolescent GenAI Use

调控AI导师:青少年使用生成式AI时的意图、求助行为与自我调节学习

Rania Abdelghani, Peter Kaiser, Kou Murayama

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 研究通过98名九年级学生的对话数据,分析青少年使用生成式AI学习时的自我调节学习和求助行为,发现学生主要进行工具性请求而缺乏监控评估,且后测成绩显著下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07962 2026-06-09 cs.CV 新提交 67%

ChronoPhyBench: Do MLLMs Truly Understand the World or Merely Exploit Language Priors?

ChronoPhyBench:多模态大语言模型真正理解世界还是仅仅利用语言先验?

Bin Zhu, Yanhao Jia, Kexin Zhao, Jie Wang, Munan Ning, Hao Li, Yuwei Niu, Tanqing Sun, Huangchong Yan, Mingjun Pan, Xinyi Wu, Qishen Yin, Yunyang Ge, Shuai Zhao, Li Yuan

机构 * Peking University, Shenzhen Graduate School(北京大学深圳研究生院) Peng Cheng Laboratory(鹏城实验室) Rabbitpre Intelligence Nanyang Technological University(南洋理工大学) Tsinghua University(清华大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 提出ChronoPhyBench基准,通过视频上下文和文本描述强制模型进行物理状态推理,揭示当前开源模型物理推理能力仍处初级阶段。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07451 2026-06-08 cs.CV cs.AI cs.CL cs.LG 新提交 67%

TEVI: Text-Conditioned Editing of Visual Representations via Sparse Autoencoders for Improved Vision-Language Alignment

TEVI: 基于稀疏自编码器的文本条件视觉表示编辑以改进视觉-语言对齐

Sweta Mahajan, Sukrut Rao, Jiahao Xie, Alexander Koller, Bernt Schiele

机构 * Max Planck Institute for Informatics, Saarland Informatics Campus, Saarbrücken, Germany(马克斯·普朗克研究所信息学院,萨尔兰信息学院,德国萨尔布吕肯) Department of Language Science and Technology, Saarland University, Saarbrücken, Germany(语言科学与技术系,萨尔兰大学,德国萨尔布吕肯)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出TEVI框架,利用稀疏自编码器解耦图像嵌入,并通过文本条件掩码模块选择性重构嵌入,以改善CLIP等视觉-语言模型的图像-文本对齐,在多个检索基准上取得提升。

Comments 20 pages, 13 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07434 2026-06-08 cs.GT 新提交 67%

Evidence Markets

证据市场

Safwan Hossain, Gabriel Andrade, Chengqi Zang, Yiling Chen

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 提出证据市场,通过动态调整流动性的对数市场评分规则,激励提交证据和信念,支持内生解决,证明有界损失、证据按市场不确定性奖励,并实现ε-DSIC策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07363 2026-06-08 cs.CR cs.SE 新提交 67%

On the Shoulders of Giants: Empowering Automated Smart Contract Auditing via the GiAnt Corpus

站在巨人的肩膀上:通过GiAnt语料库赋能自动化智能合约审计

Xiaoting Zhang, Zhipeng Gao, Yiran Lv, Xing Hu, Feifei Niu, Xin Xia

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 提出自动化框架GiANT,从真实审计报告中提取漏洞信息构建高质量数据集GiAnt Corpus,包含7711个漏洞发现,验证了其在漏洞检测等任务中的实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07175 2026-06-08 cs.CV 新提交 67%

Seeing Without Exposing: Adaptive Privacy Control for Open-World, Context-Hungry MLLMs

看见而不暴露:面向开放世界、上下文饥渴型MLLM的自适应隐私控制

Siyuan Xu, Yibing Liu, Peilin Chen, Yung-Hui Li, Shiqi Wang, Sam Kwong

机构 * City University of Hong Kong(香港城市大学) Hon Hai Research Institute(鸿海研究学院) Lingnan University(岭南大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 针对多模态大语言模型在开放世界中面临不可预测敏感信息泄露的隐私挑战,提出无训练方法APD,将隐私元素漂移至语义等价替代物并锚定上下文线索,结合新基准AdaptShield实现隐私保护与上下文保留的平衡提升。

详情

展开后加载摘要…

URL PDF HTML 收藏