arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-04 至 2025-12-04 共收录 32 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32 篇

2511.18054 2025-12-04 cs.CL cs.LG 90%

Blu-WERP (Web Extraction and Refinement Pipeline): A Scalable Pipeline for Preprocessing Large Language Model Datasets

Blu-WERP(网络内容提取与精炼流程):一种用于预处理大语言模型数据集的可扩展流程

Gowtham, Sai Rupesh, Sanjay Kumar, Saravanan, Venkata Chaithanya

机构 * BluBridge Research(BluBridge研究机构)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

AI总结 Blu-WERP是一种用于提升大语言模型训练数据质量的高效预处理流程,通过优化Common Crawl WARC文件,显著提高了模型性能和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.07004 2025-12-04 cs.CR cs.AI 89%

Casper: Prompt Sanitization for Protecting User Privacy in Web-Based Large Language Models

Casper:用于保护Web基于大语言模型用户隐私的提示净化

Chun Jie Chong, Chenxi Hou, Zhihao Yao, Seyed Mohammadjavad Seyed Talebi

机构 * New Jersey Institute of Technology(新泽西理工学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 Casper通过浏览器扩展在用户设备上运行,利用规则过滤、机器学习和本地LLM技术,有效过滤用户输入中的敏感信息,保护隐私。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.02977 2025-12-04 cs.SE cs.AI 89%

Large Language Model-Based Agents for Software Engineering: A Survey

基于大型语言模型的软件工程代理:一项综述

Junwei Liu, Kaixin Wang, Yixuan Chen, Xin Peng, Zhenpeng Chen, Lingming Zhang, Yiling Lou

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文综述了基于大型语言模型的软件工程代理,分析了其应用、挑战及未来方向。

Comments Accepted by TOSEM

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03943 2025-12-04 cs.CL cs.HC 88%

Is Lying Only Sinful in Islam? Exploring Religious Bias in Multilingual Large Language Models Across Major Religions

在伊斯兰教中,说谎只是一种罪过吗?探索多语言大语言模型在主要宗教中的宗教偏见

Kazi Abrab Hossain, Jannatul Somiya Mahmud, Maria Hossain Tuli, Anik Mitra, S. M. Taiabul Haque, Farig Y. Sadeque

机构 * Computer Science and Engineering, BRAC University(布拉克大学计算机科学与工程系) Department of Computer Science and Engineering, BRAC University(布拉克大学计算机科学与工程系) Engineering, BRAC University(布拉克大学工程系)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 研究通过BRAND数据集揭示多语言模型在宗教问题上的持续偏见,尤其在回答中性问题时对伊斯兰教的偏见。

Comments 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03318 2025-12-04 cs.AI 85%

Evaluating Generalization Capabilities of LLM-Based Agents in Mixed-Motive Scenarios Using Concordia

利用Concordia评估基于LLM的智能体在混合动机场景中的泛化能力

Chandler Smith, Marwa Abdulhai, Manfred Diaz, Marko Tesic, Rakshit S. Trivedi, Alexander Sasha Vezhnevets, Lewis Hammond, Jesse Clifton, Minsuk Chang, Edgar A. Duéñez-Guzmán, John P. Agapiou, Jayd Matyas, Danny Karmon, Akash Kundu, Aliaksei Korshuk, Ananya Ananya, Arrasy Rahman, Avinaash Anand Kulandaivel, Bain McHale, Beining Zhang, Buyantuev Alexander, Carlos Saith Rodriguez Rojas, Caroline Wang, Chetan Talele, Chenao Liu, Chichen Lin, Diana Riazi, Di Yang Shi, Emanuel Tewolde, Elizaveta Tennant, Fangwei Zhong, Fuyang Cui, Gang Zhao, Gema Parreño Piqueras, Hyeonggeun Yun, Ilya Makarov, Jiaxun Cui, Jebish Purbey, Jim Dilkes, Jord Nguyen, Lingyun Xiao, Luis Felipe Giraldo, Manuela Chacon-Chamorro, Manuel Sebastian Rios Beltran, Marta Emili García Segura, Mengmeng Wang, Mogtaba Alim, Nicanor Quijano, Nico Schiavone, Olivia Macmillan-Scott, Oswaldo Peña, Peter Stone, Ram Mohan Rao Kadiyala, Rolando Fernandez, Ruben Manrique, Sunjia Lu, Sheila A. McIlraith, Shamika Dhuri, Shuqing Shi, Siddhant Gupta, Sneheel Sarangi, Sriram Ganapathi Subramanian, Taehun Cha, Toryn Q. Klassen, Wenming Tu, Weijian Fan, Wu Ruiyang, Xue Feng, Yali Du, Yang Liu, Yiding Wang, Yipeng Kang, Yoonchang Sung, Yuxuan Chen, Zhaowei Zhang, Zhihan Wang, Zhiqiang Wu, Ziang Chen, Zilong Zheng, Zixia Jia, Ziyan Wang, Dylan Hadfield-Menell, Natasha Jaques, Tim Baarslag, Jose Hernandez-Orallo, Joel Z. Leibo

机构 * Cooperative AI Foundation(合作人工智能基金会) University of Oxford(牛津大学) UC Berkeley(伯克利大学) Quebec Artificial Intelligence Institute(魁北克人工智能研究所) Leverhulme Centre for the Future of Intelligence, University of Cambridge(未来智能研究中心,剑桥大学) MIT(麻省理工学院) Google DeepMind(谷歌DeepMind) Center on Long-Term Risk(长期风险中心) Google Research(谷歌研究) University of Washington(华盛顿大学) Centrum Wiskunde & Informatica(数学与信息研究所) Utrecht University(乌得勒支大学) Universitat Politècnica de València(瓦伦西亚理工大学) Concordia Contest Participants with Notable Contributions(康科德比赛有显著贡献的参与者)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出利用Concordia评估LLM智能体在混合动机场景中的合作能力,揭示了当前智能体在泛化能力上的不足。

Comments Published at NeurIPS Datasets and Benchmarks 2025, 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10792 2025-12-04 cs.CL 85%

Finetune-RAG: Fine-Tuning Language Models to Resist Hallucination in Retrieval-Augmented Generation

Finetune-RAG: 通过微调语言模型抵抗检索增强生成中的幻觉

Zhan Peng Lee, Andre Lin, Calvin Tan

机构 * Pints AI Labs(Pints AI 实验室)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL

AI总结 Finetune-RAG通过微调方法提升LLM事实准确性,提出首个RAG训练数据集和压力测试评估流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.15478 2025-12-04 cs.CL 84%

A Group Fairness Lens for Large Language Models

为大语言模型引入群体公平性视角

Guanqun Bi, Yuqiang Xie, Lei Shen, Yanan Cao

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 评测与基准 :large language model(title);language model(title);分类 cs.CL

AI总结 本文提出从群体公平性角度评估大语言模型的偏见,引入 GFAIR 数据集和 GF-THINK 方法,以缓解模型中的偏见问题。

Comments Accepted to EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02170 2025-12-04 cs.AI 79%

Flowchart2Mermaid: A Vision-Language Model Powered System for Converting Flowcharts into Editable Diagram Code

流程图2Mermaid:一种基于视觉-语言模型的系统,用于将流程图转换为可编辑的图表代码

Pritam Deka, Barry Devereux

机构 * Queen’s University Belfast(女王大学贝尔法斯特)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 Flowchart2Mermaid通过视觉-语言模型将流程图图像转换为可编辑的Mermaid代码,提供结构化文本表示和混合初始化的编辑功能,提升流程图的可重用性和版本控制能力。

Comments Submitted to EACL 2026 Demo Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03558 2025-12-04 cs.CV cs.CL 79%

CartoMapQA: A Fundamental Benchmark Dataset Evaluating Vision-Language Models on Cartographic Map Understanding

CartoMapQA: 一个评估视觉-语言模型在制图地图理解上的基础基准数据集

Huy Quang Ung, Guillaume Habault, Yasutaka Nishimura, Hao Niu, Roberto Legaspi, Tomoki Oya, Ryoichi Kojima, Masato Taya, Chihiro Ono, Atsunori Minamikawa, Yan Liu

机构 * KDDI Research, Inc.(KDDI研究公司) University of Southern California(南加州大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

AI总结 CartoMapQA通过问答任务评估视觉-语言模型在制图地图理解上的能力,揭示了模型在地图语义和地理推理方面的不足。

Comments Accepted at SIGSPATIAL 2025 (Best paper candidates), 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00821 2025-12-04 cs.CR cs.AI 79%

SafeGenes: Evaluating the Adversarial Robustness of Genomic Foundation Models

SafeGenes: 评估基因组基础模型的对抗鲁棒性

Huixin Zhan, Clovis Barbour, Jason H. Moore

机构 * Department of Computer Science & Engineering, New Mexico Tech(计算机科学与工程系,新墨西哥技术学院) Computational Biomedicine, Cedars-Sinai Medical Center(计算生物医学,西德斯-辛内斯医疗中心)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI

AI总结 SafeGenes通过对抗攻击评估基因组基础模型的鲁棒性,揭示其在变异效应预测中的安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03466 2025-12-04 cs.MA cs.AI 78%

AsymPuzl: An Asymmetric Puzzle for multi-agent cooperation

AsymPuzl:多智能体合作中的非对称谜题

Xavier Cadet, Edward Koh, Peter Chin

机构 * Dartmouth College(达特茅斯学院)

专题命中 评测与基准 :LLM(abstract,comments);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 AsymPuzl通过非对称谜题环境研究多智能体合作中的通信策略与反馈机制。

Comments Accepted at NeurIPS MTI-LLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03663 2025-12-04 cs.CV 78%

Multi-Scale Visual Prompting for Lightweight Small-Image Classification

多尺度视觉提示用于轻量级小图像分类

Salim Khazem

机构 * Talan Research Center(塔兰研究中心)

专题命中 评测与基准 :prompting(title,abstract)

AI总结 本文提出多尺度视觉提示方法,通过轻量级模块提升小图像分类性能,适用于多种backbone,且计算开销小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03064 2025-12-04 cs.SI 78%

Demographic Inference from Social Media Data with Multimodal Foundation Models: Strategies, Evaluation, and Benchmarking

从社交媒体数据中推断人口特征:多模态基础模型的策略、评估与基准测试

Hao Yang, Angela Yao, Eric Chang, Hexiang Wang

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 本研究利用GPT-5多模态基础模型,从社交媒体资料中推断年龄、性别和种族,展示了其在提高人口特征推断准确性、公平性和可扩展性方面的潜力。

Comments 21 pages, 10 figures and 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03720 2025-12-04 cs.CR cs.AI 77%

Context-Aware Hierarchical Learning: A Two-Step Paradigm towards Safer LLMs

上下文感知的分层学习:一种更安全LLM的两阶段范式

Tengyun Ma, Jiaqi Yao, Daojing He, Shihao Peng, Yu Li, Shaohui Liu, Zhuotao Tian

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Harbin Institute of Technology(哈尔滨工业大学) Great Bay University(大贝大学) Zhejiang University(浙江大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出上下文感知分层学习(CAHL)以提升LLM对工具完成攻击的鲁棒性,通过动态平衡语义理解和指令约束,有效增强模型安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18303 2025-12-04 cs.LG cond-mat.mes-hall cond-mat.mtrl-sci 77%

Hierarchical Deep Research with Local-Web RAG: Toward Automated System-Level Materials Discovery

分层深度研究与本地Web RAG:迈向自动化系统级材料发现

Rui Ding, Rodrigo Pires Ferreira, Yuxin Chen, Junhong Chen

机构 * Pritzker School of Molecular Engineering, University of Chicago(芝加哥大学普利兹克分子工程学院) Chemical Sciences and Engineering Division, Argonne National Laboratory(阿贡国家实验室化学科学与工程 division) Department of Computer Science, University of Chicago(芝加哥大学计算机科学系)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出一种分层深度研究代理,通过本地Web RAG和DToR机制,实现低成本高质的自动化系统级材料发现。

Comments A preliminary version appeared in The AI for Accelerated Materials Discovery (AI4Mat) Workshop at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13747 2025-12-04 cs.CV 75%

InteractiveOmni: A Unified Omni-modal Model for Audio-Visual Multi-turn Dialogue

InteractiveOmni: 一种用于音频-视觉多轮对话的统一多模态模型

Wenwen Tong, Hewei Guo, Dongchuan Ran, Jiangnan Chen, Jiefan Lu, Kaibin Wang, Keqiang Li, Xiaoxu Zhu, Jiakui Li, Kehan Li, Xueheng Li, Lumin Li, Chenxu Guo, Jiasheng Zhou, Jiandong Chen, Xianye Wu, Jiahao Wang, Silei Wu, Lei Chen, Hanming Deng, Yuxuan Song, Dinghao Zhou, Guiping Zhong, Ken Zheng, Shiyin Kang, Lewei Lu

机构 * SenseTime Research(商汤科技研究院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);post-training(abstract)

AI总结 InteractiveOmni是一种统一的多模态模型,通过多阶段训练策略提升多轮对话能力,提供高效的音频-视觉交互体验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03111 2025-12-04 q-bio.GN cs.AI cs.CV 74%

PanFoMa: A Lightweight Foundation Model and Benchmark for Pan-Cancer

PanFoMa:一种轻量级基础模型和跨癌症基准

Xiaoshui Huang, Tianlin Zhu, Yifan Zuo, Xue Xia, Zonghan Wu, Jiebin Yan, Dingli Hua, Zongyi Xu, Yuming Fang, Jian Zhang

专题命中 评测与基准 :foundation model(title);分类 cs.AI

AI总结 PanFoMa通过结合Transformer和状态空间模型,提出了一种轻量级基础模型和跨癌症基准,有效捕捉局部和全局调控信号,提升单细胞转录组建模性能。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03634 2025-12-04 cs.CL cs.AI 73%

AlignCheck: a Semantic Open-Domain Metric for Factual Consistency Assessment

AlignCheck: 一个语义开放域的度量标准用于事实一致性评估

Ahmad Aghaebrahimian

机构 * Institute of Computational Life Sciences, Department of Life Sciences and Facility Management, Zurich University of Applied Sciences(计算生命科学研究所,生命科学与设施管理系,苏黎世应用科学大学) Swiss Institute of Bioinformatics(瑞士生物信息学研究所)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 AlignCheck提出了一种可解释的开放域事实一致性评估框架,通过分解文本为原子事实并引入加权度量,提升事实评估的准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08933 2025-12-04 cs.CL 70%

Reveal-Bangla: A Dataset for Cross-Lingual Multi-Step Reasoning Evaluation

Reveal-Bangla:用于跨语言多步推理评估的数据集

Khondoker Ittehadul Islam, Gabriele Sarti

机构 * Center for Language and Cognition (CLCG)(语言与认知中心)

专题命中 评测与基准 :language model(abstract);small language model(abstract);分类 cs.CL

AI总结 本文提出一个孟加拉语多步推理数据集,评估了多语言模型在不同语言下的推理能力,发现推理上下文对非二元问题有帮助,但模型在利用相关推理步骤方面表现不佳。

Comments Accepted at BLP workshop @ IJCNLP-AACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03340 2025-12-04 cs.CL 70%

PERCS: Persona-Guided Controllable Biomedical Summarization Dataset

PERCS:基于人物的可控生物医学摘要数据集

Rohan Charudatt Salvi, Chirag Chawla, Dhruv Jain, Swapnil Panigrahi, Md Shad Akhtar, Shweta Yadav

机构 * Department of Computer Science, University of Illinois, Chicago, IL, 60607, USA(伊利诺伊大学芝加哥分校计算机科学系) Indian Institute of Technology, Varanasi, India(印度班加罗尔理工学院) Department of Computer Science & Engineering, Indraprastha Institute of Information Technology, Delhi, New Delhi, 110020, India(印度德里印度信息技术研究所计算机科学与工程系)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 PERCS数据集通过针对不同医学素养角色的可控摘要,提升生物医学信息的可及性与准确性。

Comments 9 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19304 2025-12-04 cs.AI cs.CL cs.LG 67%

AutoEnv: Automated Environments for Measuring Cross-Environment Agent Learning

AutoEnv:用于测量跨环境智能体学习的自动化环境

Jiayi Zhang, Yiran Peng, Fanqi Kong, Cheng Yang, Yifan Wu, Zhaoyang Yu, Jinyu Xiang, Jianhao Ruan, Jinlin Wang, Maojia Song, HongZhang Liu, Xiangru Tang, Bang Liu, Chenglin Wu, Yuyu Luo

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) DeepWisdom Peking University(北京大学) Singapore University of Technology and Design(新加坡科技设计大学) Sydney University(悉尼大学) Yale University(耶鲁大学) Université de Montréal & Mila(蒙特利尔大学及Mila)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 AutoEnv通过自动化生成异质环境和组件驱动的学习方法,探讨了跨环境智能体学习的挑战与扩展性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18214 2025-12-04 cs.CV cs.AI cs.CL cs.LG 67%

VLSU: Mapping the Limits of Joint Multimodal Understanding for AI Safety

VLSU:联合多模态理解在AI安全中的极限映射

Shruti Palaskar, Leon Gatys, Mona Abdelrahman, Mar Jacobo, Larry Lindsey, Rutika Moharir, Gunnar Lund, Yang Xu, Navid Shiee, Jeffrey Bigham, Charles Maalouf, Joseph Yitan Cheng

机构 * Apple(苹果公司)

专题命中 评测与基准 :foundation model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 VLSU通过细粒度分类和组合分析,揭示了多模态安全评估中联合理解的缺陷,为改进AI安全研究提供关键测试平台。

Comments 10 pages, 5 figures, 4 tables, detailed appendix. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19582 2025-12-04 cs.CV 67%

Guard Me If You Know Me: Protecting Specific Face-Identity from Deepfakes

Kaiqing Lin, Zhiyuan Yan, Ke-Yue Zhang, Li Hao, Yue Zhou, Yuzhen Lin, Weixiang Li, Taiping Yao, Shouhong Ding, Bin Li

机构 * Guangdong Provincial Key Laboratory of Intelligent Information Processing(广东省智能信息处理重点实验室) Shenzhen Key Laboratory of Media Security(深圳媒体安全重点实验室) SZU-AFS Joint Innovation Center for AI Technology(深圳大学-腾讯优图联合创新中心) Shenzhen University(深圳大学) School of Electronic and Computer Engineering(电子与计算机工程学院) Peking Univerisity(北京大学) Tencent Youtu Lab(腾讯优图实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18980 2025-12-04 cs.CL cs.AI cs.CV 62%

IW-Bench: Evaluating Large Multimodal Models for Converting Image-to-Web

IW-Bench: 评估大规模多模态模型的图像到网页转换能力

Hongcheng Guo, Wei Zhang, Junhao Chen, Yaonan Gu, Jian Yang, Junjia Du, Shaosheng Cao, Binyuan Hui, Tianyu Liu, Jianxin Ma, Chang Zhou, Zhoujun Li

机构 * Beihang University(北京航空航天大学) Alibaba Group(阿里巴巴集团) Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学) National University of Singapore(新加坡国立大学)

专题命中 评测与基准 :prompting(abstract);分类 cs.CL、cs.AI

AI总结 IW-Bench提出了一种新的基准,用于评估大规模多模态模型在图像到网页转换中的性能,通过元素准确率和布局准确率以及五跳提示方法来提升评估效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04062 2025-12-04 cs.LG 57%

Eval Factsheets: A Structured Framework for Documenting AI Evaluations

评估事实表:一种用于记录AI评估的结构化框架

Florian Bordes, Candace Ross, Justine T Kao, Evangelia Spiliopoulou, Adina Williams

机构 * FAIR at Meta(Meta的FAIR)

专题命中 评测与基准 :LLM(abstract);分类 cs.LG

AI总结 本文提出Eval Factsheets,一种结构化框架,用于系统记录AI评估方法,通过分类法和问卷方法提升评估的透明度和可重复性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22619 2025-12-04 cs.AI 57%

AI Deception: Risks, Dynamics, and Controls

AI欺骗:风险、动态与控制

Boyuan Chen, Sitong Fang, Jiaming Ji, Yanxu Zhu, Pengcheng Wen, Jinzhou Wu, Yingshui Tan, Boren Zheng, Mengying Yuan, Wenqi Chen, Donghai Hong, Alex Qiu, Xin Chen, Jiayi Zhou, Kaile Wang, Juntao Dai, Borong Zhang, Tianzhuo Yang, Saad Siddiqui, Isabella Duan, Yawen Duan, Brian Tse, Jen-Tse, Huang, Kun Wang, Baihui Zheng, Jiaheng Liu, Jian Yang, Yiming Li, Wenting Chen, Dongrui Liu, Lukas Vierling, Zhiheng Xi, Haobo Fu, Wenxuan Wang, Jitao Sang, Zhengyan Shi, Chi-Min Chan, Eugenie Shi, Simin Li, Juncheng Li, Jian Yang, Wei Ji, Dong Li, Jinglin Yang, Jun Song, Yinpeng Dong, Jie Fu, Bo Zheng, Min Yang, Yike Guo, Philip Torr, Robert Trager, Yi Zeng, Zhongyuan Wang, Yaodong Yang, Tiejun Huang, Ya-Qin Zhang, Hongjiang Zhang, Andrew Yao

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 本文探讨了AI欺骗的风险、动态及控制,提出欺骗循环模型,分析欺骗出现机制与处理方法,并提出缓解策略与审计方法以应对AI安全挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03013 2025-12-04 cs.SE cs.LG 57%

Cataloguing Hugging Face Models to Software Engineering Activities: Automation and Findings

对Hugging Face模型进行软件工程活动的分类:自动化与发现

Alexandra González, Xavier Franch, David Lo, Silverio Martínez-Fernández

机构 * Universitat Politècnica de Catalunya(政治与技术大学) Singapore Management University(新加坡管理大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.LG

AI总结 本文通过分类Hugging Face上的预训练模型,揭示了软件工程中模型的应用现状与不足,为自动化场景提供了基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15644 2025-12-04 cs.CV cs.AI cs.CR 57%

Can VLMs Detect and Localize Fine-Grained AI-Edited Images?

视觉语言模型能否检测并定位细粒度的人工智能编辑图像?

Zhen Sun, Ziyi Zhang, Zeren Luo, Zhiyuan Zhong, Zeyang Sha, Tianshuo Cong, Zheng Li, Shiwen Cui, Weiqiang Wang, Jiaheng Wei, Xinlei He, Qi Li, Qian Wang

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Ant Group(蚂蚁集团) Tsinghua University(清华大学) Shandong University(山东大学) Wuhan University(武汉大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 本文提出FragFake基准,首次系统研究VLMs在编辑图像分类和定位中的应用,发现微调模型在准确性上表现优异,同时探索了基于GRPO的RLVR训练方法。

Comments 14pages,19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03844 2025-12-04 cs.CV 50%

CoDA: From Text-to-Image Diffusion Models to Training-Free Dataset Distillation

CoDA:从文本到图像扩散模型到无训练数据集蒸馏

Letian Zhou, Songhua Liu, Xinchao Wang

专题命中 评测与基准 :foundation model(abstract)

AI总结 CoDA通过核心分布对齐技术,利用现成文本到图像模型实现无训练数据集蒸馏,提升目标语义与通用生成先验的对齐,取得ImageNet-1K的高准确率。

Comments 34 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03793 2025-12-04 cs.CY 50%

The enshittification of online search? Privacy and quality of Google, Bing and Apple in coding advice

在线搜索的劣质化?谷歌、必胜客和苹果在编程建议中的隐私和质量

Konrad Kollnig

专题命中 评测与基准 :language model(abstract)

AI总结 本研究比较了谷歌、必胜客和苹果在编程建议搜索中的隐私和质量,发现必胜客在隐私和质量上表现最佳。

Comments Technical report on work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏