arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-03 至 2026-03-03 共收录 599 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 124 篇

2412.19496 2026-03-03 cs.CR cs.AI 79%

Multi-PA: A Multi-perspective Benchmark on Privacy Assessment for Large Vision-Language Models

多视角:面向大视觉-语言模型隐私评估的基准测试

Jie Zhang, Xiangkui Cao, Zhouyu Han, Shiguang Shan, Xilin Chen

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 Multi-PA是一个多视角的隐私评估基准,用于评估大视觉-语言模型在隐私意识和泄露方面的保护能力,揭示了当前模型在隐私保护方面的风险和漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00452 2026-03-03 cs.HC cs.AI 79%

Texterial: A Text-as-Material Interaction Paradigm for LLM-Mediated Writing

Texterial: 一种基于文本作为材料的交互范式用于大语言模型辅助写作

Jocelyn Shen, Nicolai Marquardt, Hugo Romat, Ken Hinckley, Nathalie Riche, Fanny Chevalier

机构 * Microsoft Research(微软研究院) MIT Media Lab(麻省理工学院媒体实验室) University of Toronto(多伦多大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 Texterial提出一种将文本视为可塑材料的交互范式,通过手势塑形和植物生长的机制,提升大语言模型辅助写作的用户体验和操作灵活性。

Journal ref Proceedings of the 2026 ACM CHI Conference on Human Factors in Computing Systems (ACM CHI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17568 2026-03-03 cs.CR cs.AI cs.SD eess.AS 79%

JALMBench: Benchmarking Jailbreak Vulnerabilities in Audio Language Models

JALMBench: 对音频语言模型中越权攻击的基准测试

Zifan Peng, Yule Liu, Zhen Sun, Mingchen Li, Zeren Luo, Jingyi Zheng, Wenhan Dong, Xinlei He, Xuechao Wang, Yingjie Xue, Shengmin Xu, Xinyi Huang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) State Key Laboratory of Internet Architecture, Tsinghua University(清华大学互联网架构国家重点实验室) University of North Texas(北卡罗来纳州立大学) University of Science and Technology of China(中国科学技术大学) Fujian Normal University(福建师范大学) Nanjing University of Aeronautics and Astronautics(南京航空航天大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 JALMBench通过评估11,316个文本样本和245,355个音频样本,分析LALMs对越权攻击的安全性,揭示模态和架构对安全性的影响,强调需专门设计的防御方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01291 2026-03-03 cs.LG cs.CL 79%

JailNewsBench: Multi-Lingual and Regional Benchmark for Fake News Generation under Jailbreak Attacks

JailNewsBench: 多语言和区域假新闻生成对抗基准

Masahiro Kaneko, Ayana Niwa, Timothy Baldwin

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 JailNewsBench 是首个评估大语言模型对抗jailbreak攻击生成假新闻鲁棒性的多语言和区域基准,揭示了不同语言和区域间安全性的不平衡问题。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00024 2026-03-03 cs.CL cs.AI 79%

Personalization Increases Affective Alignment but Has Role-Dependent Effects on Epistemic Independence in LLMs

个性化增强了情感一致性,但对LLM中的认知独立性有角色依赖性的影响

Sean W. Kelley, Christoph Riedl

机构 * Northeastern University, Boston, MA, USA(东北大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究探讨了个性化对LLM情感一致性与认知独立性的影响,发现其效果依赖于角色设定,且通过实验验证了个性化条件对模型行为的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01205 2026-03-03 cs.CV 78%

CoSMo3D: Open-World Promptable 3D Semantic Part Segmentation through LLM-Guided Canonical Spatial Modeling

CoSMo3D:通过LLM引导的规范空间建模实现开放世界可提示的3D语义部分分割

Li Jin, Weikai Chen, Yujie Wang, Yingda Yin, Zeyu Hu, Runze Zhang, Keyang Luo, Shengju Qian, Xin Wang, Xueying Qin

机构 * SDU(山东大学) LIGHTSPEED(LIGHTSPEED公司) UNC Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 评测与基准 :LLM(title,abstract)

AI总结 CoSMo3D通过LLM引导的规范空间建模实现开放世界可提示的3D语义部分分割,提升语义稳定性和可转移性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01174 2026-03-03 cs.CV 78%

VP-Hype: A Hybrid Mamba-Transformer Framework with Visual-Textual Prompting for Hyperspectral Image Classification

VP-Hype:一种结合视觉-文本提示的混合Mamba-Transformer框架用于超光谱图像分类

Abdellah Zakaria Sellam, Fadi Abdeladhim Zidi, Salah Eddine Bekhouche, Ihssen Houhou, Marouane Tliba, Cosimo Distante, Abdenour Hadid

机构 * Institute of Applied Sciences and Intelligent Systems (ISASI), CNR(应用科学与智能系统研究所(ISASI),CNR) Dept. of Engineering for Innovation, University of Salento(创新工程系,萨勒诺大学) VSC Laboratory, Department of Electronics and Automation, University of Biskra(VSC实验室,电子与自动化系,比斯克拉大学) Dept. of Computer Science and AI, University of the Basque Country (UPV/EHU)(计算机科学与人工智能系,巴斯克国家大学(UPV/EHU)) Sorbonne Center for Artificial Intelligence, Sorbonne University Abu Dhabi(索邦大学阿布扎克人工智能中心)

专题命中 评测与基准 :prompting(title,abstract)

AI总结 VP-Hype通过混合Mamba-Transformer架构和双模态提示,实现超光谱图像分类的高准确率与低样本需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01083 2026-03-03 cs.CV 78%

Can Vision Language Models Assess Graphic Design Aesthetics? A Benchmark, Evaluation, and Dataset Perspective

视觉语言模型能否评估图形设计的审美?一个基准、评估和数据集的视角

Arctanx An, Shizhao Sun, Danqing Huang, Mingxi Cheng, Yan Gao, Ji Li, Yu Qiao, Jiang Bian

机构 * Peking University(北京大学) Microsoft Research Asia(微软亚洲研究院) Microsoft(微软) Central South University(中南大学)

专题命中 评测与基准 :language model(title,abstract)

AI总结 本文提出AesEval-Bench基准,系统评估视觉语言模型在图形设计审美评估中的性能,并构建训练数据集以提升模型在该领域的表现。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00988 2026-03-03 cs.CV cs.SE 78%

Foundation Models in Remote Sensing: Evolving from Unimodality to Multimodality

遥感中的基础模型:从单模态到多模态的演变

Danfeng Hong, Chenyu Li, Xuyang Li, Gustau Camps-Valls, Jocelyn Chanussot

机构 * School of Automation, Southeast University(自动化学院,东南大学) School of Mathematics, Southeast University(数学学院,东南大学) Aerospace Information Research Institute, Chinese Academy of Sciences(航天信息研究所,中国科学院) Image Processing Laboratory (IPL), Universitat de València(图像处理实验室(IPL),瓦伦西亚大学) Univ. Grenoble Alpes, INRIA, CNRS, Grenoble INP, LJK(格勒诺布尔阿尔卑斯大学,INRIA,CNRS,格勒诺布尔INP,LJK)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 本文探讨了遥感中基础模型从单模态到多模态的演变,旨在为研究人员提供深入理解与应用指导。

Comments Accepted by IEEE GRSM

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01775 2026-03-03 cs.CL 77%

Beyond the Resumé: A Rubric-Aware Automatic Interview System for Information Elicitation

超越简历:一种面向评分标准的自动面试系统用于信息获取

Harry Stuart, Masahiro Kaneko, Timothy Baldwin

机构 * Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出了一种基于大型语言模型的自动面试系统,用于通过评分标准校准的方式获取候选人的细致信息,以提高招聘决策质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01624 2026-03-03 cs.CY cs.AI 77%

Assessing Crime Disclosure Patterns in a Large-Scale Cybercrime Forum

评估大型网络犯罪论坛中的犯罪披露模式

Raphael Hoheisel, Tom Meurs, Jai Wientjes, Marianne Junger, Abhishta Abhishta, Masarah Paquet-Clouston

机构 * University of Twente(特文特大学) Dutch Police(荷兰警察)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究利用LLM和马尔可夫链建模分析了网络犯罪论坛中用户犯罪披露行为,揭示了大部分用户披露行为较为克制,且灰色内容较为普遍。

Comments 12 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01225 2026-03-03 cs.CL 77%

Can Thinking Models Think to Detect Hateful Memes?

思考模型能否通过思考来检测仇恨言论?

Mohamed Bayan Kmainasi, Mucahid Kutlu, Ali Ezzat Shahroor, Abul Hasnat, Firoj Alam

机构 * Qatar University(卡塔尔大学) Qatar Computing Research Institute(卡塔尔计算研究中心)

专题命中 评测与基准 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL

AI总结 本文提出基于强化学习的后训练框架,通过任务特定奖励和GRPO目标提升基于思考的多模态模型在检测仇恨言论中的推理能力,实验表明在准确性、F1值和解释质量上均有显著提升。

Journal ref In Companion Proceedings of the ACM Web Conference 2026 (WWW Companion 26), April 13-17, 2026, Dubai, United Arab Emirates

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02404 2026-03-03 cs.CL 77%

AnesSuite: A Comprehensive Benchmark and Dataset Suite for Anesthesiology Reasoning in LLMs

AnesSuite: 一个用于LLM麻醉推理的全面基准和数据集套件

Xiang Feng, Wentao Jiang, Zengmao Wang, Yong Luo, Pingbo Xu, Baosheng Yu, Hua Jin, Jing Zhang

机构 * School of Computer Science, National Engineering Research Center for Multimedia Software and Hubei Key Laboratory of Multimedia and Network Communication Engineering, Wuhan University, China(计算机学院、多媒体软件国家工程研究中心和多媒体与网络通信工程湖北省重点实验室、武汉大学) Department of Anesthesiology, Zhejiang Cancer Hospital, China(麻醉科、浙江省癌症医院) Institute of Medicine, Chinese Academy of Sciences, Hangzhou, Zhejiang, China(医学研究所、中国科学院、杭州、浙江) Lee Kong Chian School of Medicine, Nanyang Technological University, Singapore(李光耀医学院、南洋理工大学、新加坡) Centre of AI in Medicine, Nanyang Technological University, Singapore(医学人工智能中心、南洋理工大学、新加坡) Department of Anesthesiology, First People’s Hospital of Yunnan Province, China(麻醉科、云南第一人民医院) Kunming University of Science and Technology, China(昆明理工大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);SFT(abstract);分类 cs.CL

AI总结 AnesSuite为LLM麻醉推理提供首个全面基准和数据集,开发Morpheus模型在麻醉领域实现显著性能提升。

Comments Accepted in ICLR 2026; 47 pages, 12 figures, 26 tables;

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00895 2026-03-03 cs.LG 77%

Evaluating AI Grading on Real-World Handwritten College Mathematics: A Large-Scale Study Toward a Benchmark

评估AI在真实世界中的大学数学手写作业评分:迈向基准的大型研究

Zhiqi Yu, Xingping Liu, Haobin Mao, Mingshuo Liu, Long Chen, Jack Xin, Yifeng Yu

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.LG

AI总结 本文提出了一种基于OCR条件的大语言模型,用于评估真实手写数学作业的AI评分,并建立了一个标准化的基准以支持未来研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00539 2026-03-03 cs.SE cs.AI 77%

Are LLMs Reliable Code Reviewers? Systematic Overcorrection in Requirement Conformance Judgement

LLMs是否可靠代码审查员?需求符合性判断中的系统性过度纠正

Haolin Jin, Huaming Chen

机构 * University of Sydney(悉尼大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究了LLMs在需求符合性判断中的可靠性问题,发现其存在系统性过度纠正现象,并提出Fix-guided Verification Filter以提高代码审查的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08937 2026-03-03 cs.HC cs.AI cs.CY 77%

When AI Gives Advice: Evaluating AI and Human Responses to Online Advice-Seeking for Well-Being

当AI提供建议:评估AI与人类对在线寻求幸福建议的反应

Harsh Kumar, Jasmine Chahal, Yinuo Zhao, Zeling Zhang, Annika Wei, Louis Tay, Ashton Anderson

机构 * University of Toronto(多伦多大学) Harvard University(哈佛大学) Purdue University(普渡大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究评估AI与人类在在线幸福建议寻求中的表现,发现LLMs在多项指标上优于人类,且人类建议可通过打磨与AI建议竞争。

Comments CHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.03292 2026-03-03 cs.SE cs.AI cs.HC 77%

Interaction2Code: Benchmarking MLLM-based Interactive Webpage Code Generation from Interactive Prototyping

Interaction2Code: 基于MLLM的交互式网页代码生成基准测试

Jingyu Xiao, Yuxuan Wan, Yintong Huo, Zixin Wang, Xinyi Xu, Wenxuan Wang, Zhiyao Xu, Yuhang Wang, Michael R. Lyu

机构 * The Chinese University of Hong Kong, China(香港中文大学) Singapore Management University, Singapore(新加坡管理学院) Renmin University of China, China(中国人民大学) Tsinghua University, China(清华大学) Southwest University, China(西南大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI

AI总结 Interaction2Code提出首个基于MLLM的交互式网页代码生成基准测试,识别MLLM在交互生成中的四个限制并提出四种增强策略。

Comments Published in the Proceedings of the 40th IEEE/ACM International Conference on Automated Software Engineering (ASE 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01814 2026-03-03 cs.SE 75%

Architecture-Aware Multi-Design Generation for Repository-Level Feature Addition

面向架构的多设计生成用于仓库级特性添加

Mingwei Liu, Zhenxi Chen, Zheng Pei, Zihao Wang, Yanlin Wang, Zibin Zheng

专题命中 评测与基准 :large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 RAIM通过多设计生成和架构感知机制,提升仓库级特性添加的准确性和稳定性。

Comments 18 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01285 2026-03-03 cs.LG cs.AI cs.CL 75%

Attention Smoothing Is All You Need For Unlearning

注意力平滑是删除学习的全部需求

Saleh Zare Zade, Xiangyu Zhou, Sijia Liu, Dongxiao Zhu

机构 * Department of Computer Science, Wayne State University(韦恩州立大学计算机科学系) Department of Computer Science and Engineering, Michigan State University(密歇根州立大学计算机科学与工程系) Institute for AI and Data Science, Wayne State University(韦恩州立大学人工智能与数据科学研究所)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ASU通过注意力平滑技术有效删除学习,减少记忆内容的同时保持响应连贯性,优于现有方法。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01051 2026-03-03 hep-ex cs.SE 75%

CelloAI Benchmarks: Toward Repeatable Evaluation of AI Assistants

CelloAI Benchmarks: 向AI助手评估的可重复性迈进

Mohammad Atif, Kriti Chopra, Fang-Ying Tsai, Ozgur O. Kilic, Tianle Wang, Zhihua Dong, Douglas Benjamin, Charles Leggett, Meifeng Lin, Paolo Calafiura, Salman Habib

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 CelloAI Benchmarks提出了一套针对高能物理和高性能计算领域AI助手的可重复性评估基准,涵盖代码文档、代码生成和图形数据分析三个评估赛道,旨在提升科学编码辅助的可靠性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00468 2026-03-03 cs.SE 75%

Cloud-OpsBench: A Reproducible Benchmark for Agentic Root Cause Analysis in Cloud Systems

Cloud-OpsBench: 一种可重现的云系统代理根本原因分析基准

Yilun Wang, Guangba Yu, Haiyu Huang, Zirui Wang, Yujie Huang, Pengfei Chen, Michael R. Lyu

专题命中 评测与基准 :language model(abstract);small language model(abstract);SFT(abstract)

AI总结 Cloud-OpsBench 是一个用于云系统代理根本原因分析的可重现基准,通过构建确定性数字孪生,提供数据引擎、强化学习环境和诊断标准,支持下一代SRE研究。

Comments 22 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02119 2026-03-03 cs.AI cs.GT cs.LG 73%

Pencil Puzzle Bench: A Benchmark for Multi-Step Verifiable Reasoning

笔算谜题基准:多步骤可验证推理的基准

Justin Waugh

机构 * Approximate Labs

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 Pencil Puzzle Bench通过笔算谜题评估大语言模型的多步骤可验证推理能力,揭示推理努力和代理迭代能力的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22373 2026-03-03 cs.CL cs.AI cs.CV 73%

VisJudge-Bench: Aesthetics and Quality Assessment of Visualizations

VisJudge-Bench: 可视化美学与质量评估

Yupeng Xie, Zhiyang Zhang, Yifan Wu, Sirong Lu, Jiayi Zhang, Zhaoyang Yu, Jinlin Wang, Sirui Hong, Bang Liu, Chenglin Wu, Yuyu Luo

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) DeepWisdom(深智科技) Université de Montréal & Mila(蒙特利尔大学及Mila)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 VisJudge-Bench提出首个可视化质量评估基准,通过VisJudge模型显著提升对可视化美学和质量的判断精度。

Comments 62 pages, 27 figures, 8 tables. Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16241 2026-03-03 cs.CL cs.AI 73%

Are LLMs Ready to Replace Bangla Annotators?

大型语言模型是否准备好取代孟加拉语标注者?

Md. Najib Hasan, Touseef Hasan, Souvika Sarkar

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究探讨了大型语言模型在孟加拉语仇恨言论标注任务中的表现,发现模型规模并非决定标注质量的唯一因素,且存在显著的标注偏差和不稳定性。

Comments We have identified significant methodological discrepancies in the current version of the manuscript that affect the validity and reproducibility of the reported results. In order to prevent potential misunderstanding or misinterpretation of our findings, we request the complete withdrawal of this submission while we conduct a thorough revision

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02253 2026-03-03 cs.CV cs.AI cs.LG 73%

DragFlow: Unleashing DiT Priors with Region Based Supervision for Drag Editing

DragFlow: 通过基于区域的监督释放DiT先验以实现拖拽编辑

Zihan Zhou, Shilin Lu, Shuli Leng, Shaocong Zhang, Zhuming Lian, Xinlei Yu, Adams Wai-Kin Kong

机构 * Nanyang Technological University(南洋理工大学) National University of Singapore(国立新加坡大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 DragFlow通过基于区域的监督利用FLUX先验,改进基于拖拽的图像编辑效果,实现对点式和区域式基线的超越。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00055 2026-03-03 cs.LG cs.AI 73%

M3-AD: Reflection-aware Multi-modal, Multi-category, and Multi-dimensional Benchmark and Framework for Industrial Anomaly Detection

M3-AD:面向工业异常检测的反思-aware 多模态、多类别和多维基准与框架

Chao Huang, Yanhui Li, Yunkang Cao, Wei Wang, Hongxi Huang, Jie Wen, Wenqi Ren, Xiaochun Cao

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Hunan University(湖南大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 M3-AD提出了一种反思-aware 的多模态框架,通过RA-Monitor提升工业异常检测的鲁棒性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01724 2026-03-03 cs.AI 70%

GMP: A Benchmark for Content Moderation under Co-occurring Violations and Dynamic Rules

GMP:在同时发生违规和动态规则下的内容审查基准

Houde Dong, Yifei She, Kai Ye, Liangcai Su, Chenxiong Qian, Jie Hao

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) The University of Hong Kong(香港大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 GMP提出一个基准,用于评估AI在同时发生违规和动态规则下的内容审查能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01654 2026-03-03 cs.AI 70%

CeProAgents: A Hierarchical Agents System for Automated Chemical Process Development

CeProAgents:一种用于自动化化学过程开发的分层智能体系统

Yuhang Yang, Ruikang Li, Jifei Ma, Kai Zhang, Qi Liu, Jianyu Han, Yonggan Bu, Jibin Zhou, Defu Lian, Xin Li, Enhong Chen

机构 * Dalian Institute of Chemical Physics, Chinese Academy of Sciences(大连化学物理研究所,中国科学院) State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 CeProAgents通过分层多智能体系统实现化学过程开发的自动化,结合动态聊天组与结构化工作流,提出多维基准评估方法,验证了其在化工工程中的有效性与局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01554 2026-03-03 cs.AI 70%

S5-HES Agent: Society 5.0-driven Agentic Framework to Democratize Smart Home Environment Simulation

S5-HES代理:面向社会5.0的代理框架,以民主化智能家庭环境模拟

Akila Siriweera, Janani Rangila, Keitaro Naruse, Incheon Paik, Isuru Jayanada

机构 * The University of Aizu(立命馆大学) The KD University(KD大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 S5-HES代理通过自主AI编排,实现无需编程的智能家庭模拟,满足社会5.0的多样化研究需求。

Comments 12 pages, 9 figures, and Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06823 2026-03-03 cs.CR cs.CL cs.IR 70%

Exposing Citation Vulnerabilities in Generative Engines

揭示生成引擎中的引用漏洞

Riku Mochizuki, Shusuke Komatsu, Souta Noguchi, Kazuto Ataka

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文研究生成引擎中引用来源的投毒风险,通过分析引用来源的出版属性评估内容注入障碍,发现美国政治答案比日本更易受投毒攻击。

Comments 12 pages, under-reviewing at a conference

详情

展开后加载摘要…

URL PDF HTML 收藏