arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 2940 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2940 篇

2608.13598 2026-08-17 cs.AI 新提交 79%

Measuring Cross-Task Behavioral Consistency in Language Model Agents

测量语言模型智能体的跨任务行为一致性

Amritesh Banerjee, Pranil Raichura

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Mantis AI Research(螳螂人工智能研究院)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 本文提出行为一致性指标(BCM),通过约9000条软件工程任务轨迹发现语言模型智能体的跨任务与任务内一致性是可分化的不同维度,且一致性与成功率无关,BCM可补充结果指标评估智能体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13173 2026-08-14 cs.AI 新提交 79%

SkillShapley: Boundary-Adaptive Shapley Valuation for Skill Step Attribution in LLM Agents

SkillShapley:面向大语言模型智能体技能步骤归因的边界自适应夏普利值评估方法

Chang Liu, Yuqi Zhang, Yiman Zhong, Boyi Liu, Hengjun Wang, Shuyue Wei

机构 * Beihang University(北京航空航天大学) Shandong University(山东大学)

专题命中 评测与基准 :LLM(title);language agent(abstract);分类 cs.AI

AI总结 SkillShapley是面向大语言模型智能体技能步骤归因的框架,将技能步骤归因建模为夏普利值估计问题,经SkillsBench实验可高效识别技能步骤价值,为智能体技能构建提供启示。

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11534 2026-08-13 cs.CL cs.CV 新提交 79%

CT-$Δ$Bench: A Benchmark for Longitudinal 3D Medical Imaging Difference Reporting with Vision-Language Models

CT-ΔBench:基于视觉语言模型的纵向3D医学影像差异报告基准

Kegeng Tang, Jingbo Wang, Shaogang Ren, Zihao Wang

机构 * University of Tennessee at Chattanooga(田纳西大学查塔努加分校)

专题命中 评测与基准 :language model(title);foundation model(abstract);分类 cs.CL

AI总结 本文针对现有医学基础模型缺乏纵向影像差异处理能力的问题,构建了专用基准CT-ΔBench,开发感知变化指标与医师验证流程,对比不同推理方式并提出基线模型DeltaMed,为时间感知医学基础模型奠定基础。

Comments Accepted by COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10729 2026-08-12 eess.SY cs.AI cs.SY 新提交 79%

Optimal Stopping of Self-Refining Foundation Models

自优化基础模型的最优停止

Kim Hammar, Tansu Alpcan, Emil C. Lupu

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI

AI总结 本文将基础模型的自优化过程形式化为最优停止问题,推导可高效计算的最优停止策略,实验表明该策略在编码基准上比现有方法成本效益更高。

Comments Accepted at 65th IEEE Conference on Decision and Control (CDC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10471 2026-08-12 cs.AI 新提交 79%

RLMOpt: Adaptive Prompt Optimization via Recursive Language Models

RLMOpt:基于递归语言模型的自适应提示优化器

Subhash Bangalore Satheesha, Nirvik Pande, Deepthi Duddempudi, Bharath Dandala

机构 * Autonomize AI Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 本研究提出基于递归语言模型(RLM)的自适应提示优化器RLMOpt,在四个基准上相比GEPA表现更优,效率更高且提示更小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10408 2026-08-12 cs.CL 新提交 79%

VisEditBench: Can Vision-Language Models Edit Visualization Code from Multimodal Feedback?

VisEditBench:视觉语言模型能否基于多模态反馈编辑可视化代码?

Mizanur Rahman, Arshia Azimlu, Shadikur Rahman, Md Tahmid Rahman Laskar, Amran Bhuiyan, Shafiq Joty, Enamul Hoque Prince

机构 * York University(约克大学) Nanyang Technological University(南洋理工大学) Salesforce AI Research(Salesforce人工智能研究)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

AI总结 本研究推出可视化代码编辑基准VisEditBench,评估20种VLMs的编辑能力,提出基于渲染的VisEditAgent框架,显著提升了编辑任务的通过率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09853 2026-08-11 cs.RO cs.CV cs.LG 新提交 79%

RynnValue: Scaling Robotic Value Foundation Models with Temporal Distance

RynnValue:基于时间距离扩展机器人价值基础模型

Dongchi Huang, Hongyin Zhang, Bohan Hou, Siteng Huang, Zhian Su, Hang Guo, Tong Lu, Zhaofeng Xu, Jiahao Tang, Jianfei Yang, Donglin Wang, Peixi Peng, Mingxiu Chen, Deli Zhao, Xin Li

机构 * DAMO Academy, Alibaba Group(达摩院(阿里巴巴集团)) Hupan Lab(湖畔实验室)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 该研究提出开源机器人价值基础模型 RynnValue,以时间距离为监督目标,在多维度超越现有方法,可提升机器人策略的真实世界任务成功率并实现零样本泛化。

Comments 23 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08654 2026-08-11 cs.AI 新提交 79%

The Scaffolding Matters More Than the Interface: A Controlled Comparison of MCP and CLI Tool Use Across Seven Agent Scaffoldings, Five Language Models, and One Software Task

脚手架比接口更重要:在七种智能体脚手架、五种语言模型和一项软件任务中对MCP与CLI工具使用的对照比较

Marc Alier Forment, María José Casañ Guerrero, Francisco José García-Peñalvo, Juanan Pereira

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 该研究通过对照实验发现,智能体脚手架对AI编码智能体的工具使用成本影响远大于接口,MCP并非必要,且智能体常忽略分配的接口,相关数据已开源。

Comments 29 pages, 4 figures, 8 tables. Companion methodology paper: arXiv:2606.11869. Dataset and measurement harness (open source, GPL-3.0): https://doi.org/10.5281/zenodo.21851992

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08244 2026-08-11 cs.AI 新提交 79%

FemWear: A Specialized Wearable Foundation Model for Women's Health

FemWear:面向女性健康的专用可穿戴设备基础模型

Yifan Wang, Chenzhong Li

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI

AI总结 本文提出面向女性健康的专用可穿戴基础模型FemWear,通过参数高效方式改造预训练主干,在女性健康相关指标上取得性能提升,但未确立普遍优势与临床有效性。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07617 2026-08-11 cs.AI 新提交 79%

TeXFix-Bench: An Empirically Grounded Multi-Format Benchmark for LLM-Based Document Source Repair

TeXFix-Bench:面向基于大语言模型的文档源代码修复的经验驱动多格式基准

Prajwal S. Venkateshmurthy

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 该研究构建了基于经验故障分类法的多格式文档修复基准TeXFix-Bench,通过实验发现仅编译成功率会高估修复质量,Typst修复难度高于LaTeX和Markdown,并发布了相关分类法与工具。

Comments 9 pages, 4 figures, 9 tables. Artifacts: https://doi.org/10.5281/zenodo.21831797

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07006 2026-08-10 cs.CL cs.CV 新提交 79%

Does More Retrieved Evidence Help Visual Retrieval-Augmented Generation with Diffusion Language Models?

更多检索到的证据是否有助于基于扩散语言模型的视觉检索增强生成?

Jiankun Wang, Yisen Gao, Ziwei Zhang, Xingcheng Fu, Jiaxin Bai, Chen Gao

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

AI总结 针对基于扩散语言模型的视觉检索增强生成,研究发现无条件扩大检索证据会因语义冲突降低准确率,提出无需训练的基于熵的候选过滤框架,可平均提升答案准确率2.62个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06967 2026-08-10 cs.CL 新提交 79%

Can Language Models Imagine Without Seeing? Ekphrasis: Measuring Visual Creative Ideation in Text-Only LLMs

语言模型无需视觉输入即可进行想象?Ekphrasis:测量仅文本大型语言模型的视觉创意构想能力

Hongyu Luo, He Wang, Huihao Jing, Hong Ting Tsang, Yuxuan Liu, Wuganjing Song, Yauwai Yim, Chunyang Li, Yangqiu Song

机构 * The Hong Kong University of Science and Technology(香港科技大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

AI总结 本研究推出基准Ekphrasis,测量仅文本大型语言模型的视觉创意构想能力,发现该能力与流畅度分离,且其排序可跨模态稳定存在。

Comments 25 pages, 4 main figures, with appendices. Code and data: https://github.com/Imhongyu/Ekphrasis

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06663 2026-08-10 cs.CL 新提交 79%

The Horizon Gap: Planning, Memory, Execution, Training, and Evaluation for Long-Horizon LLM Agents

视界差距:长视界大语言模型智能体的规划、记忆、执行、训练与评估

Mingguang Chen, Licheng Wang, Bo Qu

机构 * DeepGrounding(深地研究机构) AlphaAvatar(阿尔法 Avatar 公司)

专题命中 评测与基准 :LLM(title);language model(abstract);分类 cs.CL

AI总结 本文提出长视界大语言模型智能体存在的视界差距,调研1547篇相关论文,厘清长视界等属性,分析领域应对措施并提出开放测量问题。

Comments 39 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06361 2026-08-07 cs.AI 新提交 79%

The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping

低频陷阱:视频语言模型在简单事件记录上的失败

Sarvesh Baskar, Zikui Cai, Shayan Shabihi, Anirudh Satheesh, Muhammad R. Islam, Udari Madhushani Sehwag, Tom Goldstein, Furong Huang

专题命中 评测与基准 :language model(title);prompting(abstract);分类 cs.AI

AI总结 该研究提出基于轨迹的参数化分析方法,发现视频语言模型Gemini 3.6 Flash在高数量、高频率事件计数上表现极差,额外帧和提示策略难以解决问题,推动视频评估转向时间推理故障诊断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04975 2026-08-06 cs.SE cs.AI 新提交 79%

SciCode-Verified: How Benchmark Defects Underestimated the Scientific-Coding Ability of Language Models

SciCode-Verified:基准缺陷如何低估了语言模型的科学编码能力

Sihan Hu, Lyuhan Huang, Youjin Deng, Kun Chen

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 该研究发现SciCode基准存在大量缺陷,导致语言模型科学编码能力被低估,修正后重新评估显示模型准确率大幅提升,瓶颈在于评估工具而非模型能力。

Comments 47 pages, 2 figures, 6 tables. Project repository: https://github.com/flyingwagner/scicode-verified

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04792 2026-08-06 cs.LG 新提交 79%

Above-ground Biomass Estimation with Geospatial Foundation Models

基于地理空间基础模型的地上生物量估算

Ghjulia Sialellia, Linus Scheibenreif, Jan Dirk Wegner, Konrad Schindler

机构 * ETHZ(苏黎世联邦理工学院)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 本文构建地理空间基础模型用于全球地上生物量估算的综合基准,发现预计算嵌入产品表现优异,基于AlphaEarth Foundations嵌入训练的模型性能优于当前最优的监督模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00608 2026-08-04 cs.LG 新提交 79%

From field-scale to large-scale spectral libraries: Tabular foundation models in soil spectroscopy

从田间尺度到大规模光谱库:土壤光谱学中的表格基础模型

Viacheslav Barkov, Jonas Schmidinger, Robin Gebbers, Martin Atzmueller

机构 * Osnabrück University(奥斯纳布吕克大学) Leibniz Institute for Agricultural Engineering and Bioeconomy (ATB)(莱布尼茨农业工程与生物经济研究所) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 该研究针对土壤光谱预测难题,对比多种模型与降维方法,发现结合偏最小二乘潜在变量的表格基础模型TabPFN在田间及大规模光谱库任务中表现最优,为光谱校准模型选择提供了循证指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29445 2026-08-03 cs.CV cs.AI 新提交 79%

QR-Structured Thermal Triggers for Targeted Semantic Attacks on Infrared Vision-Language Models

用于红外视觉语言模型定向语义攻击的QR结构化热触发装置

Xiang Chen, Yingying Zhao, Chao Li, Jiaju Han, Ben Zhang, Ang Li, Jiahuan Long, Yiwei Wei, Jiujiang Guo, Chengyin Hu

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 本研究提出QR-STT框架,作为隐蔽黑盒攻击手段,可定向操控IR-VLMs的语义对齐,其扰动还能跨任务迁移,凸显了对该类攻击进行鲁棒性评估的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28007 2026-07-31 cs.CV cs.AI 新提交 79%

Beyond Classification: Pathology Foundation Models as Detection Encoders for Mitotic Figures

超越分类:病理学基础模型作为有丝分裂图的检测编码器

Sweta Banerjee, Alireza Teimoury, Nils Porsche, Alexandra K. Stoll, Viktoria Weiss, Niklas Hargarter, Jonas Ammeling, Thomas Conrad, Christoph Stroblberger, Christopher Kaltnecker, Robert Klopfleisch, Christof A. Bertram, Katharina Breininger, Marc Aubreville

机构 * Flensburg University of Applied Sciences(弗伦斯堡应用科学大学) University of Veterinary Medicine, Vienna(维也纳兽医大学) Freie Universität Berlin(柏林自由大学) Technische Hochschule Ingolstadt(英戈尔施塔特应用技术大学) Medical University of Vienna(维也纳医科大学) Julius-Maximilians-Universität Würzburg(维尔zburg大学) Friedrich-Alexander-Universität Erlangen-Nürnberg(埃尔朗根-纽伦堡弗里德里希-亚历山大大学)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI

AI总结 本研究将多种病理学基础模型作为骨干网络,结合不同类型检测器在MIDOG++和TUPAC16数据集上验证其用于有丝分裂图检测的性能,发现H-optimus-0和Virchow模型表现具竞争力,相关代码已公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25814 2026-07-29 cs.CL cs.CR 新提交 79%

Evaluation of Adversarial Robustness in Arabic Language Models

阿拉伯语语言模型中的对抗鲁棒性评估

Anwar Alajmi, Ayed Salman, Imtiaz Ahmad

机构 * Kuwait University(科威特大学) College of Business Studies, Public Authority of Applied Education and Training(应用教育与培训公共管理局商业研究学院)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

AI总结 研究评估五个先进阿拉伯语语言模型在不同攻击下的鲁棒性,探索对抗训练防御技术,发现不同攻击对模型准确率影响各异,对抗训练提升了整体弹性,但面对字符级噪声仍有挑战,凸显了当前防御策略在阿拉伯语中的潜力与局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24810 2026-07-29 cs.AI eess.IV 新提交 79%

RRS-10K: A Multitask Vision-Language Model Benchmark for Rare Remote Sensing Image Interpretation

RRS-10K:用于罕见遥感图像解释的多任务视觉语言模型基准测试

Yuqiao Lai, Jiancheng Qi, Fei Wang, Yuxin Liu, Kun Li, Ye Chen, Yan Gao, Yanyan Wei

机构 * Laboratory of Intelligent Language Processing, National University of Defense Technology(国防科技大学智能语言处理实验室) Hefei University of Technology(合肥工业大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院) United Arab Emirates University(阿联酋大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 针对视觉语言模型在罕见遥感图像解释能力不足的问题,提出RRS-10K基准测试,含军事遥感图像及问答对,构建时引入干扰项过滤策略,评估多个模型,揭示其性能弱点,为开发更可靠的遥感视觉语言模型提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24763 2026-07-29 cs.AI 新提交 79%

CaRE Compute-aware Remasking Evaluation Protocol for Masked Diffusion Language Models

用于掩码扩散语言模型的计算感知重掩码评估协议

Yash Shah, Abhijit Chakraborty, Vivek Gupta

机构 * Arizona State University(亚利桑那州立大学) MongoDB(MongoDB公司)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 研究针对掩码扩散语言模型评估标准不完善的问题,提出计算感知评估框架CaRE,通过标准化函数评估实际数量等方法审核重掩码策略,应用于多种模型和数据集,揭示了温度、计算匹配等因素对评估的影响,发布相关内容确保评估可重复可比。

Comments updated version

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24707 2026-07-28 cs.AI cs.CV cs.DB 新提交 79%

ERUnderstand: Evaluating Vision-Language Models on Structured ER Diagrams

ERUnderstand:在结构化实体关系图上评估视觉语言模型

Ali Ansari, Yasmin Mohammadi, Farnoush Nili, Parsa Esmaeilkhani, Longin Jan Latecki, Eduard Dragut

机构 * Temple University(天普大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 研究针对实体关系图仅为图像限制AI辅助数据库工程的问题,引入ERUnderstand基准测试。通过对2960个图表及标准化表示评估视觉语言模型,发现常见元素恢复良好,但特定元素性能差,推理增强模型可提升性能,为评估多模态理解提供基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22658 2026-07-28 cs.AI cs.SD eess.AS 新提交 79%

StanceBench: A Benchmark for Audio LLM-Based Interpersonal Stance Evaluation from Speech

StanceBench:一个基于音频大语言模型的语音人际立场评估基准

Yuzhe Wang, Thomas Thebaud, Jennifer Hu, Jesús Villalba-Lopez, Venkatesh Ravichandran, Georgi Tinchev, Najim Dehak, Laureano Moro-Velázquez

机构 * Johns Hopkins University(约翰斯·霍普金斯大学) Amazon AGI(亚马逊通用人工智能公司) Amazon Research(亚马逊研究院)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 研究基于音频大语言模型的语音人际立场评估,引入StanceBench基准,通过Seamless Interaction语料库规范评估,明确9个立场维度,报告大语言模型评判的多项指标,指出不同立场的判断难易及特点。

Comments Accepted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22600 2026-07-28 cs.AI 新提交 79%

Chart Deception in Vision-Language Models: From Vulnerability to Mitigation

视觉语言模型中的图表欺骗:从漏洞到缓解

Ridwan Mahbub, Mohammed Saidul Islam, Md Tahmid Rahman Laskar, Mizanur Rahman, Mir Tafseer Nayeem, Enamul Hoque

机构 * York University(约克大学) University of Alberta(阿尔伯塔大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 研究视觉语言模型对图表欺骗的鲁棒性,引入VisDeception基准和欺骗分数,发现模型易受影响,提出推理时多智能体缓解框架,揭示可靠性差距,确立相关评估及推理方向以开发更可信的视觉分析VLM。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22520 2026-07-27 cs.AI 新提交 79%

The Regression Tax: Decomposing Why Skills Help and Hurt LLM Agents

回归税:剖析技能对大语言模型智能体产生帮助和伤害的原因

Darshan Tank, Baran Nama

机构 * Sentient Labs(森蒂恩实验室)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 研究剖析大语言模型智能体中技能产生帮助和伤害的原因,通过对比实验区分回归和残余失败两种结果,识别出回归的三个原因,发现现有技能过度强调程序指导,指出应分解技能净效应评估,还识别出应避免的回归模式及可靠性的关键因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22264 2026-07-27 cs.LG 新提交 79%

Autoregressive EHR Foundation Models with Multimodal Inputs

具有多模态输入的自回归电子健康记录基础模型

Yuxuan Liu, Joshua Placidi, Jinpei Han, Alfred John Balston, Marek Rei, A. Aldo Faisal

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 研究在自回归电子健康记录基础模型中纳入多模态的方法,通过特定模态潜在压缩和门控交叉注意力框架,研究压缩单模态序列及预训练编码器选择对性能的影响,实验表明精心设计架构及临床评估的必要性。

Comments 5 pages excluding references and supplements, 2 figures and 2 tables, Proceedings of the Workshop on Structured Data for Health at the 43rd International Conference on Machine Learning, Seoul, South Korea

Journal ref ICML2026 workshop on Structured Data for Health (SD4H)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19383 2026-07-23 stat.AP cs.LG 新提交 79%

Trend strength predicts when generative foundation models win: a power-controlled benchmark, a mechanism, and an actionable selection rule

趋势强度预测生成式基础模型何时获胜:功率控制基准、机制及可操作的选择规则

Ahmed Cherif

机构 * National School of Computer Sciences (ENSI), University of Manouba, Manouba, Tunisia(突尼斯曼努巴大学计算机科学国家学院)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 研究预训练生成式基础模型,通过功率控制研究、受控合成实验等得出结果,表明其优势与趋势强度有关,趋势强度可作为先验指标指导基础模型部署,还记录了校准不足。

Comments 12 pages, 6 figures. Code and per-forecast data released

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20194 2026-07-23 cs.LG 新提交 79%

OLEDLM: A Unified Language Model for OLED Molecular Design

OLEDLM:用于OLED分子设计的统一语言模型

Fukang Wen, Yuchong Tang, Jingyuan Li, Beichen Wang, Yixuan Jiang, Xiaoyi Jiang, Yaxuan Liu, Shunyu Wang, Zuoqiang Shi, Yi Zhu, Yanan Zhu, Pipi Hu

机构 * Tsinghua University(清华大学) Beijing Institute of Mathematical Sciences and Applications(北京应用数学科学研究院) Wuhan University(武汉大学) Shenzhen MSU-BIT University(深圳莫斯科国立大学与北京理工大学联合大学) MathonAI Team(MathonAI团队)

专题命中 评测与基准 :language model(title,abstract);分类 cs.LG

AI总结 研究针对OLED分子设计面临的挑战,提出基于因果语言模型的逆分子设计框架,采用多阶段策略,经基础模型建立、属性预测器微调、强化学习等,最终能有效探索OLED化学空间,生成新候选物。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19400 2026-07-23 cs.LG q-bio.GN 新提交 79%

Predictive single cell foundation model for gene regulation and aging with privacy-preserving tabular learning

用于基因调控和衰老的具有隐私保护表格学习的预测性单细胞基础模型

Jiayuan Ding, Jianhui Lin, Ziyang Miao, Nils Mechtel, Shiyu Jiang, Yixin Wang, Zhaoyu Fang, Jorge D. Martin-Rufino, Chen Weng, Reuben Saunders, Weize Xu, Jonathan S. Weissman, Min Li, Jiliang Tang, Wei Ouyang, Yuancheng Ryan Lu, Xiaojie Qiu

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 研究针对单细胞数据独特表格结构及隐私问题,提出用联邦学习设计的Tabula模型,开发Chiron平台。该模型在下游基准测试表现出色,揭示调控逻辑,提名年轻化因子,推动单细胞基础建模发展,迈向隐私保护虚拟细胞。

Comments 98 pages, 4 main figures, and 15 supplementary figures

详情

展开后加载摘要…

URL PDF HTML 收藏