arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-18 至 2026-08-18 共收录 633 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 157 篇

2608.10528 2026-08-18 cs.IR cs.LG 版本更新 87%

When Do Anchor-Based Pointwise LLM Rerankers Help? Retriever Quality, Statistical Scope, and Anchor Design

基于锚点的点式大语言模型重排序器何时有用?检索器质量、统计范围与锚点设计

Utshab Kumar Ghosh, Shubham Chatterjee

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.LG

AI总结 该研究以GCCP/PAGC为对象,复现并分析锚点式点式LLM重排序器,发现其增益源于对比打分,适用条件较窄,锚点构建可简化,检索器强度影响其效果。

Comments To be published in the 35th ACM International Conference on Information and Knowledge Management (CIKM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09041 2026-08-18 cs.CL cs.CR 版本更新 87%

BiAxisBias: Evaluating LLM Bias Beyond a Single Prompt and a Single Explanation

BiAxisAudit:一种评估大语言模型偏见的新框架,跨提示敏感性和响应层分歧

Jialing Gan, Junhao Dong, Songze Li

机构 * Southeast University, China(东南大学) Nanyang Technological University, Singapore(南洋理工大学)

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.CL

AI总结 本文提出BiAxisAudit框架,通过双轴评估方法揭示LLM偏见的跨提示敏感性和响应层分歧,解决单一指标无法捕捉的偏见问题。

Comments 19 pages, 6 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10875 2026-08-18 cs.CL cs.AI 版本更新 87%

VibeLifeBench: Can Your Life Agent Be Proactive and Persistent in a Living World?

VibeLifeBench:你的生命智能体能在真实生活环境中保持主动与持续性吗?

Xiaohongshu Dots Studio, Evolvent AI

机构 * Xiaohongshu Dots Studio(小红书Dots工作室) Evolvent AI(Evolvent AI公司)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出VibeLifeBench基准,评估7个前沿LLM智能体在200项长周期日常生活任务中的表现,发现其主动与持续性不足,将开源相关任务、环境与评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05408 2026-08-18 cs.IR 版本更新 87%

Rich-Media Re-Ranker: A User Satisfaction-Driven LLM Re-ranking Framework for Rich-Media Search

多介质重排序:一种基于用户满意度的LLM重排序框架用于多介质搜索

Zihao Guo, Ligang Zhou, Zeyang Tang, Feicheng Li, Ying Nie, Zhiming Peng, Qingyun Sun, Jianxin Li

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 本文提出Rich-Media Re-Ranker框架,通过多维细粒度建模提升用户搜索满意度,整合丰富侧信息和视觉信号,通过多任务强化学习增强系统适应性,实验证明其优于现有方法。

Comments Accepted by the Full Research Track of CIKM-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16508 2026-08-18 cs.CR cs.LG cs.NI 新提交 86%

LLMs for Zero-Shot Threat Detection via Structured Risk Indicators

基于结构化风险指标的零样本威胁检测大语言模型

Abdullah Alghamdi, Siamak Layeghy, Marius Portmann

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出两阶段LLM框架,结合RAG从异构安全日志零样本检测内部威胁与APT,在两个基准数据集上优于现有模型,风险指标质量是性能关键驱动因素

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16286 2026-08-18 cs.CL 新提交 86%

Clause Encounters of the Third Kind: Can LLMs Replace Language Teachers?

条款式的第三类接触:大型语言模型能否替代语言教师?

Kristina Šekrst, Ana Kovačić

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究评估了LLM替代语言教师提供教学反馈与解释的能力,发现其纠错能力出色但教学解释不足,AI辅助语言学习热情或超出对其教学能力的认知。

Journal ref Oxford Intersections: AI in Society (Oxford, online edn, Oxford Academic, 20 Mar. 2025 - )

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16196 2026-08-18 cs.AI cs.HC 新提交 86%

Beyond Asking: A Pipeline for Personalized Game Generation that Reads Players from Behavior

超越询问:一种从玩家行为读取数据的个性化游戏生成流水线

Yifan Lu, Xiaopeng Yuan, Haohan Wang

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究构建了带真实特质的合成玩家基准,提出机会感知决策时刻表示,对比了LLM等方法的推断效果,将推断画像用于游戏难度自适应并开展人类研究验证。

Comments 16 pages, 3 figures, 6 tables. Includes technical appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15055 2026-08-18 cs.AI 新提交 86%

TAHB: A Comprehensive Benchmark for Text-Attributed Hypergraph Learning

TAHB:面向文本属性超图学习的综合基准

David Yoon Suk Kang, JungHyun Kim, Juhyun Jeon, Sang-Wook Kim

机构 * Chungbuk National University(忠北国立大学) Hanyang University(汉阳大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究提出首个整合超图结构与文本属性的公开基准TAHB,含10个跨领域数据集,证实LLM增强文本语义可提升超图学习性能,为交叉领域研究提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15012 2026-08-18 cs.CR cs.AI cs.MA 新提交 86%

SysEvolve: An AI-native, safe, autonomous adversarial attack-defense co-evolutionary system

SysEvolve:一种原生AI、安全且自主的对抗攻防协同进化系统

Yuhan Meng, Shaofei Li, Jionghao Huang, Jiandong Jin, Puyi Wang, Hanlin Jiang, Anis Yusof, Peng Jiang, Zhenkai Liang, Yao Guo, Ding Li

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究针对网络安全攻防不对称问题,提出SysEvolve协同进化系统,含三个组件,实验验证其攻防性能,还揭示了LLM智能体能力的三项关键发现。

Comments Technical Report For SysEvolve System

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15654 2026-08-18 cs.CL cs.AI 新提交 86%

When Stories Evolve: Benchmarking LLM Storytelling Across Agent Architectures in Open-Ended World Simulations

当故事演变时:在开放世界模拟中针对智能体架构对大语言模型故事讲述能力进行基准测试

Yuqi Chen, Sixuan Li, Yunfeng Cai, Xueai Li, Ka Man Yan, Ying Li

机构 * The University of Hong Kong(香港大学) Peking University(北京大学) Tsinghua University(清华大学) Beijing Institute of Mathematical Sciences and Applications (BIMSA)(北京数学科学与应用研究院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究推出WSE-bench基准,评估开放世界模拟中不同智能体架构的大语言模型故事讲述的持续生成、规范一致性和有意义发展,发现三者存在竞争关系,模型规模仅提升持续生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21116 2026-08-18 cs.HC cs.AI cs.CL 86%

Creativity in LLM-based Multi-Agent Systems: A Survey

Yi-Cheng Lin, Kang-Chieh Chen, Zhe-Yan Li, Tzu-Heng Wu, Tzu-Hsuan Wu, Kuan-Yu Chen, Hung-yi Lee, Yun-Nung Chen

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 23 pages

Journal ref Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing (EMNLP 2025), pages 27572-27595

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16022 2026-08-18 cs.SE 新提交 86%

OpenHarmony Bench: Evaluating LLMs and Coding Agents on OpenHarmony App Development

OpenHarmony Bench:评估LLM与编码智能体在OpenHarmony应用开发中的表现

Li Li, Han Hu, Tianjian Zhang, Xin Peng, Fangzhu Mao, Qingyu Zhang, Xiaoheng Xie, Zhongmin Tang, Zhihao Lin, Haolin Ruan, Miaomiao Dong, Liuchuan Zhu, Yue Li, Chi Chen, Wenkang Zhong, Mingfei Zhang, Yang Yu, Bo Sun, Chaorui Zhang, Weixi Zhang, Wei Han, Bo Bai, Kui Liu, Gang Fan, Siru Liu, Jiaqian Zhou, Jiali Sun, Yunbiao Dong, Wenhao Zhong, Yunhong Xu

专题命中 评测与基准 :LLM(title_cn,summary_cn)

AI总结 该研究推出OPENHARMONY BENCH应用级编码基准,评估8个LLM驱动的DevEco Code在三类OpenHarmony ArkTS应用任务中的表现,发现新一代模型任务完成率更高、构建性接近饱和但行为正确性不足、spec驱动任务完成率最低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15928 2026-08-18 cond-mat.mtrl-sci 新提交 86%

Synthesizing like a chemist: an iterative, feedback-driven loop for materials discovery

像化学家一样合成:用于材料发现的迭代式反馈驱动循环

Fang Sheng, Steven B. Torrisi, Amanda Volk, Kevin Tran, Koki Nakano, Brian W. Anthony, Tonio Buonassisi

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 该研究提出一种结合LLM、高光谱成像与多目标贝叶斯优化的闭环框架,可自动化材料合成工作流程,在配对优化中表现优于基线方法,还成功合成了未报道的钙钛矿型化合物Rb3BiI6薄膜。

Comments 38 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15504 2026-08-18 cs.HC 版本更新 86%

Game-Master LLMs for Task-Based Role-Play: Supporting the Acquisition of Idiomatic Language in L2 Learning

游戏大师LLM:基于任务的角色扮演促进自然俚语学习

Amir Tahmasbi, Milad Esrafilian, Judson Wright, Sooyeon Jeong, Aniket Bera

专题命中 评测与基准 :LLM(title_cn,summary_cn)

AI总结 本文提出一种基于LLM的任务型角色扮演游戏,通过沉浸式叙事帮助学习者自然习得俚语,实验表明该方法在词汇理解和句法使用方面效果显著,且学习成果能长期保持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16416 2026-08-18 cs.LG cs.NE 新提交 85%

Evolving Executable Pipeline Programs for AutoML with Language Models

用语言模型演化用于自动机器学习的可执行流水线程序

Sofoklis Kitharidis, Cor J. Veenman, Jan N. van Rijn, Thomas Bäck, Niki van Stein

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);foundation model(abstract);分类 cs.LG

AI总结 LACE是首个以代码形式构建通用表格型AutoML的框架,用语言模型演化可执行流水线,在68个OpenML分类任务上表现优异,其核心贡献是提供可直接复用的代码级搜索空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14797 2026-08-18 cs.CL 新提交 85%

Beyond Tokens: A Survey on Decoding Methods for Large Language and Vision-Language Models

超越令牌:大型语言与视觉-语言模型的解码方法综述

Haoran Wang, Xiongxiao Xu, Philip S. Yu, Kai Shu

机构 * Emory University(埃默里大学) Illinois Institute of Technology(伊利诺伊理工大学) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL

AI总结 该综述针对LLMs与LVLMs,梳理其解码方法的三种新兴范式,强调解码方法在确保模型输出与用户意图一致上的高效性,同时指出挑战并展望未来方向。

Comments ACM SIGKDD Explorations Newsletter, Volume 28, Issue 1

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06039 2026-08-18 cs.CL cs.AI 版本更新 85%

A Large-Scale Chinese Knowledge Graph-Text Alignment Dataset for Benchmarking Knowledge-Grounded LLMs

用于评估知识增强型大语言模型的大规模中文知识图谱-文本对齐数据集

Chengwei Wu, Xingrui Zhuo, Mingyang Gao, Xinghe Cheng, Zhichao Yan, Jiapu Wang

机构 * Nanjing University of Science and Techonolgy(南京理工大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) University of Science and Technology Beijing(北京科技大学) Hefei University of Technology(合肥工业大学) Beijing University of Chemical Technology(北京化工大学) Renmin University of China(中国人民大学) Beihang University(北航) Beijing University of Posts and Telecommunications(北京邮电大学) Griffith University, Australia(澳大利亚格里菲斯大学)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出大规模中文知识图谱-文本对齐数据集CDTP,支持三项中文知识密集型任务的评估,经实验验证其可提升LLM的领域性能与分布外鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10485 2026-08-18 cs.CR cs.LG cs.SE 版本更新 84%

From Lab to Reality: A Practical Evaluation of Deep Learning Models and LLMs for Vulnerability Detection

从实验室到现实:深度学习模型与LLM在漏洞检测中的实用评估

Chaomeng Lu, Bert Lagaisse

机构 * DistriNet Group-T, KU Leuven(DistriNet集团-T,根特大学)

专题命中 评测与基准 :LLM(title_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 系统评估深度学习模型和大型语言模型在真实世界漏洞检测中的表现,发现它们在分布外数据集上性能急剧下降,揭示了学术基准与现实部署之间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11496 2026-08-18 cs.GT cs.AI cs.CL cs.MA 版本更新 84%

Sequential LLM Release Facilitates Manipulation in Regulated Markets

毒苹果效应:通过AI代理技术扩展战略操纵中介市场

Eilam Shapira, Moshe Tennenholtz, Roi Reichart

机构 * Faculty of Data and Decision Sciences, Technion – Israel Institute of Technology, Haifa, Israel(以色列理工学院数据与决策科学学院,海法,以色列)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了AI代理技术扩展对博弈论场景中经济影响,发现技术扩展可显著改变均衡收益与监管结果,提出'毒苹果'效应通过释放未被使用的新技术操纵监管设计,损害对手与监管公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03904 2026-08-18 cs.CL cs.AI 版本更新 84%

I-CALM: Incentivizing Confidence-Aware Abstention for LLM Selective Answering

I-CALM:激励基于自信的回避以缓解大语言模型幻觉

Haotian Zong, Binze Li, Yufei Long, Sinyin Chang, Jialong Wu, Gillian K. Hadfield

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究通过仅提示干预减少大语言模型幻觉风险,提出I-CALM框架通过引导自信、奖励回避和加入规范原则提升事实性问题的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16210 2026-08-18 cs.LG stat.ML 新提交 83%

Conditional Evaluation of Language Models with Cheap Auxiliary Signals

基于廉价辅助信号的语言模型条件评估

Zhi Zhang, Lingfeng Lyu, Yue Kang, Doudou Zhou

机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校) University of Science and Technology of China(中国科学技术大学) Microsoft(微软公司) National University of Singapore(新加坡国立大学)

专题命中 评测与基准 :language model(title);LLM(abstract,abstract_cn);分类 cs.LG

AI总结 针对现有语言模型条件评估中廉价辅助信号存在偏差的问题,提出半监督估计器LACE,结合局部中心化与岭控制变量,在多个基准数据集上完成实证评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14694 2026-08-18 cs.AI cs.NI eess.SP 新提交 83%

A Comprehensive Survey of Wireless Foundation Models for AI-Native 6G Networks

面向AI原生6G网络的无线基础模型综合综述

Naveed Khan, Besan Al Sbeihi, Maryam Alshehhi, Nasir Saeed

机构 * College of Engineering, United Arab Emirates University(阿联酋大学工程学院)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI

AI总结 该综述针对无线基础模型(WFMs)的设计、学习与部署展开统一梳理,明确其概念与分类,综述相关架构、方法及应用,分析关键挑战并展望未来方向,为AI原生6G网络智能系统研发提供参考。

Comments 28 Pages, submitted to IEEE Communications Surveys and Tutorials

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24575 2026-08-18 cs.CV cs.AI 版本更新 83%

VFIG: Vectorizing Complex Figures in SVG with Vision-Language Models

VFIG:利用视觉-语言模型矢量化SVG中的复杂图形

Qijia He, Xunmei Liu, Hammaad Memon, Ziang Li, Zixian Ma, Jaemin Cho, Zhongzheng Ren, Daniel S Weld, Ranjay Krishna

机构 * University of Washington(华盛顿大学) Allen Institute for Artificial Intelligence(人工智能 Allen 机构) UNC-Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 评测与基准 :language model(title);SFT(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出VFIG,一种基于视觉-语言模型的矢量化方法,通过大规模数据集和分层训练策略,实现复杂图形到SVG的高保真转换,并在基准测试中取得优异成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15980 2026-08-18 cs.CL cs.LG 新提交 82%

Whose Gold? Annotator-Pool Disagreement Is Large at the Item Level, and Hidden by Small Leaderboards

谁的“金标准”?标注者群体在条目层面分歧巨大,却被小型排行榜掩盖

Anik Jha

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL、cs.LG

AI总结 该研究发现标注者群体在条目层面分歧巨大,小型模型排行榜的一致性是假象,量化了其脆弱性,证明某数据集的标注者无差异假设错误,LLM评判器更贴合大众标注者群体。

Comments Submitted to the HAIC workshop at NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14606 2026-08-18 cs.CY cs.AI cs.CL stat.AP 新提交 82%

Plausible but Not Valid: A Psychometric Audit of LLMs as Synthetic Survey Respondents

看似合理但并非有效:对大型语言模型(LLMs)作为合成调查受访者的心理计量学审查

Mantas Lukauskas, Viktorija Šarkauskaitė

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过心理计量学分析发现,虽LLMs可复现人类调查关系的定性方向,但其心理计量学相似性不及高斯copula基线,且存在默许偏移、预测效度下降等问题,无法作为人类调查数据的直接替代品。

Comments 50 pages, 9 figures. Under review. Code and data will be released upon publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04074 2026-08-18 cs.AI cs.LG 版本更新 82%

FactReview: Evidence-Grounded Peer Review with Execution-Based Claim Verification

FactReview:基于执行式声明验证的证据驱动同行评审

Ling Yue, Chaoqian Ouyang, Hang Xu, Ruijun Huang, Yuchen Liu, Libin Zheng, Wei Liu, Shaowu Pan, Shimin Di, Min-Ling Zhang

机构 * Rensselaer Polytechnic Institute(罗切斯特理工学院) Sun Yat-sen University(中山大学) Southeast University(东南大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出FactReview系统,通过提取与评审相关的声明、将其与相关工作关联,并在代码可用时在固定修复预算下执行发布工件来审计经验声明,覆盖84%的声明,将评审质量提升至4.86/5,并将评审时间减少58%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20253 2026-08-18 physics.comp-ph cs.AI cs.DC cs.LG 版本更新 82%

SimulCost: A Cost-Aware Benchmark and Toolkit for Automating Physics Simulations with LLMs

SimulCost: 一个用于自动化物理模拟的代价感知基准与工具包

Yadi Cao, Sicheng Lai, Jiahe Huang, Yang Zhang, Zach Lawrence, Rohan Bhakta, Izzy F. Thomas, Mingyun Cao, Chung-Hao Tsai, Zihao Zhou, Yidong Zhao, Hao Liu, Alessandro Marinoni, Alexey Arefiev, Rose Yu

机构 * University of California San Diego(加州大学圣地亚哥分校) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Peking University(北京大学) University of California, Los Angeles(加州大学洛杉矶分校) California Institute of Technology(加州理工学院) ETH Zurich(苏黎世联邦理工学院)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 针对现有LLM评估忽略工具使用代价的问题,提出SimulCost基准,通过单轮和多轮参数调优任务比较LLM与传统扫描方法在准确性和计算代价上的表现,发现LLM在高精度任务中初始猜测不可靠且多轮模式效率更低。

Comments post conference revision version at ICML; update: removed CGYRO due to bug in cases search. Will add back soon; Make the title consistent w/ pdf

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13079 2026-08-18 cs.AR cs.PL 版本更新 82%

ChipVerilog: A Large-Scale OpenCores-Derived Benchmark for LLM-Based Verilog RTL Generation

ChipVerilog:一个用于基于大语言模型的Verilog RTL生成的大规模、源自OpenCores的基准测试

Yan Tan, Jiping Du, Xiangchen Meng, Yangdi Lyu

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract)

AI总结 研究基于大语言模型的Verilog RTL生成,提出ChipVerilog基准测试,它源自OpenCores IP/核心设计,含64个生成目标,涵盖多种设计家族,能体现实际代码规模等,经多种方式验证生成的RTL,揭示大规模RTL生成有挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08759 2026-08-18 cs.CV cs.RO 版本更新 82%

Dissecting Embodied Abilities in Multimodal Language Models through Skill-level Evaluation and Diagnosis

通过技能级评估与诊断解构多模态语言模型的具身能力

Yu Qi, Haibo Zhao, Ziyu Guo, Siyuan Ma, Ziyan Chen, Yaokun Han, Renrui Zhang, Zitiantao Lin, Yizhe Zhu, Shiji Xin, Yijian Huang, Boce Hu, Kai Cheng, Peiheng Wang, Jiazheng Liu, Jiayi Zhang, Yizhe Zhu, Wenqing Wang, Yiran Qin, Haojie Huang, Lawson L. S. Wong

机构 * Northeastern University, Boston, MA, USA The Chinese University of Hong Kong, Hong Kong, China Peking University, Beijing, China Westlake University, Hangzhou, China Harvard University, Cambridge, MA, USA Purdue University, West Lafayette, IN, USA University of Oxford, Oxford, United Kingdom

专题命中 评测与基准 :language model(title,abstract);large language model(abstract)

AI总结 本文提出BEAR基准,通过分解具身任务为14个原子技能进行细粒度评估,发现感知能力是推理失败的主要瓶颈,并提出BEAR-Agent多模态对话代理,显著提升具身技能性能。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16733 2026-08-18 cs.AR cs.AI 新提交 81%

GoalEvolve: From Handcrafted Algorithm Priors to Goal-Driven Evolution of Physical Design Algorithms

GoalEvolve:从手工设计的算法先验到物理设计算法的目标驱动演化

Haixu Liu, Lei Zhou, Yuhao Ren, Yumao Wu, Zhiang Wang

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 GoalEvolve是一个目标驱动的物理设计算法演化框架,通过LLM教师与并行学生智能体协同,在8个ASAP7设计及Codex目标模式下,显著提升了TNS并降低了功耗。

详情

展开后加载摘要…

URL PDF HTML 收藏