arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

行业趋势

科学发现、生命科学、材料及其他交叉技术。

2610.02599 更多前沿

AI能给植物肉试味?斯坦福等用2.1万次人类评价检验预测

斯坦福大学计算机科学系、Food Intelligence Lab、NECTAR、多伦多大学化学工程系等机构提出TasteBench,汇集超过2.1万次人类评价,检验AI预测植物食品与目标食品的口味相似度。同组比较中,最佳模型准确率66.1

斯坦福大学计算机科学系、Food Intelligence Lab、NECTAR、多伦多大学化学工程系等
文章封面
2609.39903 Agent

电脑Agent开始考“科研实操”:OSWorld-Science盯上真实软件工作流

清华大学、加州大学洛杉矶分校、日本理化学研究所AIP与耶鲁大学等推出OSWorld-Science,把电脑Agent放进统计、生物医学、地理信息和工程仿真等真实科研软件。评测不只看是否点到按钮,而是检查交付文件、数值精度与完整工作流,揭示“

清华大学、加州大学洛杉矶分校、日本理化学研究所AIP、耶鲁大学等
文章封面
2609.39604 大模型

世界模型只错3.7%为什么还是全盘崩?元环智能&北大等找到三个病根

元环智能、北京大学与清华大学等机构联合用细胞自动机拆解世界模型:单格预测准确率可达96.3%,完整演化成功率却只有18.9%。研究把落差归结为空间局部性、时间局部性和时间稳定性,并用三处信息流修改将对应指标从39.1%、25.8%、42.2

元环智能、北京大学、清华大学等
文章封面
Forbes/Anna Tong 更多前沿

不崩老头崩Nerd!硅谷“科技宅伴游”一小时3500美元

今年6月,《福布斯》报道了硅谷AI圈的一门小众生意:几位高价伴游者既提供亲密陪伴,也能和客户聊AI、生物黑客、加密货币。曾在金融业工作的Meida Marek向记者报出每小时3500美元的价格;她说,近来不少客户来自英伟达。技术热潮里,有人

封面
2609.30054 大模型

AI自己出题自己练:港科大造出8178道科学编程题,准确率涨10个点

香港科技大学联合上海人工智能实验室、清华大学、南洋理工大学提出SciWalker,让AI按算子链自动出科学编程题,并用真实执行反馈筛选修复。他们造出8178道高质量题目,用GSPO训练后,Qwen3.5-9B在SciCode上的准确率从29

香港科技大学、上海人工智能实验室、清华大学、南洋理工大学等
文章封面
2609.27297 更多前沿

论文搜索不再只找关键词,北大等做出科学推理地图

DP Technology、中国科学院理论物理研究所、北京大学、兰州大学等机构提出Large Knowledge Model(LKM),把论文拆成问题、推理步骤、结论与证据,再跨论文连成可检索地图。固定回答模型时,LKM检索将ChemBen

DP Technology、中国科学院理论物理研究所、北京大学、兰州大学等
文章封面
2609.21455 视觉与生成

阿里淘宝让视频模型补物理课:碰撞、多阶段运动一次适应

哈尔滨工业大学与阿里巴巴淘宝提出CompAdapt,让视频生成模型处理耦合运动、多阶段转换和多物体碰撞,并能用一个样例适应新的物理环境。目标不是只让单个物体移动得像,而是让连续事件彼此接得上。

哈尔滨工业大学、阿里巴巴淘宝等
文章封面
BogdanTheGeek 项目仓库与博客 更多前沿

废弃电子烟,居然被改成了网站服务器

用完的一次性电子烟,还能拿来架网站。开发者 Bogdan Ionescu 在开源项目 semihost-ip 中,把拆出的普冉微控制器变成了一台微型网页服务器:只有3KB内存,靠调试接口与电脑交换网络数据。代码和搭建方法都已公开,硬件爱好者

封面
2609.05093 更多前沿

只花27.72美元,AI在15轮内打破10项圆堆积纪录

Practical Systems团队用一个可验证的LLM程序进化循环改写圆堆积求解器,在15轮内以27.72美元模型调用成本,改进Packomania中N=101至114范围的10项已知纪录。结果由零容差检查并被数据库接受,但只针对可变半

Practical Systems等
文章封面
2609.03742 更多前沿

港城大等把视频课改成知识地图,125段课程生成1079份视觉摘要

香港城市大学、苏黎世联邦理工学院提出KnowVis,把线性视频课程改排成概念图、知识单元和视觉摘要。团队整理10个学科的125段视频并生成1079份摘要,人体研究报告认知负担下降、学习与保持改善;样本规模有限,不能外推到所有课程和长期学习。

香港城市大学、苏黎世联邦理工学院等
文章封面
2609.01961 具身智能与机器人

伯克利让达芬奇机器人双臂清创:成功率92%,每小时处理473个碎片

加州大学伯克利分校、直觉外科公司等机构联合提出MACAW,让达芬奇研究机器人用视觉伺服对准碎片,再以单目图像控制抓取深度。双臂设置在物理实验中达到92%成功率,平均7秒处理一个碎片、折合每小时473个;实验使用研究平台和仿真组织碎片,不能视

加州大学伯克利分校、直觉外科公司等
文章封面
2609.01591 更多前沿

微软让AI模拟学生,三类任务两项指标都超过GPT-5.4

微软研究院、伊利诺伊大学厄巴纳-香槟分校提出StudentSim,用少量个人学习记录训练个性化学生模拟器。评测覆盖国际象棋、英语写作和数学三类任务、60名学生,论文称StudentSim在行为保真度和指导响应性上均超过GPT-5.4。

微软研究院、伊利诺伊大学厄巴纳-香槟分校等
文章封面
2608.25871 更多前沿

阿里、中科大等用3200万条商品轨迹训练CEDAR,让销量预测响应预算变化

商家计划下周增加广告预算时,普通时间序列模型往往仍沿着历史销量往前画线。阿里巴巴、中国科学技术大学、香港科技大学(广州)提出CEDAR,直接学习“当前状态—商家行动—下一状态”的转换,再单独修正节日和热点带来的偏差。

阿里巴巴、中国科学技术大学、香港科技大学(广州)等
文章封面
2608.23691 Agent

剑桥、港大等让AI智能体自由做数学,12道构造题里5道找到新结果

不给AI智能体分配固定角色,也不让中央调度器指定下一步,只提供一个可检验的研究目标,它们会不会自己形成研究路线?来自DualverseAI、剑桥大学、香港大学、加州大学圣迭戈分校的研究团队共同提出并评测了开放世界多智能体环境Station。

DualverseAI、剑桥大学、香港大学、加州大学圣迭戈分校等
文章封面
2608.24572 更多前沿

Meta做了一只光纤传感手套,60Hz捕捉手势、指尖误差4.9毫米

手指被杯子、工具或另一只手挡住时,摄像头很容易丢点;依赖惯性或磁场的传感手套又会遇到漂移和干扰。Meta、西北大学提出一套光纤传感手套,用沿手指铺设的多芯形状传感光纤直接恢复三维曲线,再以60Hz重建完整手部姿态。

Meta、西北大学等
文章封面
2608.18114 更多前沿

Meta等用无创脑信号解码完整句子,平均词错误率降至39%

九名参与者听到句子后在键盘上输入,脑磁图设备连续记录大脑活动。Meta AI、巴黎高师、法国国家科学研究中心等机构据此训练Brain2Qwerty v2,在不植入电极的情况下解码自然句子,跨参与者平均词错误率达到39%。

Meta AI、巴黎高师、法国国家科学研究中心等
文章封面
2608.17271 Agent

人类撤掉方法指导,AI科研得分近乎腰斩:清华等发布ASI-Bench

给AI完整实验路线时,它能沿步骤执行;只给研究问题,让它自己决定方法,成绩迅速下滑。清华大学、麻省理工学院、哈佛大学、微软研究院等机构发布ASI-Bench,用60项项目级任务测试AI探索未知、选择方法并产出可验证结果的能力。

清华大学、麻省理工学院、哈佛大学、微软研究院等
文章封面
2608.14652 更多前沿

阿里达摩院南大等做0.1度天气预测,72小时内85%以上时段胜过IFS-HRES

南京大学、蚂蚁集团和阿里巴巴达摩院联合提出BaguanHR,目标是训练0.1度全球高分辨率天气模型。论文报告,在72小时预报范围内,其合成加真实数据版本在超过85%的受测时段优于IFS-HRES;训练数据翻倍时,72小时预报RMSE下降4.

南京大学、蚂蚁集团、阿里巴巴达摩院等
BaguanHR与机器学习模型及IFS-HRES在极端天气指标上的比较
2608.13558 Agent

牛津NUS提出OmniScientist:AI直接看图听音频做实验,36个案例全部写成论文

把胸片、鸟鸣、显微图、3D结构和运动轨迹交给AI,它能否不靠人类先整理成表格,直接提出假设、运行分析并写成论文?牛津大学与新加坡国立大学提出OmniScientist,在5个学科的36组真实数据上完成从感知到论文的全流程,直接读取原始模态的

新加坡国立大学、牛津大学等
OmniScientist直接处理多模态科学数据的文章封面
↑