新智元 2026-08-05 19:07 北京 新智元报道 让机器人把一只虾夹起来,再放进锅里。 真正困难的,可能不是认出虾,也不是找到锅,而是把握夹爪闭合的那个瞬间:早一点,夹爪会落空;晚一点,虾可能已经被推走。夹住之后,机械臂还要连续调整力度、方向和速度。整个过程没有暂停键,也不会等摄像头拍完「下一帧」再继续。 但许多视觉世界模型认识时间的方式,恰恰来自这些被摄像头截取的画面。它们看到第1帧、第2帧、第3帧,并学习如何从一张图跳到下一张图。至于两帧之间发生了什么、换一种帧率后该如何预测,甚至某个关键瞬间缺失后如何还原,模型通常没有一条可以直接查询的连续轨迹。 问题也由此变得具体: 如果机器人对世界的理解只存在于一格格画面里,它要怎样抓住发生在两帧之间的那一瞬间? 来自清华大学智能产业研究院(AIR)与UC Berkeley BAIR的研究团队提出了ODEWorld——全球首个连续时间具身世界模型。它不再只问「下一帧是什么」,而是直接学习世界在每个时刻朝什么方向、以多快的速度变化,并由此还原一条随真实物理时间连续演化的潜空间轨迹。 论文链接: https://arxiv.org/abs/2607.27924 项目主页: https://dstate.github.io/odeworld_website/ 这项工作的关键,并不是单独增加了一项「补帧」功能。只要模型掌握的是一条连续的变化轨迹,就可以在任意时刻读取状态:需要更高帧率时,从轨迹上增加采样点;观测缺失时,查询中间时刻;需要回看变化来源时,则沿轨迹反向求解。原本分散的生成能力,因此被统一成了同一个连续时间问题。 团队将这套预测范式称为Physical-Time Flow,简称PT-Flow;基于PT-Flow构建的连续时间潜空间世界模型,则被命名为ODEWorld。 离散预测的时间边界 设机器人在时刻t的状态表征为 。传统离散模型通常学习一个状态转移函数: 其中c可以是目标图像或任务指令。 这种建模方式并非无效,但它将预测能力绑定在预先设定的时间步长上。训练视频按照固定频率采样,模型学习的也是相邻采样点之间的跳转。当查询时刻落在两个训练帧之间,或者输入序列缺少部分观测时,离散模型本身并没有一条显式的连续轨迹可供查询。 PT-Flow改为学习潜状态关于真实物理时间的导数: 这里的 是潜空间速度场,输出当前状态在下一瞬间的变化方向和速度。给定参考状态z0后,未来状态可以通过常微分方程求解器积分得到: 静动态解耦 为速度场构造干净的潜空间 把视频变成连续方程,首先需要找到一个适合由ODE描述的状态空间。 在机器人视频中,大量视觉内容没有发生变化。桌面、墙壁和物体纹理可能连续数秒保持静止,真正推动任务进程的只有机械臂、夹爪、目标物体以及接触关系。若让速度网络同时拟合静态背景与少量运动区域,动态信号会被大量零变化或噪声特征淹没。 ODEWorld因此没有直接在像素空间中建立速度场。它首先使用冻结的DINOv2编码器,将图像压缩为视觉特征 ;随后再通过一组以初始状态为条件的动态编码器与解码器,提取真正负责描述变化的潜变量: 编码器和解码器都能直接看到s0。静态场景信息因此可以从参考状态中取得,zt没有必要重复保存背景,只需概括当前状态相对s0发生了什么变化。 这种解耦带来了非常激进的压缩:原始DINO特征大小为16×16×768,而ODEWorld的动态潜变量只使用一个1×768token。基于这个单token,速度场只需由一个轻量的三层MLP参数化,时间信息通过FiLM注入;zt、z0和目标条件c则共同决定速度网络的输出。 直接监督「状态怎么变」 拥有紧凑潜空间,并不意味着模型一定能学到稳定的连续动力学。潜空间世界模型长期面临的一个问题是表征坍缩:如果编码器把不同画面都映射到相似向量,预测器就很容易得到较低损失,但这些向量不再包含足够的状态信息。 ODEWorld的关键设计,是不只比较预测状态与目标状态是否一致,而是直接监督潜状态的一阶时间导数。 由于动态编码器满足 ,根据链式法则: s0在一次预测过程中保持不变,因此它关于时间的导数为零。训练数据虽然只提供离散帧,却可以利用相邻特征估算 。 再通过雅可比向量积(Jacobian-vector product,JVP),模型无需显式构造巨大的雅可比矩阵,就能把视觉特征空间中的变化速度投影到动态潜空间,得到 。 速度网络的训练目标由此写成: 其中sg表示停止梯度,用于稳定速度场优化。论文中的进一步实验显示,即使移除停止梯度,模型仍然能够有效训练,说明一阶速度约束本身已经为潜空间提供了较强的结构性约束。 这与典型JEPA式训练存在明显区别。后者通常要求预测潜变量接近目标编码器产生的潜变量,并依赖EMA、停止梯度或额外的方差与协方差约束来避免坍缩。 ODEWorld则把「状态如何沿时间移动」直接写进监督目标:如果所有状态都坍缩到相同表示,模型便无法解释非零的真实变化速度。 论文采用RankMe衡量表征的有效秩。在相同采样协议下,ODEWorld的768维动态潜变量平均有效秩为425.2;DINOv2 CLS特征为376.1;V-JEPA 2的1024维表征为203.7。 更高的有效秩意味着潜空间保留了更多彼此独立的变化维度,也表明单token并不等于信息贫乏。 Savitzky–Golay滤波 理论上,最简单的状态速度可以由相邻帧差分得到: 但ODEWorld使用的是冻结的DINOv2图像编码器。DINOv2主要为单帧视觉表征设计,并没有专门保证连续视频中的时间一致性。即便像素只发生轻微变化,相邻帧特征也可能包含高频抖动;直接将这些差分当作物理速度,会把视觉编码噪声一并交给速度场。 团队因此使用Savitzky–Golay导数滤波器估计 。 它在局部窗口内进行多项式平滑和求导,在抑制高频噪声的同时,尽量保留接触、抓取和物体移动等关键变化。论文的潜轨迹可视化显示,ODEWorld生成的轨迹比原始DINO特征以及离散下一步预测基线更加平滑,同时仍保留原特征空间的主要几何结构。 这也揭示了PT-Flow的一个重要边界:模型学习的不是已知解析物理方程,而是在数据中寻找一个适合连续积分、又能保留任务语义的潜空间动力系统。它追求的是可用于未来预测的连续表征,并不是从视频中恢复唯一的真实控制方程。 一条速度场 统一三类生成能力 完成训练后,未来预测不再依赖重复调用固定步长的下一帧模型,而是使用RK4等现成ODE求解器沿速度场积分。查询时间点可以自由选择,由此自然产生三类能力。 第一是任意时间分辨率生成。希望动作更慢,就在轨迹上查询更多、更密集的时刻;希望快速推进,则减少采样点。模型无需为不同播放速度单独训练。 第二是时间补全。论文将训练序列降采样到原始帧率的三分之一,ODEWorld仍能查询训练数据未提供的中间时刻并生成连贯状态。这里的「补帧」并非简单的像素插值,而是从学习到的潜空间动力学轨迹中解码对应时刻。 第三是反向生成。将积分方向反转,即令 ,同一速度场就能生成物理上合理的反向序列。这并不意味着模型能够还原任意系统唯一、真实的历史,也不意味着所有现实过程严格可逆;它说明模型学习到的潜空间流可以在相反方向上进行稳定数值积分。 64帧预测更快 长程画面也更稳定 ODEWorld的效率首先来自表征空间的压缩。 它没有在高维像素或完整视觉特征上反复预测,而是将与运动有关的信息集中到一个动态token中,在这个紧凑潜空间里求解状态随时间的变化。大量与当前运动无关、在相邻帧中基本保持不变的背景和外观信息,因此不必在每一步预测中重复计算。 第二层效率来自速度场本身。 由于动态状态已经被压缩,负责描述潜状态变化率的网络只需要一套三层MLP,而不必依赖庞大的逐帧生成网络。ODE求解器先在低维潜空间中完成整条轨迹的积分,只有需要输出具体画面时,模型才通过动态解码器和图像解码器恢复视觉结果。 换句话说,ODEWorld把主要计算用在「世界如何变化」上,而不是在每个时间点重新生成一遍完整世界。 在LIBERO视频预测实验中,各方法的短时与长时预测结果如下。PSNR衡量预测画面与真实画面在像素层面的接近程度,数值越高越好;LPIPS更关注人眼感知到的结构与语义差异,数值越低越好。 短时的16帧预测中,ODEWorld达到20.53PSNR和0.109LPIPS;当预测范围延长到64帧后,两项指标仍保持在19.46和0.134,均优于LDP与V-JEPA 2。速度上的差距更直观。 生成64帧时,LDP的延迟为3.953秒,V-JEPA2为0.619秒,而ODEWorld只需0.072秒——约为LDP的1/55、V-JEPA2的1/8.6。 将动态表示压缩到单token,并用轻量速度场完成连续积分,不只是减少了模型内部的表示规模,也确实转化成了端到端预测效率。 从预测下一帧 到建模变化本身 ODEWorld最重要的意义,不只是极致压缩带来的性能提示,而是把世界模型的学习对象从「离散状态之间的映射」转向「状态随物理时间的变化率」。 静动态解耦为连续动力学清理了表征空间;JVP把离散视频中的变化速度投影为可监督的潜空间导数;单token和轻量速度网络则让ODE积分能够低成本运行。任意时间采样、缺帧恢复和反向生成,由此不再是彼此独立的功能,而成为同一条潜空间速度场的不同使用方式。 对具身智能而言,这种变化或许比「多预测几帧」更值得关注。机器人真正需要理解的,并不是静态世界由哪些像素组成,而是当它接近、接触并移动一个物体时,世界正在怎样变化,以及这种变化接下来会把它带到哪里。 当世界模型开始直接学习这种变化,预测未来才可能从逐帧模仿,进一步走向连续的动态推演。 参考资料: https://arxiv.org/abs/2607.27924 编辑:LRST 秒追ASI ⭐ 点赞、转发、在看一键三连 ⭐ 点亮星标,锁定新智元极速推送! 跳转微信打开
ASI启示录 2026-08-05 19:07 北京 新智元报道 「Optimus 会是一款史诗级(epic)产品。」 8 月 3 日,马斯克在 X 上连发数帖为特斯拉的机器人路线站台。 不过,马斯克的操作你懂的。Optimus 擎天柱机器人还没有时间表、没有技术细节,更没有商业化节点。 但对普通人来说,才不管你口号喊的震天响,就问一句: 机器人啥时候能进到家里? 别急。还真有。 就在最近,家庭具身智能品牌元点 Zeroth 一次发布了两台机器人: 身高约 165cm、体重约 55kg 的全尺寸人形 Jupiter,以及全球首款异构机械臂家庭协作机器人 N1。 行业里聊家庭机器人,大多还停留在「功能延伸」或者「劳动力替代」的思路。说白了,就是把机器人当个高级家电。 但元点机器人想做的不一样: 它更强调机器人和人的长期共生关系。 家庭机器人不应只是一个等指令的机器,而应该是能理解并记住你的习惯、偏好和情绪的亲密成员,成为陪伴生活、探索世界、平等交流的智能镜像。 这一轮具身智能的分水岭,也许就在于谁能一代代把今天已经可工程化的技术,真的送进普通人的客厅。 从小人形到全尺寸 「元点机器人宇宙」全阵容亮相 先说 Jupiter。作为元点机器人的首款全尺寸人形机器人,它的身材数据是 165cm、55kg,差不多是一个身材偏瘦的成年人。它能走路、能导航、能跟你聊天,碰到地毯台阶这种「家庭地形」也不至于摔跟头。 但元点机器人对它的期待显然不止于此:Jupiter 的最终目标不是在发布会上走两步、挥挥手,而是 成为能长期进入家庭、以伙伴形式存在的通用智能机器人。 用元点机器人自己的话说,真正的具身智能,不应只是执行任务的工具,而应具备感知环境、理解用户、参与生活并随时间共同成长的能力。 除了家庭场景,Jupiter 也能去商场、展会当「社牛」,还支持高校科研机构拿它做研究载体。 再说 N1。如果说 Jupiter 像是请了一位全能管家,那 N1 就是你厨房和客厅里的「拆分型帮手」。 它采用全球首创的异构机械臂方案,能把自己一分为二,变成两个独立工作的小机器人,共享大脑,各干各的。 这就好比你请了一个助理,结果他能变成两个人同时帮你端菜和收拾桌子。 N1 的身材也足够「家庭友好」:占地只有 0.2 平方米,大概就是一块瑜伽砖的面积,0 转弯半径意味着它在厨房过道里也能灵活转身。肩膀高度可以在 63cm 到 128cm 之间调节,恰好覆盖了茶几到吧台的高度区间。换句话说,家里那些你弯腰够、伸手拿的活,它都能干。而且可拆解、可拓展的结构设计,让 N1 的场景适应能力比想象中更灵活。 更重要的是,N1 自带一套 PSS 物理空间安全系统,能自动规划路径、动态避障,对家里的老人和小孩来说,安全感拉满了。 它还搭载了元点机器人的家庭专属记忆系统,用得越久越了解你家的习惯,哪个杯子放哪、几点该喂猫,慢慢都能记住。在整理、搬运、照护辅助、生活服务这些场景中,率先形成可用、可靠、还能持续迭代的家庭协作能力。 值得一提的是,这家公司来头不小。乐享科技成立于 2024 年底,创始人郭人杰是个 97 年的少年班选手。15 岁考入西安交大少年班,后赴伦敦政经学院读硕士,26 岁就当上了追觅科技中国区执行总裁,三年实现从 0 到 60 亿的营收跨越。出来创业不到一年半,已经累计融了 10 亿元,红杉、IDG、经纬一众顶级 VC 排队入场,在手订单突破 3 万台。 此次 Jupiter 和 N1 的发布,也进一步勾勒出元点 机器人 在具身智能领域的产品路线。此前,公司已围绕家庭场景推出全球首款自主回充机器人 M1、履带式机器人 W1 等产品,覆盖了儿童陪伴、老人看护、宠物监测、家庭巡检、户外随行等方向。如今加上 Jupiter 和 N1,元点机器人已形成从小型人形、履带移动,到家庭协作、全尺寸人形的多形态产品矩阵。 形态不少,目标只有一个: 让 机器人 以更安全、更自然、更高频的方式进入家庭。 六大技术方向撑腰,打的是家庭场景的持久战 元点机器人想明白了一件事: 家庭机器人的关键从来不是「它能做什么」,而是「它以什么关系进入你的家」。 当机器人从冰冷设备转向长期陪伴者,它需要的东西远比工厂机器人复杂得多:更高的安全边界、更自然的交互方式、更持续的学习能力,以及对家庭生活节奏的理解能力。 只有当技术能力、产品体验与家庭关系真正融合,具身智能才可能从一个新奇设备变成日常生活的一部分。 家里有追着跑的孩子、腿脚不便的老人、到处溜达的猫、堆在门口的快递,还有地毯、台阶、椅子腿这种永远在变的「非标地形」。想在这个环境里站住脚,光靠一个算法或者一个硬件亮点远远不够。你得整机设计、运动控制、环境感知、多模态理解、安全协作全都打通。 为此,元点机器人建了一套覆盖六个核心方向的全栈技术体系。具体来说: 本体结构和关节模组负责「身体素质」,让机器人走得稳、动得准、碰到东西不会伤人; 轻量化机械臂解决「手上活」,在家庭这种窄空间里做柔性操作,而不是像工业机械臂那样大开大合; 具身通用模型和 VLA 负责「大脑」——让机器人不只是「看见了桌上有个杯子」,而是理解「主人渴了,该倒杯水」,然后真的去做; 意识仿生模型则更超前一步,瞄准的是长期关系——让机器人在陪伴、记忆、情绪识别和个性化响应中具备持续进化的基础。 这套技术布局,让元点机器人能同时覆盖机器人「身体」与「智能」两端的核心能力。Jupiter 与 N1 的发布,正是这一全栈能力在全尺寸产品方向上的集中呈现。 正如创始人郭人杰所说:「我们希望家庭具身智能终端不只是拥有『记忆』,而是能够在长期陪伴中逐渐理解一个真实的人。它会记得你的习惯,也能感知你的情绪。随着一次次相处,成为越来越懂你的家庭伙伴。或许有一天,它甚至比你更早察觉你的疲惫、期待与需要。同时,它也不只服务于某一个人,而是能够识别不同家庭成员的性格、偏好与生活节奏,并与每个人建立不同的互动方式。真正的家庭具身智能,应该懂得家庭里的每一个人,也懂得人与人之间细微而珍贵的关系。」 一代代把「家人」送进客厅 对于行业而言,具身智能正从概念验证阶段进入产品定义与场景验证并行的新阶段。谁能更早理解真实家庭需求,谁能在产品、技术、供应链和商业化之间形成持续迭代,谁就更有机会建立长期竞争优势。 每隔几个月就有人喊「颠覆」,但真正重要的问题永远是: 你的 机器人 到底能不能送到用户手里? 元点 机器人 选了一条看起来不那么性感但格外务实的路: 渐进式落地。 郭人杰说:「可工程化的高维技术解决实际的用户需求,等于成规模的产品。所以我们就一代代找哪些技术到今天已经可以工程化了,哪些场景是今天用这些工程化技术可以满足的,一代代去满足这些需求。」 从 M1 到 W1,再到 N1 和 Jupiter,每一代产品都比上一代多解决一些问题,也多进入一些家庭场景。 在元点 机器人 的思考逻辑中,具身智能的终局绝非一场单纯的技术破局,而是一场关于「人、科技与生活空间」关系的重塑。家庭具身智能的价值,不应只停留在少数人的前沿体验里,而应真正走进千千万万个普通家庭,成为每个人都可以享有的科技红利。技术进步的意义,在于让复杂的算法隐身于无形,让科技的温度显影于日常,让生活更有尊严、更有温度。 无论是需要陪伴的孩子、需要守护的老人,还是在日常琐碎中渴望被理解与分担的每一个人,都应平等享受 AI 发展带来的改变—— 让 AI 不再是遥远的技术概念,而成为普通家庭触手可及的陪伴、协作与守护,真正实现更平等、更普惠、更有温度的智能未来。 编辑:所罗门 秒追ASI ⭐ 点赞、转发、在看一键三连 ⭐ 点亮星标,锁定新智元极速推送! 跳转微信打开
ASI启示录 2026-08-05 19:07 北京 新智元报道 每周,全球有超过2亿名18—24岁的年轻人打开ChatGPT。 他们是ChatGPT最活跃的一批用户,按理说,早该把它用得炉火纯青。 可就在8月4日,OpenAI甩出了一个扎心的数字: 哪怕是这群人里用得最溜的高阶用户,实际调用出的能力,也只相当于「超级用户」的1%到10%。 同一个ChatGPT,超级用户能榨出十分力,大多数学生连一分却都还没摸到边。 这1%到10%是「和超级用户比」,并不是说学生只用了模型1%的能力。 但结论已足够扎心:大多数人手里握着一台越来越强的机器,却只会按最基础的那几个键。 模型已不再是瓶颈,「不会用」才是。 于是,OpenAI亲自出手,一口气拿出三款插件,要把「不会用」这道门槛给磨平。 三款教育插件瞄准三类人 这次OpenAI一口气拿出三款教育插件,分别对准三类人: K-12老师、大学老师、大学生。 这里的「插件」不是浏览器上装的那种扩展。 它是把应用、角色技能、操作指令和一整套常用工作流预先打包好的「开箱即用包」,你不用先修炼成提示词高手,装上就能干活。 这背后藏着一个转变。 过去OpenAI教你怎么写提示词,现在它干脆把备课、课程设计、出测验、做学习计划这些成熟流程,直接为你预装进去。 老师早上打开电脑,不再对着空白对话框为提示词发愁,点开一个已经排好流程的模板,往里填内容就行。 三个插件,各管一摊。 K-12教师插件,管的是老师那些最耗神又最琐碎的活儿:作业翻译、生成exit ticket(课堂小结)、家校沟通、出练习测验,一套备课流程基本包圆。 K-12教师插件示例:作业翻译、exit ticket小结、家校沟通、练习测验,一套备课流程打包。 它还接入了Learning Commons,让生成的材料对齐各地的学术标准,但打分和教学判断,仍握在老师手里。 大学教师插件,则往「课程」纵深走:改教学大纲、生成互动教学网站、排课程日历,还能直接打包进学校的教学系统(LMS)。 大学教师插件示例:生成互动教学网站、课程日历、课程材料与海报。 大学生插件,落点在「学」:把正在学的东西变成更个性化的材料,AI辅导、难点练习,自动生成学习指南、测验、闪卡和可视化讲解。 大学生插件示例:从自选资料生成互动学习页、闪卡与学习计划。 不错,这些功能单拎出来,ChatGPT本来就能做。 但真正改变的,是OpenAI把备课、出题、做学习计划这些成熟工作流提前铺好,省掉了用户自己搭提示词、试错、调参的那一大部分活儿。 别再「问一句,答一句」地使用ChatGPT了 OpenAI给这道坎起了个名字:能力鸿沟(capability overhang)。 工具进化得太快,人的使用能力跟不上了,中间隔着的那道沟越拉越宽。 OpenAI内部数据:用ChatGPT Edu的学生多数能力领先免费版用户,分析计算、教育学习差距最大。 而要填这道沟,真正要做的是降低那道「会不会用」的门槛。 OpenAI自己也拿出了佐证: 在ChatGPT Edu的部署里,学生用得越久,使用模式就越往「超级用户」靠拢,尤其在分析、计算和学习这几项上,提升最明显。 一个超级用户,可能正让ChatGPT连数据、跑分析、搭一个能自动运转的小工作流;而大多数学生,还停在让它「帮我写篇八百字作文」。 会用的人,正把AI越用越深;不会用的人,还停在「问一句、答一句」。 同样一个人,有人带着、有现成工作流依托,与自己一个人瞎摸索,最后能把AI用成什么样,两者之间相差甚远。 这差距不在脑子,在于没人告诉过他,这玩意儿还能这么用。 这已经不再是发一个AI家教了 把OpenAI这一年在教育上的动作拼起来看,它在搭的是一套闭环。 插件负责「用」,插件负责把工作流塞到师生手边。 教师学院负责「教」,OpenAI是「国家AI教学学院」的创始合作伙伴,这个项目计划五年培训40万名K-12教育工作者。 按这个规划,五年之后,每10个美国老师里就该有1个受过它的训练。 但这不是OpenAI一家的独角戏。学院由AFT(美国教师联合会)、UFT联合微软、OpenAI和Anthropic共建,牵头方是微软。 国家项目负责「铺」。 通过Education for Countries,OpenAI把ChatGPT Edu送进各国教育系统。 仅爱沙尼亚一地,据OpenAI披露就已覆盖超过2万名学生和4600名教师,还配了一项和塔尔图大学、斯坦福合作的长期研究。 往下还有更细的毛细血管:学生社群、八座城市的线下教师工作坊、给科研人员的12个月免费工作区。 而学生社群那头又接着实习和求职入口,把学到的AI技能直接对接早期职业机会。 2026年7月,OpenAI在佐治亚州Jonesboro举办的K-12教师训练营现场。 最后,学习成效衡量套件负责「评」,测AI到底有没有真正改善学习,而不只是让人用得更多、更频繁。 用、教、铺、评四件套拼在一起,早已超出一个AI家教的量级,它是在往教育基础设施里扎根。 OpenAI给了工具 教学权归谁? 这里有一个容易被忽略、却很关键的细节:三款插件目前都没有向所有ChatGPT用户开放。 官方写得很清楚,它们只通过ChatGPT Edu和ChatGPT for Teachers的学区部署提供。能不能装、装哪些、给谁用,由学校和学区说了算,学校掌控应用、权限和课程材料。 这是一种策略选择,对比一下更清楚。 三周前的7月14日,Anthropic刚上线Claude for Teachers,走的是另一条路:面向单个通过验证的美国K-12教师,个人就能免费领。 这条路当时被一些教育界人士批评「跳过了学区决策层」:学校IT和管理者还没点头,工具已经进了老师手里。 OpenAI这次几乎是反着来,把入口直接架在学区一层,让机构成为统一的分发口,它要争的不是几个老师的青睐,是整个教育机构的统一入口。 但把入口架进学区,不等于连教学权也一并拿走。 在课堂上到底怎么用AI、怎么给学生打分这件事上,教师、学校和政府,谁也不打算撒手。 AFT对此也下了死命令:课程内容科技公司一概不许插手,培训环境完全由教师主导。 一位一线老师有一个很实在的比方: AI像火,能煮饭,也能烧伤。它能读懂一道题,却读不懂一间教室里的气氛,更判断不了一个孩子此刻究竟卡在哪。这些,只能交给讲台上那个大活人。 所以这场仗,表面看是OpenAI在忙着送插件、送额度、送培训,底下真正争的,是「谁来定义课堂里怎么用AI」。 对于那2亿年轻人和他们的老师来说,问题早已从用不用AI,变成了用谁家的AI,怎么教又由谁说了算。 参考资料: https://openai.com/index/learn-teach-chatgpt-work-codex/ https://openai.com/index/ai-education-opportunity/ https://www.aft.org/news/ai-revolution-who-gets-lead-nations-classrooms https://www.hm.ee/en/news/estonia-announces-groundbreaking-national-initiative-ai-leap-programme-bring-ai-tools-all https://help.openai.com/en/articles/20001406-chatgpt-for-academic-researchers 编辑:元宇 秒追ASI ⭐ 点赞、转发、在看一键三连 ⭐ 点亮星标,锁定新智元极速推送! 跳转微信打开
游戏首先要传播出去才会具备被用户接受和讨论的价值,那些曾经陪伴你我的盗版游戏,是否也为今天的你埋下过一颗种子?查看全文
美国联邦通信委员会(FCC)正在制定措施禁止进口中国制造的光收发模块。光收发模块让数据在数据中心内以光速通过光纤传输。美国政府官员希望这项措施在年内公布和生效。其目的是防止中国公司窃取数据、植入恶意软件或干扰美国数据中心的服务。FCC 也可能修改或搁置这项进口禁令。美国对中国数据中心设备的禁令可能会冲击中际旭创。中际旭创是全球最大的光收发模块供应商之一。禁令也可能增加亚马逊 AWS 等美国云计算公司的成本,迫使它们转向本国供应商如 Coherent 和 Lumentum。
中国创新药研发快速发展,带动实验猴需求激增、价格接近翻倍,而这造成的供应紧张可能拖慢新药试验进度。今年 6 月一家国家级实验室以每只17.8 万的价格采购 40 只食蟹猴,价格较一年前接近翻倍。下一代癌症疗法开发商 Excalipoint Therapeutics 联合创始人兼首席财务官朱杰伦预计,实验猴明年每只售价可能突破 20 万元,较一两年前的略高于 10 万元接近翻倍。部分药物在获准进入临床试验前,必须通过猴体试验评估安全性。灵长类动物与人类生理结构相近,可用于观察药物在体内的运行及对器官的影响。单个生物药研发项目可能需要十几只至 100 只实验猴。业内人士和分析师指出,实验猴养殖场供应总体稳定,价格上涨主要是因为生物药和下一代疗法大量涌现,导致涉及灵长类动物的试验需求远超现有承载能力。目前中国约占全球创新药研发管线的三分之一,并已成为全球临床试验的首要目的地。
Telegram 因有用户分享 CSAM(child sexual abuse material)材料而被苹果在全世界短暂下架。苹果发言人证实了此次短暂下架事件,表示苹果的审查发现该应用存在违反禁止 CSAM 材料的内容,“在开发商迅速删除相关内容并封禁发布该内容的用户后,该应用已恢复上架。”Telegram 有逾 10 亿用户,它表示对 CSAM 内容采取零容忍政策,今年已因此封禁了近 33.8 万个群组和频道。英国监管机构 Ofcom 今年四月因类似的原因对 Telegram 展开了调查。Telegram 则坚称它没有 CSAM 问题,称自 2018 年以来已通过检测算法几乎完全杜绝 CSAM 材料的公开传播。
周 1 遇到了一个问题,告诉 ai ,ai 帮我生成了差不多 1k 行代码,差不多花了 3 天时间完全搞清楚 ai 的逻辑,主要是一个分布式的问题,要考虑很多个边界情况。ai 的代码整体设计都挺好的,思路也正确。唯一一个问题就是:因为我引入的一个第三方库版本较低,缺少一些获取状态的接口,ai 为了获取状态额外引入了一些字段去处理,增加了复杂度,后来提示 ai 可以升级依赖的第三方库,ai 简化了处理逻辑。 当然理解 ai 代码的过程中,也在不停的问他 xx 作用是什么,什么场景会触发这个问题。整体感觉用 ai 理解代码还是有效率提升的,前几年没有 ai 的时候,看 raft 的实现,特别痛苦,前后估计花了 1 个月的时间才理解。 当然现在的状态确实是 review ai 代码花的时间更多,想问问大家,日常工作中,如何快速 review ai 生成的代码,有没有快速理解代码的小技巧。
我用 AI 写代码第一个产品,全部许愿完成,连服务器都没登录过。统统许愿,我用的 CLAUDE ,没有设置过什么规则,比如 agents.md ,主打就是开放思维,我是一行代码看不明白,然后为了解决这个问题,我就让 chatgpt 帮我看,帮我指出有什么问题,然后把反馈给 CLAUDE,如此反复,就成了。 经过大量的许愿,我觉得思维很重要,你能想到,他们就能给你做到,至于代码写的怎么样,其实我并不是很关心,因为达到了我的目的,chatgpt 我觉得不适合给我写代码,因为他很啰嗦,把一个问题复杂化,他可能只适合 审计? 审计这个词 我也不知道从哪里看到的,总之我说审计他就给我找问题。全部代码差不多 10 万行。 然后说下收益,以前靠广告每个月能收到 ADSENSE 的汇款,现在靠订阅,比广告划算。然后就摆烂,放在那里。 像这种网站其实对于程序员来说相当简单,但是我觉得只要有一个订阅就会有两个,就会有更多。 CLAUDE CHATGPT 现在不断升级,反而我觉得很难控制,如果让我重新开始写,我不一定能搞得出来。
最近做了一个独立的 Rice Purity Test: https://testricepurity.org/ 它面向 18+ 用户,包含 100 道原创 Yes/No 题目。答题进度和分数只保存在浏览器本地,没有账号、服务器端答案存储、分析脚本或广告脚本。结果页还提供浏览器本地的模式报告和好友挑战(只把加密分数放在 URL fragment ,不上传答案)。 我也尽量把边界写清楚:这是娱乐/自我反思工具,不是心理测量、诊断或道德评价,也与 Rice University 无关。当前支持英语、西班牙语、法语、德语、葡萄牙语、日语、韩语和简体中文。 欢迎试用,也想听听大家对隐私说明、移动端答题流程和结果分享设计的意见。
About · Help · Advertise · Blog · API · FAQ · Solana · 1741 Online Highest 6679 · Select Language 创意工作者们的社区 World is powered by solitude VERSION: 3.9.8.5 · 24ms · UTC 16:15 · PVG 00:15 · LAX 09:15 · JFK 12:15♥ Do have faith in what you're doing.
感觉现在是大概的底部区域了,想屯一些币 大概在未来 1-2 年的走势会怎么样,现在屯能挣钱吗? 我现在已经屯了一些币:ETH,SOL,HYPE,SUI,MON,OKB 各位大佬怎么看?
持有$v2ex,给 V2EX 加池子,获得 token,这个会不会成为 V2EX 的价格发现的波轮呀,赶紧冲一下
大家好!我是来自瑞士的独立开发者。先说明:我不会中文 — 这篇帖子是在 AI 帮助下写的,应用的中文界面也是。如果有翻译不自然的地方,欢迎指出(或直接提 PR)。我会用英文回复,请见谅 🙏 我做了 Imference Desktop:一个本地优先的 AI 绘图桌面应用。做它的原因很简单:我想要一个不用折腾 ComfyUI 节点图、不用配置 Python 环境的工具 — 下载、打开、出图。 特点: 一键安装:应用自动安装隔离的推理引擎(不碰系统 Python),自动检测 GPU,按需启停 — 无需终端,无需折腾 CUDA 本地生成,每张 $0:支持 7 大模型家族(SDXL 、SD 1.5 、Z-Image 、FLUX 、Chroma 、Qwen-Image 、Anima),提示词和图片不会离开你的电脑 模型开箱即用:从内置目录选一个模型直接生成 — 权重自动下载,步数/CFG/分辨率/质量标签都已预调好,第一张图就是对的 支持自带模型:直接加载本地 .safetensors(比如从 Civitai 或 LiblibAI 下载的),原地使用,不复制不上传 8GB 显存流畅运行 SDXL,理论上 4GB 也能跑(欢迎实测反馈!);FLUX 、Qwen-Image 等大模型按显存自动 offload / 量化 支持 Windows 和 macOS,界面已完整汉化 没有 GPU 或想跑更大的模型?同一界面可切换云端生成 — 无需注册,按次付费 代码完全开源:https://github.com/Publikey/imference-desktop 中文说明:https://github.com/Publikey/imference-desktop/blob/main/README.zh-CN.md 推理引擎不是新代码 — 它就是我的 SaaS 产品在生产环境 GPU 集群上跑的那套 worker,搬到了消费级硬件。 关于中文翻译的幕后故事,我写了一篇博客:我把应用翻译成了中文,但我不会中文 — 有趣的是,校对翻译的过程还发现了英文版一直存在的一个 UI bug 。 欢迎试用和反馈!
家附近这个点,带倒车影像的价位低到高如图: 想体验特斯拉,但看评论夏天这款好像只能跑 200km ; A6L 之前开过确实舒服,但是租一个豪车还是有点虚; A7L 每天多个 20 块左右。
各位想问下,现在在墙内网络环境,新注册 uber 乘客帐号的时候是不是不能科学上网? 我使用电脑网页端的 uber 官网,用邮箱新注册了一个帐号,发过来的一次性密码登录成功,之后绑定了+86 的手机号,并且设置了长期密码,之后在手机上的 app 登录(使用邮箱+密码),登录之后提示我“Account Locked”,继续把网页 log out 再 log in ,结果也“Account Locked”了。 在电脑网页端,用了第二个邮箱再次注册,这次没绑手机号,相同现象,同样的 log out 之后再次 log in 就 出现“Account Locked”。 最后在手机端 app ,用第三个邮箱注册、一次性密码登录,并且设置了长期密码,这次没有“Account Locked”,电脑网页端和手机 app 都正常登录了。 第 3 次唯一不同的地方,就是把科学上网给关闭了。 这里还是想讨论一下,是不是只有这一个原因?第 3 次注册成功了,会不会有再次绑定+86 手机号就再次被“Account Locked”的风险? 这次不是私人出行,手机号尽量使用现有的+86 手机号,这个没办法了。
阿里云 7 折 腾讯云 7 折 华为云 7 折 阿里 CDN 4000U/P 腾讯 CDN 4000U/P 火山 CDN 4000U/P 谷歌云 GCP7 折 亚马逊云 AWS7 折 腾讯云国际 65 折 阿里云国际 7 折 华为云国际 7 折 AWS 全球节点 CDN 加速 1 折 3500 刀/P Ai 模型低至 4 折 火山国际 7 折 TG 详聊:@Tiangua7
有没有深度用过的最贵套餐的朋友说说 k3 用起来会排队严重、会不说人话吗
目前是苹果全家桶,考虑到有个号码要一直开着,另外出差有影音播放需求,想买个二手安卓手机,希望能满足以下要求 c 口能接 type-c 转 HDMI ,这样出差的时候可以连到酒店电视上放下载好的剧集 希望性能能跟得上,经常会下载一些 4K 的剧集 对品牌、屏幕这些没啥要求,反正也不经常用 感谢
曾回帖都说千万不要入 Kimi ,Codex 20x 满额后,忍不住再次补了个顶配 Allegro 。 再次,“上当”。 慢 ➕ 额度少。 PS:网页版做个 PPT 还是可以的。(唯一有用的)
鏖战大 A 科技,7 月份陆陆续续补仓,仓位越搞越重。今天结束还亏个 20%。 然后就是每天开盘的时候每隔几分钟看一看盘,收盘了还要各个论坛看看消息。 特别影响上班。 要慢慢减一下仓位了!
如题,各位大佬
免费下载: https://github.com/libcr/crScrcpy/releases crScrcpy 是 C++开发的跨平台应用来控制你的 android 设备 基于源代码 chromium 150.0.7871.91 和 最新版本的 scrcpy-server 4.1 1. 使用 chromium Views UI 框架设计跨平台应用界面,提供平台一致且优秀的性能表现 2. android 设备视频渲染通过 chromium/media 核心模块实现了 GPU 加速,支持 H265/H264 的硬解 3. 支持 android 设备群组管理,支持鼠标同步操作,方便管理多台设备 4. 支持对多台设备录像
大家应该也有过这种经历吧:AI 一下子输出一大堆东西,结果根本看不懂。 最近在阅读一个不太熟悉的代码分支时,我对比了一下找维护者询问代码逻辑和找 AI 询问代码逻辑的体验。感觉两者最大的不同在于: 问真人的时候,自己需要持续跟上对方说话的思路。如果哪里跟不上了,可以随时打断并提问。等听不懂的部分解释清楚、双方思路重新对齐之后,再继续往下讲,所以最后通常能够听懂。 问 AI 的时候,AI 往往会一次输出一大堆乱七八糟的东西。可能从第二段开始就已经听不懂了,但又没有机会及时打断。思路从一开始就没有对齐(毕竟人类很难对齐 AI 的思路吧!),结果就是越往后看越看不懂。 所以我在想,如果 AI 也能像真人一样,一步一步地解释,每讲完一部分就确认一下有没有理解,再继续往下,效果是不是会好很多? 目前我感觉比较可行的,好像只有 OpenAI 或者 A/ 的语音功能了。
https://github.com/learning233/opencode_mobile 想玩玩的话,可以看下 github 介绍,里面有预览图,以及服务器搭建流程、安装包。 代码写的差不多了,然后让 deepseek flash 介入的,在原基础上进行了四十多次提交,改了点 bug ,补了一些边缘情况,使用了 opencode-go 7% 的月额度。 他改完我还没测过!! 选中单条线路让他去找 bug 还凑合,如果提示词只有一句“去找 bug”,等他找完再发一句“确定你找的这些都是 bug 吗?”,大概有 30%-40% 会在第二轮被否定。
内购已经编辑好,但下面的提交以供审核按钮一直无法点击? AI 说不用管了,但我总觉得不太对。有没有老哥知道是哪里设置有问题? 界面上也没找能关联内购的选项,是不是因为我第一次提交 app 和内购有这个问题?
- 禁止为纯理论、低概率的边界情况增加兜底逻辑。例外:用户明确要求,或涉及数据损坏、资源泄漏、安全问题。 假如不加这一条,AI 会习惯把各种极端假设情况都考虑到,写长长的防御性代码占满你的屏幕 这种代码撸棒性拉满,但是对人类来说阅读维护成本更高,不符合开发效率优先的现状
先说说我的基本情况: 渠道:giffgaff 官网申请的 eSIM eSIM 申请时间:2026 年 6 月 17 日 封号情况:截止今天( 8 月 5 号)一直都没收到封号邮件,不过出了这档子事情也不敢继续用了 我的退款历程大家可以参考一下: 这张就是我的申诉记录,红框中的两次也就是今天是成功的: 接下来我说说具体的步骤: 申请前先完成携号转网,今天我是先转网到了 VOXI 后再申请的(今天刚转网成功,然后我就立马申请 VOXI 退款了,VOXI 有在线客服聊天,所以很快就通过申请了) 需要注意申请时间,头几次我都是白天申请的,每次都是到了晚上 19:00 左右回复我,当然回复都是统一的拒绝模版(我猜测应该不是真人回复),今天下午我申请了,然后果然 18:55 的时候拒绝了我,然后我再使用相同的话术一模一样的再申请一次,结果就成功了,邮件的内容不同了,知道了客服的名称叫 Juline ,所以申请的时候应该在 19:00 后申请遇到真人的可能性比较大 剩下的步骤可以参考下面这个视频的 4:37 开始的内容 英国 giffgaff 卡真的 GG 封号了,保号退款自救保姆级教程|先别急着携号转网! 我的操作跟这个视频基本上是一模一样的,文案也是,我把我用的文案也放在下面吧 Hello,I recently topped up my giffgaff eSIM with £10 credit. However, I have now ported my number out to another network and no longer need the giffgaff service. I haven't used any of the credit, so I would like to request a full refund of the remaining balance to the original payment method.Could you please help me process the refund? Thank you. 以下是申诉地址,我知道的有两个应该效果都差不多 https://support2.giffgaff.com/app/ask https://support2.giffgaff.com/app/question 我不确定已经被封号的人是否也可以这样退款成功,没封号的 V 友可以参考我的步骤试试。 附上我的退款成功邮件,希望各位 V 友也都可以退款成功,如果提交了一次被拒了不要放弃,可以再次申请新的,只要人工看到了大概率是会给退的(我猜的 XD )
比如发一份 task ,在规定时间内完成,出什么题或者有什么办法防止高端 AI 直接 ac ?
TcpTun 是一款轻量、无广告免登录的 Android VPN 与透明代理客户端,支持多配置管理、二维码导入、智能分流、IPv4/IPv6 、TCP/UDP 转发及完善的连接诊断,让网络连接更灵活、稳定、易管理。 加入群: https://groups.google.com/g/tcptun-testers 测试: https://play.google.com/apps/testing/com.tcptun.client Promotion code: ZVY4M5A32VD09QSC6A4R26M 370M1E4DPYGXYBKJWVC9AXQ LQ50PJ11VGKZLU2HF9U6PE3 AGH8YMXPVLL2L39C1H5G5MS JEFLBKALM4DAEE4STKH7RJ9 VEYKYJF5XVCWRKLEAP2SLZA WXL3L9HWV7P64PUP29C5DTA ZLXF0ZL5TLU7PYGWJFMK2YP 30ZRJPAL5PWUQ5UST7GQCB6 T4RT05M77W3DGH0SLNYC6QR KEVCSZ027TN5FATFDP9Z5QJ 5031UNLQ44QSMEJL7R5JALY 83EBDHZXHXB2X8SVA9XU8KL 4NMVARXD1L6XCWSG83YA2K2 3WSFZ3ENHG2SAF9GTDPZNZA X6MWN1S48FGX2PSRT6QVYPB 0JLDS67UUHDSMM4JZMKBBTQ SPYM96UC8WJMFBFC9CRT3H5 DKU0Y3R5CG3BWT3Y2G57ZC7 DJP4KPQ5HM7ECGM75D8Q7X0
https://picui.ogmua.cn/s1/2026/08/05/6a72d7adb77bb.webp 搜 [停车小智] 目前主要是武汉有数据,其他地方的数据各位可以小程序里提交、推荐。
订阅 chatgpt plus 和 claude pro 有蛮久了,我 vibe 的应用先说 3 个吧,都是 mac 平台的: 又一款菜单栏的系统运行占用显示面板 swift ,支持显示 cpu 、gpu 、电池温度、高温提醒、电量、保持唤醒、进程 cpu&gpu&内存占用查看、杀进程、端口占用查看等功能。 一开始需求就是希望能在菜单栏查看进程和端口占用,然后杀进程,后面慢慢又引入了其它乱七八糟的功能,但总体还是保持了视觉上的简洁和克制,没有追求 atoll 和 vorssaint 那样做到 all in one ,这俩现在越来越复杂了,atoll 我都卸载了,换了另一个 here island 。 又一个 easytier gui rust+swift ,视觉上原生更好看,支持一次输入密码,开机启动自动组网,用的 cloudflarwe workers 搭建的个人共享节点做 p2p ,这样在外面随时可以 termux 访问 mac ,哪怕 mac 重启后,不用怕忘了。 一款手游的自动化助手 maafw+maafw-go+mxu ( tauri ),用来解放双手的,这么多年靠手打太累了。 以上均是自用,后续都会开源的,实现过程也没少参考其它开源实现 ai 真好用啊,以前没时间搞的,现在交给 ai ,真的很方便,当然,一想到每个月这么多大洋交出去了,实际早就可以买个买断制很好用的产品了(比如最近买了 launchos 就很丝滑),但还是觉得有些应用 diy 更适合自己
之前尝试过各种本地大模型识别日语字幕,但是准确率都不够满意,尤其是时间轴很混乱,没法正常用。 时隔数月,突然想到,时间轴如果是确定的,那把音频切割开来,一句一句识别,加上 Codex 根据本地识别结果和中文翻译再联网 review ,可能可行。 本地用 whipser-v3 做初步识别,置信度低的找 whisper-v2 再次识别,随后让 Codex 对有争议的结果进行判断和联网查询。最后仍然会有个别结果不确定需要人工确认,但一集动漫一般就几句。 之所以要这么做是因为一些动漫只有精确的中文字幕,但网上公开的日语字幕,例如 jimaku.cc 下载的,不太符合中国人的使用习惯,经常将 2 句合并到一起,而且有不少内部换行。 另外,Bang Dream 的第二季和第三季我没找到任何日语字幕,中文字幕是有的,利用这个我今天制作了几集双语字幕,准确率接近 100%了。 所以大家可以考虑用这个方法复活自己喜欢的动漫的日语字幕了,大部分动漫还是有外挂中文字幕的。
If most software will soon be built by machines, the job of software engineers will change: from writing software to The post Every software company will become a dev tools company appeared first on The New Stack.
Identity-aware AI Gateway is now in open beta. User Insights turns that traffic into a behavioral baseline for every person and agent, and flags insider risk the moment it appears.
At Cloudflare, we knew we could not depend on every employee to configure every agent perfectly or watch every tool call. Before expanding write access across our own internal MCP servers, we built WriteGuard. We are now bringing those controls to Cloudflare MCP server portals through a private beta.
The Agent Access Model proposes a new architecture to secure task-scoped agents using strict identity brokering, continuous mediation, and stateful trust.
We built Cloudflare OS to equip our teams to safely rethink how they get work done with AI. The platform brings together the best of our technologies, from our Compute primitives to our Zero Trust suite. This post walks through our journey to give our users the best AI tools available.
WindBorne Systems has raised $37 million Series B round to scale its weather balloons and AI forecasts.
Mitti Labs plans to expand beyond India and enter the Philippines and Indonesia while growing its carbon credits and agricultural data business.
River plans to build a new factory, launch additional models from 2027, and target profitability as it scales production.
Robinhood's latest financial instrument intends to let any retail investor feel like they, too, can make money by backing Y Combinator startups.
MacPaw is building a local version of its AI assistant Eney using Liquid AI's models.
As streamers compete with social media giants for viewer attention, Disney+ is partnering with TikTok to bring creator content to its app.