实时交互版的 YouTube 来了。
2000年出生的人,今年已经26岁了。
当我们再谈00后时,谈论的已经不只是在校大学生、职场新人,或者社交媒体上某种年轻人的生活方式。
他们中的一部分人,正在成为真正意义上的创业者,从组建团队、寻找融资、到面对市场,也开始试图定义下一代产品。
而AI正是这群人最集中的方向之一。

2026年7月发布的胡润百富榜单中收录了44位25岁及以下的创业者,其中榜单中的创业项目大量分布在具身智能、AI医疗、AI应用与企业服务等领域。
在这股浪潮里,出生于2003年的杨博麟就是其中一个。
在本科期间,他已经连续尝试过多个出海项目,累计实现超千万元人民币营收,其中一家最终完成退出。

年初,杨博麟与相识多年的Derek Law共同创立SigmaZ AI,作为一家专注于扩散语言模型(DLM)后训练与视觉自进化研究的模型公司,Tap8则是这套模型能力的第一个产品化尝试。
回国后几周内,该公司便快速拿到多个投资意向,目前已完成数百万美元天使轮融资,本轮投资方包括蓝驰创投、云启资本(Y Transformers首批被投企业)、德迅投资、XIAOXIAO FUND 小小基金,以及多位知名投资人跟投。
对一个还不到25岁的创始人来说,这已经是足够醒目的履历,但更值得关注的,其实是他过去几年几次产品探索背后反复出现的同一个问题,AI应该怎样根据人的状态,重新组织和呈现信息。

最早的一款基于多智能体架构的AI学习助手StudyGO,是一个AI与真人导师协作的学习平台;
学生可以使用类似NotebookLM的AI学习功能,也可以在AI无法解决问题时匹配真人导师,系统会记录学习进度、笔记与总结,再据此提供更加个性化的推荐。
根据项目Demo Day时期披露的信息,StudyGO曾与20多所英国高校学生组织建立合作,平台积累了数百名导师,12个月营收超过200万元。
从产品形态来看,StudyGO解决的还主要是匹配问题,让AI帮助学生找到更合适的内容和真人导师。随着系统开始持续记录学习进度、笔记和对话,问题也开始往前走了一步。除了找到什么内容,内容本身能不能根据一个人的学习状态发生变化。

后来的CuFlow,试图把PDF、课堂录音和课程视频变成一间会因人而变的全模态AI教室。该项目此前也完成数百万元人民币种子轮融资。
杨博麟曾观察过两千多个在线教育课时,并试图寻找好课的共同特征,他最后提出一个指标,Aha moment per minute,也就是一堂课每分钟能够制造多少次「原来如此」的理解瞬间。
CuFlow由此把自己定义为生成式AI教室。其中还有一个名为FlowNote的模块,负责持续整理用户在课堂、阅读、视频与AI对话中的学习轨迹。

做到CuFlow以后,团队面对的问题已经逐渐超出了教育本身。一堂课能够因人而变,背后的关键并不只在于课程生成,系统需要持续理解一个人正在关注什么、哪里没有理解,以及下一刻应该呈现什么信息。
当这套逻辑被继续抽象,课堂就只是其中一种载体。如果AI可以根据学生的反馈实时重组一堂课,它同样可以根据消费者的关注点重组一段产品评测,根据健身者的动作调整一段训练视频,或者根据分析师的问题重新组织一份商业报告。
这也成为了Tap8的起点,CuFlow原本围绕课堂形成的实时生成能力,开始被放到更广泛的视觉场景里。

过去所谓的互动视频,大多也是提前录制若干分支,再让观众在A与B之间选择。无论选择多少次,所有可能出现的内容其实都已经由创作者提前准备完成。
Tap8想做的是另一件事:用户做出动作后,系统根据当前场景、用户行为和已经积累的上下文,实时生成下一状态。
在AirPods演示中,用户可以直接点击视频里的耳机继续追问,系统随后生成产品信息面板、3D结构和内部爆炸图。

不同用户即使从同一段视频出发,也可以因为更关注降噪、续航、芯片或者佩戴体验,逐渐进入完全不同的探索路径。
在健身场景中,视频也不再只是播放教练做深蹲,系统可以识别人体关键点,分析动作角度,在错误位置叠加提示,并进一步展示应该怎样调整。
用户看到的将会是一个能够根据动作继续变化的视觉环境。Tap8把这种形态称为「可执行的世界」。

它的过程可以被简化为,当前场景 + 用户动作 + 上下文 → 下一场景。
当用户能够直接介入画面,并要求系统实时给出下一状态时,Tap8面对的就不再只是视觉生成的问题。
过去几年,主流视觉生成模型最擅长的一件事情,是直接生成像素,用户给出Prompt,模型最终交付一张图片或者一段视频。

这种方式已经能够生成非常真实的人物、光影、纹理和复杂场景,但画面一旦生成完成,里面的大部分东西最终都已经被压成了像素。
可以把它理解成拍一张照片,人能认出画面里有一扇门,但对于最终文件来说,那扇门只是组成画面的像素。
如果接下来想打开它、拆掉门把手,或者查看内部结构,往往需要重新生成新的画面。普通视频可以接受这样的方式,实时互动却需要画面里的东西保留更多结构。

因此,SigmaZ选择让一部分视觉内容以可执行代码存在。
a16z此前曾专门讨论过这一趋势,Karpathy也多次提到,模型的输出形式正在从纯文本和Markdown继续向HTML、SVG、JavaScript以及可交互界面扩展。
这并不意味着代码会取代像素。像素模型依然擅长人物、自然场景、复杂纹理和开放视觉,代码更适合处理文字、图表、按钮、3D结构和需要后续操作的内容。
Tap8更接近两者结合,视觉背景和开放画面可以交给生成模型,事实、结构与交互则尽可能保留为代码。
区别在于,代码把画面内部的结构保存了下来。当视觉内容逐渐承担界面、工具和交互空间的角色以后,这种可执行结构会越来越重要。
不过代码写出来以后,还有一个问题,页面可以正常运行,不代表最终视觉效果足够好。

这就是SigmaZ第二条技术路线Vision-Guided RSI,也就是视觉引导的递归式改进。
这条路线和该团队的CTO Derek Law过去几年的研究经历有很深的联系。
Derek曾长期参与Amazon Alexa和Amazon AGI相关工作,后来负责过Generative UI方向的研究与工程。

他作为核心作者参与撰写的论文《Vision-Guided Iterative Refinement for Frontend Code Generation》,被ICLR 2026 Recursive Self-Improvement Workshop接收。
它的逻辑并不复杂,一个Agent负责写代码,页面被真正渲染出来,另一个拥有视觉能力的Agent观察最终结果,并指出布局、视觉或者实现上的问题。
随后模型回到源代码继续修改,再次渲染,再次检查。这套评审标准是由跨领域专家标注持续校准,最优的生成过程会被蒸馏回模型权重。

也就是说,写代码的Agent和负责检查画面的Agent形成闭环之后,人还会持续参与校准这个闭环的评价尺度,再把校准结果反哺回模型。

剩下的另一个问题就是速度了。
如果用户点击一下耳机,系统过很久才生成内部结构,再好的画面也无法形成实时互动。这也是SigmaZ押注DLM(扩散语言模型)的原因。

传统大语言模型通常按照从左到右的顺序生成Token,一个复杂视觉场景背后可能包含大量代码,内容越长,等待时间也会不断增加。
DLM尝试并行处理多个位置。通俗一点理解,传统自回归模型更像从左上角开始,一行一行完成整张海报;扩散语言模型会先铺开整体结构,再同时完善不同区域。
SigmaZ目前正在围绕DLM搭建自己的后训练框架,并希望把这种方式用于实时视觉代码生成。

代码负责保留结构和交互,视觉反馈负责改善生成结果,DLM则进一步降低等待时间。
这些技术最终指向的,其实是一个更基础的问题,人类正在越来越难跟上AI生成信息的速度。
现在的大模型每秒能够输出越来越多的Token,Agent也开始并行处理大量任务,人类接收信息的速度却没有同步提高。

成年人静默阅读速度大约只有每秒5个Token,而当前前沿模型的输出速度已经可以达到每秒80到240个Token。即使按照比较保守的数字,一个模型和一个认真阅读的人之间,也已经出现十几倍的速度差。
如果未来一个人同时面对多个Agent,这个差距还会进一步扩大。模型越来越擅长生成信息以后,人怎样更快地理解这些信息,反而开始成为新的问题。
Tap8给出的思路,是让模型的结果不再只通过一段段文字交给用户,而可以直接变成图表、结构、动画以及能够继续操作的视觉内容。

目前SigmaZ核心团队汇聚了来自Amazon AGI、阿里AI Lab、字节AI团队和百度等公司及实验室的资深研究员和产品负责人。
通用型实时交互视频不是单点算法或者单个模型的竞争,模型架构、后训练、视觉生成、渲染链路、交互体验和推理成本都必须同时成立,任何一层太慢或者太不稳定,最终都会直接反映在产品上。
那些实验室里的资深研究员和产品负责人,选择跟着一个20出头的人,进入一个当时还没有名字的品类,这件事本身就是一种判断。

历史上每一种新媒介真正成立,都不只取决于底层技术能不能工作,还取决于它是否产生了只有这种媒介才能承载的内容。
短视频没有简单取代电影,移动互联网也没有只是把电脑网页缩小。新的媒介真正成熟以后,往往会逐渐形成自己的创作者、叙事方式、商业模式和用户习惯。
回头再看William过去几年的产品轨迹,变化最大的其实是产品载体。教育助手、生成式教室,再到实时互动视频,背后的思考一直在向更广泛的场景延伸。

到了Tap8,团队开始面对一个更普遍的矛盾,模型生成信息越来越快,人能够分配给这些信息的注意力和理解能力却没有同步增长。
他们给出的答案,是让AI直接生成一个可以看、可以点、可以继续改变的视觉世界。

这个答案最终能不能成立,现在还没有人知道。
但当模型生成信息的速度已经开始超过人类消化信息的速度以后,重新设计AI和人之间的那层界面,至少正在变成一个越来越现实的问题。