从AI教育到「能互动的视频」,这位00后拿下数百万美元融资

来源:虾蛄AI
作者:虾蛄内容部
时间:2026-08-21
2454
实时交互版的 YouTube 来了。

实时交互版的 YouTube 来了。

2000年出生的人,今年已经26岁了。

当我们再谈00后时,谈论的已经不只是在校大学生、职场新人,或者社交媒体上某种年轻人的生活方式。

他们中的一部分人,正在成为真正意义上的创业者,从组建团队、寻找融资、到面对市场,也开始试图定义下一代产品。

而AI正是这群人最集中的方向之一。

2026年7月发布的胡润百富榜单中收录了44位25岁及以下的创业者,其中榜单中的创业项目大量分布在具身智能、AI医疗、AI应用与企业服务等领域。

在这股浪潮里,出生于2003年的杨博麟就是其中一个。

在本科期间,他已经连续尝试过多个出海项目,累计实现超千万元人民币营收,其中一家最终完成退出。

年初,杨博麟与相识多年的Derek Law共同创立SigmaZ AI,作为一家专注于扩散语言模型(DLM)后训练与视觉自进化研究的模型公司,Tap8则是这套模型能力的第一个产品化尝试。

回国后几周内,该公司便快速拿到多个投资意向,目前已完成数百万美元天使轮融资,本轮投资方包括蓝驰创投、云启资本(Y Transformers首批被投企业)、德迅投资、XIAOXIAO FUND 小小基金,以及多位知名投资人跟投。

对一个还不到25岁的创始人来说,这已经是足够醒目的履历,但更值得关注的,其实是他过去几年几次产品探索背后反复出现的同一个问题,AI应该怎样根据人的状态,重新组织和呈现信息。

最早的一款基于多智能体架构的AI学习助手StudyGO,是一个AI与真人导师协作的学习平台;

学生可以使用类似NotebookLM的AI学习功能,也可以在AI无法解决问题时匹配真人导师,系统会记录学习进度、笔记与总结,再据此提供更加个性化的推荐。

根据项目Demo Day时期披露的信息,StudyGO曾与20多所英国高校学生组织建立合作,平台积累了数百名导师,12个月营收超过200万元。

从产品形态来看,StudyGO解决的还主要是匹配问题,让AI帮助学生找到更合适的内容和真人导师。随着系统开始持续记录学习进度、笔记和对话,问题也开始往前走了一步。除了找到什么内容,内容本身能不能根据一个人的学习状态发生变化。

后来的CuFlow,试图把PDF、课堂录音和课程视频变成一间会因人而变的全模态AI教室。该项目此前也完成数百万元人民币种子轮融资。

杨博麟曾观察过两千多个在线教育课时,并试图寻找好课的共同特征,他最后提出一个指标,Aha moment per minute,也就是一堂课每分钟能够制造多少次「原来如此」的理解瞬间。

CuFlow由此把自己定义为生成式AI教室。其中还有一个名为FlowNote的模块,负责持续整理用户在课堂、阅读、视频与AI对话中的学习轨迹。

做到CuFlow以后,团队面对的问题已经逐渐超出了教育本身。一堂课能够因人而变,背后的关键并不只在于课程生成,系统需要持续理解一个人正在关注什么、哪里没有理解,以及下一刻应该呈现什么信息。

当这套逻辑被继续抽象,课堂就只是其中一种载体。如果AI可以根据学生的反馈实时重组一堂课,它同样可以根据消费者的关注点重组一段产品评测,根据健身者的动作调整一段训练视频,或者根据分析师的问题重新组织一份商业报告。

这也成为了Tap8的起点,CuFlow原本围绕课堂形成的实时生成能力,开始被放到更广泛的视觉场景里。

过去所谓的互动视频,大多也是提前录制若干分支,再让观众在A与B之间选择。无论选择多少次,所有可能出现的内容其实都已经由创作者提前准备完成。

Tap8想做的是另一件事:用户做出动作后,系统根据当前场景、用户行为和已经积累的上下文,实时生成下一状态。

在AirPods演示中,用户可以直接点击视频里的耳机继续追问,系统随后生成产品信息面板、3D结构和内部爆炸图。

不同用户即使从同一段视频出发,也可以因为更关注降噪、续航、芯片或者佩戴体验,逐渐进入完全不同的探索路径。

在健身场景中,视频也不再只是播放教练做深蹲,系统可以识别人体关键点,分析动作角度,在错误位置叠加提示,并进一步展示应该怎样调整。

用户看到的将会是一个能够根据动作继续变化的视觉环境。Tap8把这种形态称为「可执行的世界」。

它的过程可以被简化为,当前场景 + 用户动作 + 上下文 → 下一场景。

当用户能够直接介入画面,并要求系统实时给出下一状态时,Tap8面对的就不再只是视觉生成的问题。

过去几年,主流视觉生成模型最擅长的一件事情,是直接生成像素,用户给出Prompt,模型最终交付一张图片或者一段视频。

这种方式已经能够生成非常真实的人物、光影、纹理和复杂场景,但画面一旦生成完成,里面的大部分东西最终都已经被压成了像素。

可以把它理解成拍一张照片,人能认出画面里有一扇门,但对于最终文件来说,那扇门只是组成画面的像素。

如果接下来想打开它、拆掉门把手,或者查看内部结构,往往需要重新生成新的画面。普通视频可以接受这样的方式,实时互动却需要画面里的东西保留更多结构。

因此,SigmaZ选择让一部分视觉内容以可执行代码存在。

a16z此前曾专门讨论过这一趋势,Karpathy也多次提到,模型的输出形式正在从纯文本和Markdown继续向HTML、SVG、JavaScript以及可交互界面扩展。

这并不意味着代码会取代像素。像素模型依然擅长人物、自然场景、复杂纹理和开放视觉,代码更适合处理文字、图表、按钮、3D结构和需要后续操作的内容。

Tap8更接近两者结合,视觉背景和开放画面可以交给生成模型,事实、结构与交互则尽可能保留为代码。

区别在于,代码把画面内部的结构保存了下来。当视觉内容逐渐承担界面、工具和交互空间的角色以后,这种可执行结构会越来越重要。

不过代码写出来以后,还有一个问题,页面可以正常运行,不代表最终视觉效果足够好。

这就是SigmaZ第二条技术路线Vision-Guided RSI,也就是视觉引导的递归式改进。

这条路线和该团队的CTO Derek Law过去几年的研究经历有很深的联系。

Derek曾长期参与Amazon Alexa和Amazon AGI相关工作,后来负责过Generative UI方向的研究与工程。

他作为核心作者参与撰写的论文《Vision-Guided Iterative Refinement for Frontend Code Generation》,被ICLR 2026 Recursive Self-Improvement Workshop接收。

它的逻辑并不复杂,一个Agent负责写代码,页面被真正渲染出来,另一个拥有视觉能力的Agent观察最终结果,并指出布局、视觉或者实现上的问题。

随后模型回到源代码继续修改,再次渲染,再次检查。这套评审标准是由跨领域专家标注持续校准,最优的生成过程会被蒸馏回模型权重。

也就是说,写代码的Agent和负责检查画面的Agent形成闭环之后,人还会持续参与校准这个闭环的评价尺度,再把校准结果反哺回模型。

剩下的另一个问题就是速度了。

如果用户点击一下耳机,系统过很久才生成内部结构,再好的画面也无法形成实时互动。这也是SigmaZ押注DLM(扩散语言模型)的原因。

传统大语言模型通常按照从左到右的顺序生成Token,一个复杂视觉场景背后可能包含大量代码,内容越长,等待时间也会不断增加。

DLM尝试并行处理多个位置。通俗一点理解,传统自回归模型更像从左上角开始,一行一行完成整张海报;扩散语言模型会先铺开整体结构,再同时完善不同区域。

SigmaZ目前正在围绕DLM搭建自己的后训练框架,并希望把这种方式用于实时视觉代码生成。

代码负责保留结构和交互,视觉反馈负责改善生成结果,DLM则进一步降低等待时间。

这些技术最终指向的,其实是一个更基础的问题,人类正在越来越难跟上AI生成信息的速度。

现在的大模型每秒能够输出越来越多的Token,Agent也开始并行处理大量任务,人类接收信息的速度却没有同步提高。

成年人静默阅读速度大约只有每秒5个Token,而当前前沿模型的输出速度已经可以达到每秒80到240个Token。即使按照比较保守的数字,一个模型和一个认真阅读的人之间,也已经出现十几倍的速度差。

如果未来一个人同时面对多个Agent,这个差距还会进一步扩大。模型越来越擅长生成信息以后,人怎样更快地理解这些信息,反而开始成为新的问题。

Tap8给出的思路,是让模型的结果不再只通过一段段文字交给用户,而可以直接变成图表、结构、动画以及能够继续操作的视觉内容。

目前SigmaZ核心团队汇聚了来自Amazon AGI、阿里AI Lab、字节AI团队和百度等公司及实验室的资深研究员和产品负责人。

通用型实时交互视频不是单点算法或者单个模型的竞争,模型架构、后训练、视觉生成、渲染链路、交互体验和推理成本都必须同时成立,任何一层太慢或者太不稳定,最终都会直接反映在产品上。

那些实验室里的资深研究员和产品负责人,选择跟着一个20出头的人,进入一个当时还没有名字的品类,这件事本身就是一种判断。

历史上每一种新媒介真正成立,都不只取决于底层技术能不能工作,还取决于它是否产生了只有这种媒介才能承载的内容。

短视频没有简单取代电影,移动互联网也没有只是把电脑网页缩小。新的媒介真正成熟以后,往往会逐渐形成自己的创作者、叙事方式、商业模式和用户习惯。

回头再看William过去几年的产品轨迹,变化最大的其实是产品载体。教育助手、生成式教室,再到实时互动视频,背后的思考一直在向更广泛的场景延伸。

到了Tap8,团队开始面对一个更普遍的矛盾,模型生成信息越来越快,人能够分配给这些信息的注意力和理解能力却没有同步增长。

他们给出的答案,是让AI直接生成一个可以看、可以点、可以继续改变的视觉世界。

这个答案最终能不能成立,现在还没有人知道。

但当模型生成信息的速度已经开始超过人类消化信息的速度以后,重新设计AI和人之间的那层界面,至少正在变成一个越来越现实的问题。

原文链接:点击前往 >
版权说明:本文内容来自于虾蛄AI,本站不拥有所有权,不承担相关法律责任。文章内容系作者个人观点,不代表快出海对观点赞同或支持。如有侵权,请联系管理员(zzx@kchuhai.com)删除!
相关文章
2026年2月中国出海手游排行与增长榜
2026年2月中国出海手游排行与增长榜
2月出海手游收入榜单前4名与1月一致,《Gossip Harbor?: Merge & Story》再度蝉联冠军,《Whiteout Survival》紧随其后位列第2名;《心动小镇》首次入围出海榜;《Tasty Travels: Merge Game》出海收入再创新高,首次进入出海榜前10;《明日方舟:终末地》继1月新入榜后排名继续攀升至第10名;《崩坏:星穹铁道》与《偶像梦幻祭2》重回榜单。本期榜单中,二次元产品共计11款。
游戏排行榜
2026-03-09
狂赚50亿、连续8个月霸榜,这款SLG交出了上线一年的答卷
狂赚50亿、连续8个月霸榜,这款SLG交出了上线一年的答卷
《Kingshot》在游戏玩法上,并没有颠覆性的创新,甚至被不少人诟病为“抄袭”“换皮”“挂羊头卖狗肉”。但是仔细看下来会发现《Kingshot》并不简单,有着三层洋葱式设计:外层是吸引眼球的塔防RPG,中层是承接与过渡的模拟经营,内核则是驱动长期留存的SLG。
游戏市场
游戏设计
2026-02-25
一群大佬“组局”做射击,首日在线近10万却挨喷,火速更新口碑逆转?
一群大佬“组局”做射击,首日在线近10万却挨喷,火速更新口碑逆转?
本以为这游戏可能就这样“泯然众人”了,结果Wildlight Entertainment展现出了相当的韧性和抗压能力。游戏周二上线开始积累用户评价,到周六就立马更新了5V5模式,一周之内更是推了三次更新,算是快速对玩家的反馈做了专项优化。
游戏运营
2026-02-04
V社射击模式创新,新英雄的推出也成为热度引爆点
V社射击模式创新,新英雄的推出也成为热度引爆点
在MOBA射击赛道竞争日趋白热化的当下, Valve这款低调打磨近两年的新作《Deadlock》,终于凭借一场重磅更新打破沉寂。
游戏设计
2026-02-03
扫码关注
获取更多出海资讯的相关信息
热门活动
更多
个人VIP
小程序
快出海小程序
公众号
快出海公众号
商务合作
商务合作
投稿采访
投稿采访
出海管家
出海管家