00:00近期AI进展及OKA相关事项 本文梳理了近期AI进展的情况,重点介绍了OKA相关的事项。其中包括ChatGPT的文本转语音功能、OKI发布的boys engine模型以及与新选公司的合作。文章还提到了OS案件、口型转口型技术和AI科技资讯的发布。 章节速览 00:00近期AI进展及OKA相关事项 本文梳理了近期AI进展的情况,重点介绍了OKA相关的事项。其中包括ChatGPT的文本转语音功能、OKI发布的boys engine模型以及与新选公司的合作。文章还提到了OS案件、口型转口型技术和AI科技资讯的发布。最后,文章简要讨论了微软在算力投资方面的激进态度。 04:38微软公费AI计划stargate星际之门 微软公费AI计划stargate星际之门启动,成本高达1150亿美元。计划采用以太网互联技术,可能采用GPT6训练基础设施。GPT store分成机制细则逐渐公布,开发者可获得高达1000美元每月的分成。 08:16 SARA的算力测算及模型参数分析 本文介绍了针对SARA技术的算力测算方法及其训练过程中的参数设定。通过参考DIT论文和压缩率八倍的假设,我们得出了SARA一分钟生成视频所需的算力和训练数据范围。与DITXL等模型相比,SARA在生成视频时具有更高的算力需求。 14:09 AI视频推理算力需求及影响因素分析 该对话片段讨论了AI视频推理所需的算力范围和影响因素。根据推理视频的分钟数和渗透率,计算出所需的算力数量。对于H100显卡来说,推理1个小时只能推理5分钟的视频,所以需要大约89张H100显卡。然而,实际情况下,算力利用率很难达到百分之百,且短视频的访问量具有波峰和波谷的特点,因此所需的算力数量会更高。此外,对于模型的选择和开源生态的发展也会影响算力需求。目前,AI模型仍然是首选,而拉玛模型在开源生态中受到广泛使用,并且随着版本的更新,其算力需求也会增加。 20:01模型发展趋势及开源模型参数量对比 本文介绍了长文本模型的发展趋势以及多个开源模型的参数量和架构,包括千问、data breaks、DBRX、jn等模型。其中,jn模型使用了曼巴架构和ME架构,并结合了全former等技术。另外,还提到了星辰的step模型和grocer一代模型,以及国内模型厂商中较少达到万亿参数级别的模型。 27:58 AI模型glock参数量大但性能不如之前 glock的参数量较大,但性能不如之前的模型。XAI发布了block 1.5模型,迭代速度较快。微软收购了inflection团队,加强自身AI实力。云厂商在模型方面进行自研和合作,提供API服务。红杉认为AI应用迭代周期越来越快,生成式AI收入已达30亿美元。 32:26 AI领域的重要趋势和进展 该对话片段涉及到吴文达和AK在AI领域的分享和观点。吴文达分享了关于智能体和AGI实现的重要性,并提到了通过智能体流程可以增强模型的能力。AK则讨论了模型架构的重要性以及算力方面的限制。此外,还提到了苹果与谷歌就模型使用进行商谈的情况。整体而言,对于AI领域的趋势和进展,智能体、模型架构和算力是值得关注的三个主要方面。 Q&A 近期AI进展中,有哪些与OKA相关的重大事件? OKA最近发布了一款名为boys engine的模型,该模型由OKI官方于3月29日宣布,虽然没有透露具体架构及定价信息。尽管如此,该模型已经与多家公司合作,包括教育系列、AI视频制作以及非营利组织等。 boys engine模型的工作原理是什么?是否有厂商与boys engine模型进行了合作? boys engine模型接受纯文本输入并能够模仿用户的声音,以语音方式读出文本内容。用户只需提供15秒左右的语音样衣,模型就能学会该用户的语音特点,并据此转换为语音输出。与boys engine模型合作的厂商之一是新选,他们是一家华人创立的公司,以其视频技术而闻名。新选最近发布了更新版本,不仅支持中文语音合成,还允许用户共享声音,这在一定程度上解决了之前口型同步技术对用户动作限制的问题。 微软推出的AI计划“stargate星际之门”有何特点? 微软的“stargate星际之门”计划旨在研发新一代AI芯片,计划在数据中心中配置数百万个服务器芯片,并采用以太网进行互联,以减少对英伟达GPU卡的依赖。该计划的投资成本高达1150亿美元,旨在提升算力以支持GPT5等下一代AI模型的训练。 GPT store的分成机制是如何运作的? GPT store的分成机制是根据开发者在GPT store内的排名、用户访问量和调查结果等因素进行分配,起步价为每月1000美元,随着用户量增加,分成金额也会相应提高。目前,该机制在美国地区进行试点,具体细则正在逐步完善中。 sara的算力测算方法和基准是什么? 在关于sara算力的介绍中,首先提到的是mesi s参与的测算。由于sara的技术细节如模型参数、训练数据等并不明确,因此在测算时主要依据DIT架构进行,特别参考了DITXL模型,其参数量约为6.75亿,对应的浮点运算次数约为10的21次方。以此为基础,通过设定生成视频的视频帧数和压缩率(假定压缩8倍),并考虑训练数据量和参数量的影响(DIT作者锚定的数据量约为30个B点,参数量增加30倍),最终得出了训 练骚扰所需算力的下限和上限范围。 训练骚扰所需算力的计算方法是怎样的? 训练骚扰所需算力的计算基于训练数据的token数量、参数量和训练所需时间等因素。首先,根据DIT论文提供的压缩率(假设为8倍),将原始图像压缩至潜在空间(latent space)中的180帧图像进行计算。其次,将参数量增加30倍,并假设训练数据量为DIT数据量的4到10倍之间进行调整。最后,结合视频帧数和潜在空间帧数,将训练所需的数据量和算力乘以训练时间得出训练骚扰所需算力的下限和上限范围。 推理阶段的算力需求如何估算? 推理阶段的算力需求同样基于一分钟视频作为基本单位,通过参考DIT的推理算力情况,随着视频分钟数的增加,推理算力以线性方式增长。当视频生成量超过某一临界点时,推理所需的算力范围将扩大。例如,当推理骚扰视频的数量超过1500到3800分钟时,推理所需算力会出现显著增加。同时,通过将推理算力转换到特定硬件(如H100或H110)上,可以估算一台设备在不同时间段内能够推理多少分钟的骚扰视频,从而对未来的推理需求进行较为细致的预测。 Youtube每天AI视频的渗透率和预计上传量是多少? 在Youtube上,由于视频较长且使用场景较多,AI视频的渗透率为15%。按照现有数据,每天大约有几百万分钟的视频上传至Youtube。如果按此渗透率估算,每天使用AI技术制作的视频时长约为1070万分钟。如果假设每个AI视频只能使用一小时(120分钟),则理论上每天需要约8.9万个H100 GPU来完成这些任务。 AI视频实际所需的算力是否能够达到理想状态? AI视频的实际所需算力很难达到理想状态,例如在训练模型时,算力利用率通常达不到100%,因此理想情况下的8.9万个H100 GPU可能还需要乘以一个数,以考虑到实际的算力利用率。此外,AI视频的访问量并非24小时保持平滑,有波峰波谷之分,所以实际所需算力可能还要再乘以一个系数。同时,视频生成过程中可能不止生成一个视频,进一步增加了算力需求。 大模型厂商的估值情况如何? 根据CBN size的数据,可以推算出主要大模型厂商的估值。例如,OPI的估值约为18倍左右,Anthropic的估值约为21倍不到。这些公司的收入情况良好,但目前尚未实现盈利,以技术为主导。调研结果显示,企业普遍倾向于选择AI模型,尤其是旅游VAI作为基准,Google模型能够达到OpenAI六成的水平,SO则为三成多,而开源模型如LLAMA也受到广泛关注。 长文本处理模型的发展趋势及其应用实例? 长文本处理模型是一个重要发展趋势,尽管普通用户感知不明显。例如,GP4、rock杠1等模型已采用Moe架构进行改进,国内的千问1.5也从稠密架构转为Moe架构,并在推理时只激活其中一小部分参数,提高了效率。此外,data breaks开源的DBRX模型同样采用Moe架构,参数量虽大但专家数相对较少,且在特定算力条件下取得了接近或超过GPT-3.5的表现。 相较于其他开源模型,DBRX模型在性能上处于什么水平? DBRX模型在性能上表现不俗,与开源模型如llama two、group one one相比,基本都能达到SOTA水平。与GPT-3.5相比,虽然参数量超过一千亿,但在分值上略逊于GPT-3.5。相较于去年发布的Google模型1.0 pro,DBRX在分值上基本相当。因此,相较于GPT-3.5和Google模型1.0pro,DBRX在性能上具有一定竞争力。 AIA one提出的jn模型有何特点及其优势? AIA one提出的jn模型采用不同于Transformer架构的Memba架构,该架构基于状态空间模型,相较于Transformer模型,它在扩展上下文长度时,复杂度以线性而非平方级增长,因此在处理长上下文任务时具有显著优势,能有效降低算力需求,并且推理速度也更快。 MandB模型能否在短期内替代传统架构?MandB模型的技术构成和性能如何? 目前看来,尽管MandB模型技术上混搭了许多先进技术,但由于从论文到实际生产应用需要时间,短时间内完全替代传统架构较为困难。MandB模型融合了传统技术、MOD混合专家架构以及全former等技术,并拥有520亿参数和16个专家,每次运行时会随机选取四个专家进行计算。其架构类似jama ja,是MandB模型与ME和全former的结合。 星尘公司的step模型与GPT4水平相当吗?XAI grocer一代模型的性能如何? 星尘公司发布的万亿参数的step模型,在万亿级别参数上与GPT4处于相近水平。不过,该模型目前仍处于预览阶段,尚未公开使用。XAIgrocer一代模型在2022年发布,参数量达到三千多亿,虽然在性能上相较于某些已有模型并不算特别优异,但仍具有一定的潜力。 Glock 1.5模型相比其他模型有何特点? Glock 1.5模型主要在数学能力和编码能力上有显著提高,在human evil测试中,其zio shot达到了74.1%,在128K上下文长度下表现良好,但在推理时仍与一些更强大的模型如GPT4有一定差距。 微软如何发展自己的模型和云平台AI服务? 微软收购了来自Google DeepMind的inflection团队,并在内部组建AI团队进行研究,同时与inflection团队合作,提供API服务,拥有独占的模型接口。 AI应用的预期进展如何? 尽管去年AI应用预期进展较快,但实际情况并未达到预期乐观,但红杉美国AI峰会上表示,由于各种模型能力不断增强,预计AI应用的迭代周期会加速。 生成式AI在一年内创造了多少收入? 在一年多的时间内,生成式AI创造了大约30亿美元的收入,其中未包括各云厂商调用API的AI收入。这一进展已经超过了上一波云化时期(SARS收入达到30亿美元)十年的时间。 智能体在AI应用中的作用是什么? 吴文达提到,智能体在实现AGI方面至关重要,通过智能体串联多个模型工具,能够显著提升整体任务处理水平。 对于AI模型架构的未来发展有何看法? AK认为,如果想要实现模型的重大突破,可能需要探索新的模型底层架构,虽然目前已有像捐吧等模型,但能否在未来取代传统架构仍不确定。 芯片出口管制对AI产业有何影响? 芯片出口管制不仅限制了高端芯片的出口,而且最近还增加了对搭在PC产品中的芯片的限制,这使得芯片限制逐渐变得更为严格。 苹果是否在考虑使用Google的jmi模型? 苹果正在与谷歌商谈,可能是因为苹果自研大模型进展不如预期,希望通过合作使用jmi模型。但目前还不清楚具体进展,需等待更多信息披露。