2025年4月第3周AI资讯

今天,我再为大家分享几组重要的人工智能新闻:

一、DeepSite

这是一个基于Deepseek V3 0324模型的AI编程工具,由Nginx打造并托管在Hugging Face。用户仅需输入描述,即可生成完整应用或游戏代码,并直接在浏览器中运行和托管。也就是说,你无需编程基础,也可通过中文描述生成代码。只需在左侧对话框中输入一行简单的提示词,我们就可以复刻Flappy Bird小游戏,点击开始按钮即可正常游戏。

二、TTT-MLP

近期,英伟达、斯坦福大学和加州大学联合推出了一个名为Test Time Training的全新架构,有望替代当前主流的Transformer架构。根据最新的论文,测试者将TTT层添加到预先训练好的Transformer中并进行微调,就可以生成具有强时间一致性、长达1分钟的动画片。TTT能够解决Transformers架构无法生成长视频的难题。

从测试结果可以看出,尽管存在违影和不连续的情况,也是一项重大的技术革新。本段演示动画基于猫和老鼠的预训练数据集生成,能够根据提示词合成全新的故事。

三、AC-Talker

这是腾讯新发布的图像开口说话项目,能够通过音频表情驱动,生成自然完美口型匹配的视频。该工具可用于合成开口说话、唱歌的视频。大家可以预览一下效果。

此外,AC-Talker还可以根据用户提供的参考动作,完成超真实的表情迁移。

四、VIGGLE

本周,VIGGLE推出了升级版模型,可以通过语音或文本提示词结合动作源合成一段视频。目前,该功能已经可以在网页端、移动端使用。登录到VIGGLE,分别上传图像和音频,选择一个动作序列,点击生成按钮即可。

五、GEN-4 Turbo

本周,Runway宣布推出GEN-4 Turbo模型Runway 表示, Gen-4 Turbo是Runway迄今为止最强大的视频模型生成视频的最快方式。使用 Gen-4 Turbo,用户只需 30 秒即可生成 10 秒的视频,非常适合快速迭代和创意探索。现在已在所有计划中推出。

六、Nova Reel 1.1

本周,亚马逊对之前发布的Nova Reel模型进行了升级,并推出了1.1版本,最长支持生成持续两分钟的视频。Nova Reel 1.1引入了一种名为Multi-shot Manual的模式,可以结合图像和提示词生成视频,为用户提供了更多的控制权。目前Nova Reel仅通过AWS平台提供。该模型最多支持输入4,000字符的提示词,且能够生成720p分辨率的视频。

七、即梦3.0

本周,字节正式推出了seeddream3.0图像生成模型,目前已经可以在即梦使用。seeddream 3.0在中文渲染能力方面有了大幅提升,生成图像的速度也远超GPT-4o。我们可以借助该模型生成图文并茂的海报,文字渲染也非常精准。免费用户每天可获得固定的额度,每次可生成一组4张图像。从多组测试可以看出,seeddream 3.0能够准确渲染中英文,效果非常出色。

除了生成广告海报,我们还可以轻松生成包含文字和人像的超真实场景,然后使用图像生视频功能,还可以将图像动态化,生成一段5秒钟的视频。输入同样的提示词到GPT-4o,则无法生成对应的图像。

八、Gemini Live

本周,Gemini Live已经可以在安卓端使用,且能够读取屏幕通过语音和人们互动。

这篇文章有 122 个评论

发表回复