首页 > 传媒 > 关键词  > OpenAI最新资讯  > 正文

成都汇阳投资关于Sora 正式上线,多模态模型的里程碑

2024-12-16 14:40 · 稿源: 站长之家用户

 事 件

  12 月 10 日,OpenAl正式上线 Sora,并向包括美国在内的多数国家用户开放,用户可在OpenAI官网上体验Sora。同时,Sora 被包含在ChatGPT Plus 和ChatGPT Pro 的会员订阅方案中, 用户无需额外付费。 其中,订阅Plus方案的用户可使用 Sora 生成最多 50 个分辨率达720p、时长为 5 秒的高 级视频而Pro方案能生成最多 500 个分辨率达1080p、时长为 20 秒的高 级视频,并且提供去水印功能。

新 Sora 视频再创作能力大幅提升

 相较于 OpenAI2 月份发布的版本, 此次上线的新 Sora 新增 Storyboard、Remix、Re-cut 等功能 ,视频再创作能力大幅提升 ,并且优化了视频生成速度及生成方式。新 Sora 的新功能包括 1)Storyboard:类似于电影里的分镜,即用户只需借助文字设计几段视频帧或直接上传图片作为静态视频帧, 并在视频帧之间预留一些时间供Sora 发挥,Sora 便能自动把这些视频帧串联起来形成一段完整的视频:2)Remix:通过不同的文字描述对视频中的元素进行替换、删除或重构, 比如可以把图书馆变成宇宙飞船:3)Re-cut:智能识别并剪切出视频中的最 佳帧,并将其导入 Storyboard 中 ,拓展该视频帧:4)Loop:用于创建无限循环的视频:5)Blend:将两个视频无合并为一个视频:6)Style presets:为视频预设风格 , 比如黑白电影、纸片人等。 此外,借助 Sora Turbo,新Sora 的视频生成速度显著提升, 同时,新 Sora 将视频生成方式扩展为文/文+图/文+视频生成视频。

 国内企业开始加速研发并选代A I 视频生成产品

 今年以来 , 国内企业开始加速研发并选代 AI 视频生成产品 ,产品能力不断提升 ,应用场景持续拓宽。1)今年 6 月,快手 AI 团 队发布可灵 AI 视频生成大模型 ,可生成长达 2 分钟 、分辨率达 1080p 的视频 ,可灵 AI 主要功能包括文生视频 、 图生视频 、 视频续写等;2)今年 7 月 ,智谱 AI 上线视频生成产品智谱清影 ,并在 11 月 进行全新升级 ,支持生成时长为 10 秒的 4K 超高清视频 ,除常规的文生视频和图生视频功能外 ,智谱清影引 入 CogSound 模型 , 可以对为 生成的视频添加背景音乐:3)今年 8 月 , 字节推出即梦 AI 一站式创作平台, 随后在 11 月 宣布即梦 AI 两大视频模型 S2.0 Pro 和 P2.0 Pro 正式全量上线,其中, S2.0Pro 在图生视频场景具有较高的首一致性,能够保持视频与用户输入图像的 色彩 、 风格等保持一致 ,P2.0Pro 具有极 高提示词遵循能力, 能够在一句提示词内实现多个镜头切换及多镜头组合, 同时保持视频内形象主体、 风格和氛围的一致性 。此外 ,Minimax、 阿里云等初创企业及大模型厂商也在布局 AI 视频生成赛道, 整体来看,视频生成工具今年以来, 国内企业开始加速研发并选代 AI 视频生成产品,产品能力不断提升 ,应用场景持续拓宽 。 1)今年 6 月 ,快手 AI 团队发布可灵 AI 视频生成大模型, 可生成长达 2 分钟、分辨率达 1080p 的视频,可灵 AI 主要功能包括文生视频、 图生视频、 视频续写等;2)今年  7 月,智谱AI 上线视频生成产品智谱清影 ,并在11 月进行全新升级 ,支持生成时长为 10 秒的 4K 超高清视频 , 除常规的文生视频和图生视频功能外,智谱清影引 入 CogSound 模型 , 可以对为生成的视频添加背景音乐:3)今年 8 月, 字节推出即梦AI 一站式创作平台, 随后在 11 月宣布即梦 AI 两大视频模型 S2.0 Pro 和 P2.0 Pro 正式全量上线 , 其中 ,S2.0Pro 在图生视频场景具有较高的首一致性 , 能够保持视频与用户输入图像的色彩 、 风格等保持一致 ,P2.0Pro 具有极 高提示词遵循能力, 能够在一句提示词内实现多个镜头切换及多镜头组合 , 同时保持视频内形象主体、风格和氛围的一致性。此外 ,Minimax、 阿里云等初创企业及大模型厂商也在布局 AI 视频生成赛道 , 整体来看 ,视频生成工具的能力不断提升 , 未来有望渗透更多应用场景。

相关公司

 三六零 (601360) : 目前 360 搜索是中国搜索引擎的 Top2 , 市场份额为 35%,公司的人工智能研究院从 2020 年开始一直在包括类 ChatGPT 技术在内的 AIGC 技术上有持续性的投入 ,但截至目前仅作为内部业务自用的生产力工具使用 ,且投资规模及技术水平与当前的 ChatGPT3 相比还有较大差距 , 各项技术指标只能做到略强于 ChatGPT2 。 由于训练数据源及应用方向的原因 ,在中文环境下的实际效果强于 ChatGPT2 。360 在数据资源端有丰富的多模态大数据积累和相关语料 、尤其是中文语料 ,相较于国外同行落后的是预训练大模型和有效的多模态数据清洗与融合技术 。公司有充足的资金储备可用于购买大规模算力 ,在继续深入自行研发的同时 ,不排除寻找强有力的合作伙伴 , 以开放的心态搭建多方共享平台 、补足短板 ,快速缩小差距 。公司也计划尽快推出类 ChatGPT 技 术的 demo 版产品 。

 中科曙光 (603019):伴随宁夏 “ 算力交 易平台 ” 的上线 , “ 东数西算 ” 工程迎来重要里程碑 。 2 月 24 日 ,由宁夏回族自治区联合中科曙光 、中国电信宁夏公司 、北京国际大数据交易所等打造的国内头个一体化算力交易调度平台——东数西算一体化算力服务平台正式上线 。该平台上线后将整合宁夏地区零散算力资源 ,解决算力输出、应用 、交易等难题 ,赋能宁夏“ 六新六 特 ”等产业数字转型升级。

 参考资料:20241212- 山西证券-计算机行业点评: Sora正式上线, 多模态模型的里程碑

 免责声明:以上信息出自汇阳研究部,内容不做具体操作指导,客户亦不应将其作为投资决策的唯 一参考因素。据此买入,责任自负,股市有风险,投资需谨慎。

推广

特别声明:以上内容(如有图片或视频亦包括在内)均为站长传媒平台用户上传并发布,本平台仅提供信息存储服务,对本页面内容所引致的错误、不确或遗漏,概不负任何法律责任,相关信息仅供参考。站长之家将尽力确保所提供信息的准确性及可靠性,但不保证有关资料的准确性及可靠性,读者在使用前请进一步核实,并对任何自主决定的行为负责。任何单位或个人认为本页面内容可能涉嫌侵犯其知识产权或存在不实内容时,可及时向站长之家提出书面权利通知或不实情况说明,并提供身份证明、权属证明及详细侵权或不实情况证明(点击查看反馈联系地址)。本网站在收到上述法律文件后,将会依法依规核实信息,沟通删除相关内容或断开相关链接。

  • 相关推荐
  • 可灵AI发布全新2.0模型上线多模态视频编辑功能

    快科技4月16日消息,据报道,可灵AI在北京举行灵感成真”2.0模型发布会,正式发布可灵2.0视频生成模型及可图2.0图像生成模型。据介绍,可灵2.0模型在动态质量、语义响应、画面美学等维度保持领先;可图2.0模型在指令遵循、电影质感及艺术风格表现等方面显著提升。3月27日,全球AI基准测试机构Artificial Analysis发布了最新的全球视频生成大模型榜单,快手可灵1.6pro(高品质模

  • 成都投资关于镁供需或进入持续性紧平衡状态

    本文介绍了镁元素的基本特性、资源分布及产业发展情况。镁是轻质银白色金属,具有延展性,化学性质活泼,在地壳中含量丰富。中国镁资源储量占全球70%,主要分布在菱镁矿、白云石矿和盐湖资源中。全球镁产业呈现高度集中态势,中国原镁产量占全球92%。近年来,中国镁行业通过环保政策推动产业结构优化,集中度提升。宝武镁业作为行业龙头,拥有完整产业链;星源卓镁专注于镁合金压铸技术研发。预计2024-2027年全球原镁供需将维持紧平衡状态,行业进入良性扩张周期。

  • 多模态和Agent成为大厂AI的新赛 点

    这是《窄播Weekly》的第52期,本期我们关注的商业动态是:当大厂的AI竞争策略开始倾斜向应用场景,多模态能力和代理执行成为两个焦点。大模型落地C端场景的核心,就是让大模型的能力越来越接近人。沿着这个主旋律,可以划分出两个进化方向:一个是持续降低用户与大模型进行有效沟通的难度;另一个则是让大模型具备执行更复杂任务的能力。前者的实现,需要给到大模型多

  • 多模态和Agent成为大厂AI的新赛点

    本期《窄播Weekly》聚焦AI大厂竞争策略向应用场景倾斜的趋势,重点分析了多模态能力和代理执行两大发展方向。文章指出,大模型落地的核心在于让人机交互更自然,具体表现为:1)通过多模态技术降低用户使用门槛,如阿里夸克新推出的"拍照问夸克"功能;2)通过代理执行提升复杂任务处理能力,如字节、百度等推出的通用Agent产品。国内外厂商路径差异明显:国�

  • 1000万上下文!新开源多模态大模型,单个GPU就能运行

    今年2月初,谷歌发布的Gemini2.0Pro支持200万上下文,震惊了整个大模型领域。仅过了2个月,Meta最新开源的Llama4Scout就将上下文扩展至1000万,整整提升了5倍开启千万级时代。根据实验数据显示,Llama4Behemoth在MMLUPro、GPQA、MATH-500等测试的数据比GPT-4.5、ClaudeSonnet3.7、Gemini2.0Pro更好。

  • 开源即支持!基于昇腾MindSpeed MM玩转InternVL3多模态理解最新模型

    多模态理解领域当前已成了各家AI大模型公司“军备竞赛”的关键点之一,国内外知名AI大模型公司都争相通过发布最先进的多模态大语言模型展现其在多模态理解领域的前沿能力。近期,上海AI实验室推出了其最新的多模态大语言模型InternVL3 系列,相比上一代InternVL2. 5 模型,该模型展现出卓越的多模态感知和推理能力,同时进一步扩展了其工具使用、GUI代理、工业图像分析等

  • 刚刚,商汤发布第六代大模型:6000亿参数多模态MoE,中长视频直接可推理

    现在的国产AI应用,一口气看好几分钟的视频,都可以直接做推理和解析了!瞧~只需“喂”上一段柯南片段,AI就摇身一变成“名侦探”做剖析:它会对整个视频的内容先做一个总结,再按照秒级,对视频片段做内容上的推演。商汤科技联合创始人杨帆认为:银河通用合伙人、大模型负责人张直政表示:除此之外,上海交通大学副教授闫维新对这个问题的看法是:总言之,商汤作为国�

  • 紫东太初多模态RAG全新发布:端到端问答准确率提升33%

    在产业智能化进程中,如何高效融合企业专有知识资产,构建领域专属认知引擎,是企业迈向智能决策与高效运营的关键。然而,传统检索增强生成(RAG)技术受限于语言单模态处理能力,仅能实现文本知识库与文本查询之间的浅层理解,难以满足复杂业务场景的需求,在实际应用中暴露出两大缺陷:信息表征缺失:忽略知识库中多模态富文档的视觉语义信息,如版面结构、图表关�

  • UniToken:多模态AI的“全能选手”,一次编码搞定图文理解与图像生成

    复旦大学与美团研究者提出UniToken框架,首次在统一模型中实现图文理解与生成任务的"双优表现"。该方案融合连续和离散视觉编码,有效解决了传统多模态建模中的"任务干扰"和"表示割裂"问题。通过三阶段训练策略(视觉语义对齐、多任务联合训练、指令强化微调),UniToken在多个基准测试中性能超越专用模型。其创新性体现在:1)统一的双边视觉编码

  • 《数码宝贝:源码》预约已突破1000万,里程碑福利升级加码!

    《数码宝贝:源码》手游由东映动画正版授权,万代南梦宫与恺英网络联合开发。游戏预约量突破1000万,远超原定800万目标。玩家预注册可获得专属头像框、钻石等福利,公测PV即将发布。游戏采用PBR写实风格与动态粒子引擎,还原经典数码宝贝形象和多样场景。取消传统抽卡模式,采用数码蛋孵化形式,通过地图探索免费获取。游戏包含策略战斗、钓鱼采集等丰富玩法,4月25日正式上线。