首页 > 业界 > 关键词  > Gemini最新资讯  > 正文

今日AI:Gemini Pro1.5向所有人开放;Stable Diffusion核心团队集体离职;HeyGen5.0上线视频翻译功能;剪映内测视频翻译功能

2024-03-22 16:02 · 稿源:站长之家

欢迎来到【今日AI】栏目!这里是你每天探索人工智能世界的指南,每天我们为你呈现AI领域的热点内容,聚焦开发者,助你洞悉技术趋势、了解创新AI产品应用。

新鲜AI产品点击了解https://top.aibase.com/

QQ截图20240322161437.png

🤖📱💼AI应用

Gemini Pro1.5及其百万上下文功能现已向所有人开放

QQ截图20240322154001.png

【AiBase提要:】

⭐ Gemini Pro1.5加入视频模态的长上下文功能,AI可以处理更复杂的视频内容。

⭐ 博主体验Gemini Pro1.5后表示,描述准确且清晰,展示强大处理能力。

⭐ Gemini Pro1.5百万上下文功能的开放将推动AI领域发展,为用户带来更丰富体验。

体验地址:https://top.aibase.com/tool/google-ai-studio

Suno正式发布V3音乐生成模型 所有人都可用

image.png

【AiBase提要:】

⭐ 音质得到显著提升,带来更清晰动听音频体验。

⭐ V3提供更丰富音乐风格选择,满足不同需求。

⭐ 用户指令响应显著改进,确保音乐结尾流畅自然。

官网地址:https://top.aibase.com/tool/suno-ai

剪映内测视频翻译功能仅限移动端体验

【AiBase提要:】

🚀剪映推出全新视频翻译功能,进一步巩固其领先地位。

📱内测仅限移动端体验,审批速度较快,可在短时间获得资格

🔒视频翻译功能仅支持用户本人视频,需声音认证。

内测申请地址:https://bytedance.larkoffice.com/share/base/form/shrcnq7rM9EEJytIW5LKyUpVaee

HeyGen发布5.0版本上线实时数字人聊天和视频翻译功能

QQ截图20240322100113.png

【AiBase提要:】

⭐全新用户界面设计,更容易找到想要使用的功能

⭐引入全新视频编辑工作室,编辑更加灵活

⭐上线实时数字人聊天功能,视频翻译等功能

产品入口:https://top.aibase.com/tool/heygen-5-0

零一万物API开放 多模态中文图表体验超越GPT-4V

【AiBase提要:】

⭐️ 零一万物API正式开放,包含三款强大模型,支持通用聊天、多文档阅读理解等功能。

⭐️ 多模态模型Yi-VL-Plus中文图表体验超越GPT-4V,支持图表识别、信息提取、问答和推理。

⭐️ Yi-34B-Chat-200K模型开放,准确率高达99.8%,用于长文本理解、小说内容总结和论文要点提取。

地址:https://platform.lingyiwanwu.com/playground

视频转视频框架AnyV2V 可修改源视频主题、风格等

QQ截图20240322150433.png

【AiBase提要:】

⭐️ 支持对源视频进行深度修改,加入文本提示、主题或风格

⭐️ 核心目标是简化视频编辑为两个步骤

⭐️ 整合各种图像编辑工具,实现新视频生成外观和动作与原视频保持一致

论文地址:https://arxiv.org/html/2403.14468v1#S6

MIT研究员推新AI图片生成框架DMD:AI 单步生成高质量图像 速度快30倍

image.png

【AiBase提要:】

⭐️ MIT研究人员开发了比传统扩散模型快30倍的单步AI图像生成器,质量仍高。

⭐️ 新方法结合了教师 - 学生模型,通过匹配蒸馏实现单步图像生成。

⭐️ 框架加速了图像生成,潜在益处涉及设计工具、药物发现和3D建模等领域。

论文网址:https://arxiv.org/abs/2311.18828

微软NaturalSpeech语音合成推出第三代 生成语音更自然了

【AiBase提要:】

⭐️ NaturalSpeech3采用属性分解扩散模型和数据/模型扩展,提高语音合成质量和自然度

⭐️ FACodec和属性分解扩散模型是NaturalSpeech3的关键技术

⭐️ NaturalSpeech3在语音质量、相似性、韵律和可懂度方面超越了现有TTS系统

论文:https://arxiv.org/abs/2403.03100

Demo 演示: https://speechresearch.github.io/naturalspeech3

📰🤖📢AI新鲜事

开源AI掌机01Light爆火,让远程操控电脑变得触手可及

image.png

【AiBase提要:】

⭐01Light能够识别屏幕内容学习用户习惯,提供个性化需求满足。

⭐ 用户按下按钮讲话,01Light思考回应需求,实现远程语音控制电脑操作。

⭐ 完全开源的01Light能提高工作效率,节省时间,随时随地操控电脑。

官网:https://top.aibase.com/tool/01-light

项目地址:https://github.com/OpenInterpreter/01

Stable Diffusion核心团队集体离职 AI巨头Stability AI面临财务危机

【AiBase提要:】

⭐️ Stable Diffusion核心团队集体离职,引发科技界广泛关注。

⭐️ Stability AI可能因财务困境挑战,团队领导离职名单中。

⭐️ Stable Diffusion项目开源成功,但给公司商业模式带来挑战。

百度5款大模型上新,更小更便宜!还可1分钟零代码打造Agent应用

image.png

【AiBase提要】

⭐ 做一个“英语作文批改小帮手”应用,只需在AppBuilder中输入应用名称或功能,平台即可生成应用。

⭐ 百度推出5款大模型,轻量化、性价比更高,适用于各种场景下的Agent应用。

⭐ 千帆AppBuilder升级,支持一键分发到多个主流渠道,加入新的基础组件如向量数据库VDB1.0。

产品入口:https://top.aibase.com/tool/baiduzhinengyunqianfanappbuilder

微软将以6.5亿美元收购Inflection AI 获得后者大模型的使用权

【AiBase提要:】

⭐ 微软同意支付6.5亿美元收购Inflection AI,获取大模型使用权。

⭐ 微软将雇佣Inflection AI大部分员工,包括联合创始人。

⭐ Inflection-2.5是Inflection最新人工智能模型,性能接近GPT-4。

中国首部AI全流程微短剧《中国神话》启播 央视频AI频道上线

【AiBase提要:】

🎬 央视频推出全流程AI微短剧《中国神话》,六集展现经典神话故事。

📺 央视频AI频道正式上线,推动视听产业创新升级。

🤖 AI技术应用助力央视频推动中国传媒业发展。

月入25万,批量AI美女,收割中年男人的钱包

图片

【AiBase提要:】

⭐ 中年男人愿意花钱,AI美女们抓住了这一商机。

⭐ AI美女主播以低单价产品吸引中老年男性用户,通过带货视频获利丰厚,受欢迎程度高。

⭐ AI带货产业链庞大,但也存在虚假宣传和维权问题。

案例:https://www.chinaz.com/2024/0322/1605183.shtml

————

今日Midjourney提示词:淘宝服装模特

2_1711094141451_ai2023_A_beautiful_Chinese_female_model_wearing_round_framed_gl_d73a8207-946d-4c83-9eb6-648463f7d7b5.png

图源备注:图片由AI生成,图片授权服务商Midjourney

A beautiful Chinese female model wearing round framed glasses, with a delicate Asian face, wearing a light gray linen short sleeved shirt and Short pants, Japanese style shirt ,hands in pockets, front view, and a beige background,full bodyshot, Studio lighting, soho, shot on Canon EOS5D Mark IV ,8k --ar3:4--v6.0

举报

  • 相关推荐
  • 同是Mini LED,为何RGB-Mini LED是高端电视首选?

    本文对比高端电视RGB-Mini LED与SQD-Mini LED技术:RGB-Mini LED采用三原色光源,在色彩准细匀、硬件防蓝光、低能耗长寿命上全面占优;SQD-Mini LED仅为量子点改良。海信作为开创者市占率领先,推荐其UX、E8S、E5S Pro三款不同价位产品,选购应认准RGB-Mini LED主流技术。

  • 三星首款AI眼镜Galaxy Glasses发布 搭载Gemini

    三星在今晚的发布会上正式揭晓了其首款AI智能眼镜——Galaxy Glasses,标志着这家消费电子巨头正式入局AI可穿戴设备赛道。该产品由三星联合谷歌、Gentle Monster和Warby Parker三方共同研发,运行Android XR系统,并原生深度集成了谷歌Gemini多模态大模型,定位为一款全天候免提视觉智能助理。 与市面上多数AR眼镜不同,Galaxy Glasses没有搭载传统显示屏,而是采用贴近日常光学眼镜的�

  • 三星首款AI眼镜!Galaxy Glasses正式亮相:内置Gemini

    三星在今晚的发布会上正式揭晓首款AI智能眼镜Galaxy Glasses。 这款设备由三星联合谷歌、Gentle Monster、Warby Parker三方联合研发,运行Android XR系统,原生深度集成谷歌Gemini多模态大模型,打造全天候免提视觉智能助理。 整机采用贴近日常光学镜的轻薄外观,整机重量仅50克左右,没有搭载传统AR显示屏,依靠镜框两侧高清摄像头捕捉实景画面,将视觉信息同步传输至Gemini完成识�

  • 终于要换代!苹果HomePod mini 2今秋有望亮相:升级Siri AI芯片

    距离HomePod mini于2020年首次亮相已近六年,苹果迟迟未对这款小音箱进行更新,但最新消息显示,第二代HomePod mini即将发布,预计最快将在今年秋季亮相。 此前有传闻称HomePod mini 2会更早面世,但苹果据称在等待新一代Siri的完善,导致其发布节奏延迟。 事实上,包括新款HomePod mini、新Apple TV 4K、全尺寸HomePod以及苹果智能家居显示屏在内的多款产品,均曾曝出因苹果AI研发进度�

  • AI日报:MiniMax发布Music3音乐模型;百度GenFlow官宣中文名“库库AI”;智谱发布 GLM-5.3

    MiniMax发布Music3,可生成5分钟歌曲;百度GenFlow定名库库AI,月活破亿;智谱GLM-5.3后训练提升编程并开源;OpenAI推电脑历史功能;谷歌Gemini 3.7 Flash编码升级降价50%;App Store现AI假截图刷分应用;DeepSeek V4 Pro上线硅基流动,百万上下文低价;京东七鲜首发24小时无人咖啡店。

  • 三千档首搭RGB-Mini LED!华为Vision智慧屏 6 SE RGB正式发售

    华为Vision智慧屏 6 SE RGB正式发售,提供55、65、75共三个尺寸,售价3599元起,成为行业首款三千档RGB-MiniLED电视。在此之前,RGB-MiniLED这套原色背光方案长期只出现在万元级旗舰电视,三千档主流家用档位一直存在明显的技术断层。很多普通家庭想体验更真实、通透的观影画面,要么需要加大购机预算,要么妥协选择普通MiniLED机型,在日常观影里忍受画面发灰、色彩饱和度不足�

  • OPPO Watch X3Mini 新增粉黛海配色,8月14日开售

    OPPO Watch X3Mini 今天官宣了新配色粉黛海,8月14日正式开售。这款手表今年4月发布,原本有高光金、星光银、摩卡棕三种配色,18K 金精钢表壳,1799元起售,新配色预计沿用同样的价格体系。 手表搭载的高精度腕温传感器是它的特色功能,精度正负0.1摄氏度,可以根据手腕温度变化捕捉女性生理期,帮用户更早、更准地掌握周期。它还首发生理周期运动指导,综合睡眠、HRV 和�

  • 同为Mini LED,为什么业内人都看好RGB-Mini LED电视?

    文章对比SQD-Mini LED与RGB-Mini LED技术:前者靠蓝光激发量子点,存在色彩冲淡、有害蓝光占比高、功耗发热大;后者红绿蓝独立发光,实现原生真彩、硬件低蓝光护眼、低功耗和长久色稳。推荐海信UX旗舰、E8S+ Pro影游旗舰、E5S+ Pro高性价比等RGB机型。选购应结合观看习惯,平衡色彩、护眼与长期成本。

  • AI日报:谷歌发布 Gemini 3.6 Flash;小红书大模型IMO满分夺金;腾讯Miora AI创意平台全量上线

    谷歌发布Gemini 3.6 Flash等三款轻量级新模型,强化效率并降低Token消耗。小红书大模型在IMO数学奥赛满分夺冠,展现顶级推理实力。Anthropic更新Claude Code,首度支持iOS模拟器。腾讯Miora AI平台上线,主打风格统一的全链路服务。Suno遭数据泄露,波及5530万用户,暴露训练数据来源问题。此外,腾讯调整AI架构,GitMind推出多模态思维导图,OpenAI在ChatGPT中开启广告服务测试。

  • MiniMax H3视频模型正式开源:全模态理解输入,最高生成2K 视频

    MiniMax 今日正式开源新一代通用视频模型 MiniMax H3,这款模型被定位为通用型全模态生成系统,能够统一理解由文本、图像、视频和音频构成的多模态上下文,并生成最高2K 分辨率、最长15秒、带原生立体声音频的视频内容。 得益于以任务泛化为导向的系统设计,H3在预训练阶段便具备了广泛的多模态上下文理解与生成能力,官方称其能够出色地遵循复杂的多模态指令。输出规�

今日大家都在搜的词: