首页 > 业界 > 关键词  > SDXL最新资讯  > 正文

AI视野:Stability.ai开源SDXL Turbo;Pika Labs1.0版发布;字节跳动ChitChop在海外上线;Keras3.0正式发布;法院判决AI生成图片具备版权

2023-11-29 15:39 · 稿源:站长之家

🤖📱💼AI应用

Stability.ai发布开源文生图模型SDXL Turbo

文生成图AI平台Stability.ai发布开源SDXL Turbo,图像生成实时响应,仅需1秒。SDXL Turbo基于全新对抗扩散蒸馏技术(ADD),将生成步骤减至1-4步,保持高质量。性能测试显示,SDXL Turbo在1步骤击败LCM-XL的4步骤和SDXL的50步骤。虽有局限,只能用于学术研究,生成512x512固定像素图片,但技术突破可助中小企业低成本应用。

image.png

开源地址:https://github.com/Stability-AI/generative-models

在线体验地址:https://clipdrop.co/stable-diffusion-turbo

论文地址:https://stability.ai/s/adversarial_diffusion_distillation.pdf

【AiBase提要:】

🚀 SDXL Turbo发布:Stability.ai宣布开源SDXL Turbo,实现文生成图实时响应,1秒生成图片。

🌐 技术突破:基于对抗扩散蒸馏技术,SDXL Turbo将生成步骤从50减至1-4步,保持高图像质量。

💼 应用范围:虽局限于学术研究,SDXL Turbo技术突破可助中小企业以低成本进行图像生成应用。

Pika Labs1.0版发布

AI初创公司Pika Labs正式发布了其令人印象深刻的AI视频生成器的1.0版本,为视频创作带来了全新的体验。

image.png

Pika Labs体验网址:https://top.aibase.com/tool/pika-labs

【AiBase提要:】

Pika Labs发布1.0版AI视频生成器,支持多种风格视频创作。

Pika Labs成功融资5500万美元,由知名投资者领投。

Pika Labs1.0支持用户上传视频二次生成和编辑,而且还能局部编辑视频内容

字节跳动ChitChop在海外上线

字节跳动推出的大模型产品“ChitChop”在海外上线,由POLIGON开发和运营,提供多达200+的智能机器人服务,支持创作、工作、AI画画、娱乐、AI学习和生活等六大场景,具备语音输入和文件分析功能。

微信截图_20231129152102.png

【AiBase提要:】

🤖 ChitChop是字节跳动的人工智能助理工具,提供200+智能机器人服务。

🖋️ 产品支持创作、工作、AI画画、娱乐、AI学习和生活等六大场景。

🎙️ ChitChop具备语音输入功能,能自动识别语音内容,并可进行文件分析和讨论。

📰🤖📢AI新鲜事

OpenAI介入调查:GPT-4在编写代码上偷懒

GPT-4最新版本因偷懒不愿编写完整代码,用户抱怨频出,引起广泛关注和调查。

【AiBase提要:】

😞 GPT-4最新版本存在编写代码懒惰的问题,用户反映在实际需求中难以得到满足。

🤖 用户反馈GPT-4在解释问题上花费过多时间,而不提供实际可运行代码,引发不满。

🔍 OpenAI已介入调查,并表示将借助用户提供的例子加以改进。

法院判决AI生成图片具备版权

北京互联网法院首次就AI生成图片领域著作权侵权案作出一审判决,认定AI生成的图片具备独创性和智力投入,应受著作权法保护,为该领域著作权保护树立了重要判例。

【AiBase提要:】

🤖法院首次确认AI生成图片具备独创性和智力投入,应受著作权法保护。

🧠在创作过程中,法院强调智力投入主要来自人而非人工智能模型。

🖼️判决对涉案图片的智力成果、独创性、作品性质及著作权归属等进行详细解释,对AI生成图片领域著作权保护具有重要意义。

vivo S18系列将首批搭载蓝心AI大模型

vivo宣布S18系列将成为首批采用AI大模型技术的手机,搭载自研蓝心大模型,参数量级涵盖十亿、百亿、千亿。S18将采用骁龙7Gen3处理器,而S18Pro升级为天玑9200处理器。

【AiBase提要:】

🚀 技术领先: vivo S18系列引领潮流,首批搭载覆盖十亿至千亿参数级别的蓝心AI大模型技术。

💡 卓越配置: S18搭载骁龙7Gen3处理器,曲面屏、超光感人像镜头,而S18Pro升级至天玑9200,支持Wi-Fi7等先进配置。

🌐 全面布局: vivo不仅在硬件上创新,还推出了蓝心小V助理和蓝心千询APP,拓展了基于AI大模型的应用场景。

谷歌搜索展示AI生成图片替代了真实照片

最新报道指出,谷歌搜索结果中以色列传奇歌手卡玛卡维沃·奥莱的照片实际上是由人工智能生成的,引发了对搜索准确性的担忧。

【AiBase提要:】

🔍 谷歌搜索显示卡玛卡维沃·奥莱的照片实为AI生成,替代了真实照片。

🤖 谷歌表示正在改进Knowledge Panels,但对问题尚未解决。

🌐 网页指责Google对AI生成的虚假信息回应不足,呼吁公司解决问题。

亚马逊宣布推出新的人工智能芯片Trainium2

亚马逊AWS推出新的人工智能芯片「Trainium2」,旨在构建和运行AI应用程序,同时深化与英伟达的合作,提供对Nvidia最新芯片的访问。

【AiBase提要:】

🚀 双管齐下策略: 亚马逊计划推出Trainium2人工智能芯片,同时提供对Nvidia最新芯片的访问,以满足不断增长的AI应用需求。

💡 性能提升: Trainium2芯片将使AI模型性能提高四倍,为公司如OpenAI、Databricks等提供更强大的训练工具。

🌐 多元选择: 亚马逊强调其云计算服务AWS的多元选择,包括Graviton4处理器和Nvidia GPU,以满足客户对成本效益高的云服务的需求。

一男子用AI工具洗稿竞争对手文章 “窃取”数百万的页面浏览量

人工智能生成工具在SEO领域引发争议,Content Growth创始人通过AI文本生成器成功窃取360万流量,引发用户质疑和道德担忧。

【AiBase提要:】

🔄 互联网时代,强大的文本生成器如ChatGPT颠覆传统SEO,引发人工智能生成内容浪潮。

🤨 Content Growth创始人通过AI文本生成器实施SEO“抢劫”,引发用户强烈愤怒和道德质疑。

🤔 使用Byword等人工智能生成器清洗现有内容,可能欺骗搜索引擎,呼吁对人工智能内容进行监管和审查。

麻省理工学院推GenSim项目:利用大语言模型编写机器人新任务

麻省理工学院的“GenSim”项目利用大型语言模型如GPT-4,通过自动生成新任务或详细说明所需行为的每个步骤,扩大了机器人可以接受培训的仿真任务范围,为机器人学习提供更广泛的模拟任务。

【AiBase提要:】

🌐 MIT CSAIL的“GenSim”项目通过大型语言模型生成新任务或详细说明机器人行为步骤,拓展了机器人在仿真任务中的培训范围。

🤖 GenSim系统具有目标导向和探索两种模式,利用LLM生成任务描述和行为代码,成功训练机械臂执行新任务,如高速放置彩色积木。

💡 经过人类预训练后,GenSim自动生成了100种新行为,相比手动编写任务的基准测试,展示了在构思新型机器人活动方面的潜力。

亚马逊推出AI聊天机器人Amazon Q

亚马逊在re:Invent大会上发布了面向AWS客户的AI聊天机器人「Amazon Q」,可提供广泛的解决方案和操作建议,涵盖业务智能、编程和配置等多个领域。

【AiBase提要:】

🤖 Amazon Q是面向AWS客户的聊天机器人,起始价格每用户每年20美元,能回答广泛问题。

🔗 可连接到各应用程序,学习企业各方面信息,生成内容,提供可视化选项。

🔐 重视隐私,Q仅返回用户有权查看信息,管理员可控制和过滤答案。

🤖📈💻💡大模型动态

北大提出Chat-UniVi视觉语言大模型

Chat-UniVi是由北大和中山大学研究者提出的统一视觉语言大模型,在短短三天训练内获得130亿参数,通过动态视觉token和密度峰聚类算法实现统一视觉表征,在多任务中表现卓越。

image.png

项目地址:https://github.com/PKU-YuanGroup/Chat-UniVi

【AiBase提要:】

🌐 模型简介: Chat-UniVi是北大和中山大学研究者提出的视觉语言大模型,仅需三天训练即可获得130亿参数,实现统一的视觉表征。

🚀 核心方法: 采用动态视觉token和密度峰聚类算法,大幅减少视觉token数量,提高模型性能,在多任务中超越其他大型模型。

📈 实验成果: Chat-UniVi在图片、视频理解以及问答任务中表现卓越,使用更少的视觉token达到与其他大模型相媲美的性能水平,并开源了代码、数据集和模型权重。

新加坡国立大学开源多模态语言模型 NExT-GPT

新加坡国立大学发布的开源多模态语言模型 NExT-GPT,通过处理文本、图像、视频和音频等多样化输入,推动了多媒体人工智能应用的发展,为开发者提供强大支持。

【AiBase提要:】

🌐 多模态能力: NExT-GPT 提供强大的多模态语言模型,能处理文本、图像、视频和音频,拓展了人工智能应用领域。

🧠 架构与训练: 采用三层架构,包括线性投影、Vicuna LLM 核心和模态特定的转换层,通过 MosIT 技术进行中间层训练,降低训练成本。

🌟 开源贡献: NExT-GPT 的开源使研究者和开发者能够创建能够无缝集成文本、图像、视频和音频的应用,为多媒体人工智能应用提供了重要贡献。

研究人员发布Starling-7B:基于AI反馈的大语言模型

UC伯克利发布基于AI反馈强化学习的Starling-7B大语言模型,采用RLAIF技术,在性能上媲美GPT-3.5,通过基准测试表现出色,迈向更人性化的应用。

项目网址:https://huggingface.co/berkeley-nest/Starling-LM-7B-alpha

【AiBase提要:】

🚀 RLAIF技术介绍: Starling-7B采用了基于AI反馈的强化学习,通过优化Openchat3.5和Mistral-7B而成。

📊 性能卓越: 在基准测试中,Starling-7B表现出色,对比其他模型性能提升引人瞩目。

🔄 迈向人性化: RLAIF主要改善了模型的实用性和安全性,未来计划引入高质量的人工反馈数据,更好地满足人类需求。

👨‍💻💡🎯聚焦开发者

Keras3.0正式发布

Keras3.0发布,全面支持TensorFlow、JAX和PyTorch,进行了全新的大模型训练和部署功能引入,保持高度向后兼容性,为深度学习开发者提供更多选择和工具。

【AiBase提要:】

💡 全面支持多框架: Keras3.0全面支持TensorFlow、JAX和PyTorch,使用户可以选择在不同框架上运行Keras工作流。

💻 大模型训练和部署: 引入新的大模型训练和部署功能,支持各种预训练模型,保持高度向后兼容性,平滑过渡。

🚀 跨框架数据pipeline: Keras3.0支持跨框架数据pipeline,包括分布式API,提高在大规模数据并行和模型并行方面的效率。

中国团队开源大规模高质量图文数据集ShareGPT4V

中国团队开源了基于GPT4-Vision构建的图文数据集ShareGPT4V,训练了7B模型,涵盖120万条多样性丰富的图像-文本描述数据,在多模态性能上超越同级别模型,为多模态研究和应用提供了新的基石。

image.png

【AiBase提要:】

🌐 数据集概要: ShareGPT4V基于GPT4-Vision构建,包含120万条图像-文本描述数据,涵盖世界知识、对象属性、空间关系、艺术评价等多方面。

🚀 性能突破: 中国团队的7B模型在多模态基准测试上表现优异,超越同级别模型,为多模态研究和应用提供有力支持。

🔗开源资源: 该数据集已开源,论文地址为

https://arxiv.org/abs/2311.12793,项目地址为https://github.com/InternLM/InternLM-XComposer/tree/main/projects/ShareGPT4V

上海AI实验室、Meta联合开发开源模型 可为人体生成3D空间音频

上海AI实验室与Meta合作推出的开源模型利用头戴式麦克风和人体姿态信息,成功生成人体的3D空间音频,为虚拟环境提供关键支持。

image.png

项目地址:https://github.com/facebookresearch/SoundingBodies

【AiBase提要:】

🔍 技术突破: 上海AI实验室与Meta的开源模型通过多模态融合,解决了音源位置未知和麦克风距离音源较远等难题,成功实现了人体的3D空间音频生成。

🔒 局限性挑战: 虽然取得了技术进展,但该模型仅适用于渲染人体音,难以处理非自由音场传播环境,且计算量较大,难以在资源受限的设备上部署。

🌐 开源模型链接: 项目地址为 https://github.com/facebookresearch/SoundingBodies,为虚拟现实领域的发展提供了新的可能性,但仍需进一步优化和拓展。

Real-ESRGAN-Video:将视频清晰度提升至2K或4K

Real-ESRGAN-Video技术让用户轻松将视频清晰度提升至2K或4K,通过简化上传和选择清晰度的步骤,提供多种模型处理模式,特别适用于动画视频。测试结果显示对相对清晰的视频效果显著,为提升视频素材清晰度带来新可能。

【AiBase提要:】

🌟 清晰度提升: Real-ESRGAN-Video技术简化步骤,让用户轻松将视频清晰度提升至2K或4K。

🔄 多模型支持: 提供多种处理模式,标准模型适用于大多数视频,动画专用模型更擅长处理动画线条和颜色。

🚀 测试验证: 测试结果显示在相对清晰的视频上,提升效果显著,尤其对动画视频的效果提升更为明显。

举报

  • 相关推荐
  • 大家在看
  • AI Clone Voice Free:免费的人声克隆工具 支持多种语言和口音。

    AI 克隆声音是一项利用机器学习技术生成与特定人声相似的语音的技术。无需特殊设备,可在浏览器中快速生成高质量的克隆声音。价格分为免费基础服务和付费高级服务,提供更多的声音定制选项。

  • Hacker Search:利用Hacker News历史数据回答关于任何话题的问题

    Hacker Search是一个基于Hacker News历史数据的问答工具,它特别适用于理解HN读者对某个话题的情感,或寻找HN读者感兴趣的话题的专家见解。

  • Voxpad:AI笔记助手,快速生成讲座笔记。

    Voxpad是一款利用人工智能技术帮助用户快速生成讲座笔记的网站。它通过自动化笔记过程,节省了用户手动记录笔记的时间,同时提供了精确和详细的笔记内容,包括关键点和总结,并附有时间戳,方便用户快速定位到特定部分。此外,Voxpad支持多文件格式,具有易于使用的界面和文本编辑器,允许用户编辑和格式化笔记,以满足个性化需求。

  • Pitch Deck Generator:快速创建有说服力的演示文稿

    Pitch Deck Generator 是一个在线工具,旨在帮助用户通过其7步模板工作流程,快速创建出具有说服力的演示文稿。它从识别问题或机会到自信地提出请求,通过引导性的提示帮助用户创建清晰、简洁的演示,展示其独特的解决方案和团队。

  • AutoChat:先进的WhatsApp自动化平台,助力商业升级。

    AutoChat是一个基于云的WhatsApp自动化平台,提供强大的自动化功能,帮助企业简化运营并实现商业目标。它通过无代码聊天机器人构建器、批量消息发送、团队收件箱、GPT-4 AI聊天机器人、原生WhatsApp购物体验等功能,帮助企业提升客户服务水平,增强客户信任,并提高销售效率。

  • LegalLint:法律文件格式化和格式问题识别工具

    LegalLint 是一款专为法律领域设计的文档准备工具,旨在提高文档准备的效率和准确性。它具备以下功能:自动替换引用、插入注释块、检测和突出显示文档中的各种格式问题,如多余的空格、错位的标点或未闭合的括号。这些功能帮助法律专业人士高效地创建无误的文档,节省宝贵的时间并确保文档格式的精确性。

  • TailorLinx:个性化外联信息工具,提升回复率

    TailorLinx是一款结合AI和高级销售心理学的工具,旨在改善冷外联工作,确保与潜在客户的个性化和有效联系。它通过分析电子邮件和LinkedIn数据,包括潜在客户的行业、角色、兴趣和近期活动,来定制信息。TailorLinx利用AI驱动的技术和销售心理学来解释目标潜在客户的详细资料,使信息能够以高度个性化和相关性进行制作。TailorLinx已证明能够将回复率提高至38%。

  • Chirpley:全球首个专注于微纳米影响者的自动化市场平台

    Chirpley是一个创新的自动化、点对点、一站式影响者市场平台,专注于微纳米影响者。它通过人工智能和机器学习技术,为营销人员提供了快速有效的营销手段,并通过一键营销炸弹(1-click marketing bomb)功能,使得营销活动更加迅速和高效。Chirpley旨在解放微影响者营销的巨大盈利潜力,并通过端到端自动化、自适应、数据驱动的微影响者活动,提升营销的覆盖范围和影响力,将结果和效果提升到令人瞩目的高度。

  • helpmee.ai:AI辅助的电脑帮助,让老年人轻松掌握技术。

    helpmee.ai是一个利用AI技术为老年人提供电脑使用指导的网站。通过耐心的语音对话和屏幕共享,AI伴侣逐步引导老年人完成任何计算机任务,确保他们能够自信且独立地在数字世界中导航,支持50多种语言,全天候服务。该服务使用OpenAI的最新GPT-4o模型,提供无与伦比的准确性和理解力。

  • video-subtitle-master:批量生成视频字幕并支持多语言翻译的客户端工具

    video-subtitle-master 是一个基于之前开源项目 VideoSubtitleGenerator 开发的客户端工具,它允许用户批量为视频生成字幕,并支持将字幕翻译成不同的语言。这个工具特别适合需要对视频内容进行本地化处理的个人或团队,无论是为了教育、娱乐还是商业目的。它集成了多种翻译服务,如百度翻译、火山引擎翻译等,并优化了对 Apple Silicon 的支持,提供了快速的生成速度。

  • EngineerDraft:实时字幕生成工具

    BeMyEars 是一款实时字幕生成工具,利用本地设备完成语音识别,为听障人士和需要字幕的用户提供极致体验。其主要优点包括多语言支持、多源输入、隐私保护等。

  • 大设:AI 智能绘画平台,让文本和图片成为艺术作品。

    大设是基于 Stable Diffusion 的免费 AI 绘画网站,提供一键生成高清精绘大图、SDXL 模型教程、AI 提示词工具。背景包括清华大学研发,定位为 AI 智能绘画平台。

  • Supaclip:将视频快速转化为知识库。

    Supaclip是一个旨在帮助用户将视频内容转化为知识库的在线工具。它通过提供视频摘要、AI助手、字幕和时间戳等功能,帮助用户快速理解和导航视频内容。产品适用于内容创作者、学生、播客主持人和研究人员等,通过这些功能,用户可以增加视频的有机覆盖率、从讲座中获取最大价值、提供节目笔记、通过聊天机器人进行互动以及从访谈视频和纪录片中提取关键见解和引用。

  • Context Data:一站式企业级数据平台,专为生成式AI应用设计

    Context Data是一个为生成式AI应用设计的数据处理和转换平台,旨在帮助AI团队构建数据基础设施,以便他们专注于构建AI逻辑。它提供了无需设置基础设施、跨多个源转换数据、连接多个模型、加载数据到主要向量数据库、查询私有向量数据、定时管道以及构建数据和ETL管道等功能。Context Data强调数据隐私控制,避免了将数据上传到OpenAI等外部模型,简化了构建AI就绪数据平台的压力和复杂性。

  • World of Gami:AI驱动的Trello替代品,让团队任务保持最新。

    World of Gami是一个利用AI技术简化任务管理的网站,它将日常任务转化为令人兴奋的挑战,使项目管理不仅是必需的,而且是团队工作流程中令人愉悦和有益的一部分。通过将传统任务列表或看板转变为生动和竞争性的游戏,每个用户可以创建自己的'船',使用Scrum方法进行冲刺,并竞争'冲刺皇冠',这不仅使项目管理更加有趣,而且培养了团队精神和成就感。

  • Dola AI:您的个人 AI 日历助手,简化日程安排,释放时间。

    Dola 是一款通过消息应用进行日程安排的 AI 助手,它与 Google 日历、Apple 日历和 Caldav 兼容,能够通过自然语言快速安排日程,提高效率,同时支持语音、图片和文本输入。Dola 旨在帮助用户节省时间,专注于他们喜欢的事情。

  • Remind AI:使用先进的AI技术,轻松捕捉您的数字活动并作为记忆使用。

    reMind是一款利用AI技术帮助用户捕捉和利用数字活动作为记忆的产品。它通过先进的人工智能技术,让用户能够轻松地记录和回顾自己的工作和活动,从而提高生产力。

  • BrowseBuddy:AI购物助手,提升电商购物体验

    BrowseBuddy是一款AI驱动的聊天机器人,旨在通过提供个性化的帮助来增强在线购物体验。它利用自然语言处理技术来理解客户查询,提供量身定制的产品推荐和支持。BrowseBuddy通过智能产品匹配、实时解决方案、多语言支持等技术,为电商企业提供了一种提升客户满意度和销售效率的解决方案。

  • Depthforge:AI驱动的3D图像生成应用

    Depthforge是一款利用Apple Vision Pro技术,通过文本提示生成沉浸式3D图像的应用。它易于使用,能够让用户通过简单的文本输入来创造独特的高质量3D图像,体验全新的3D图像生成世界。

  • AudiowaveAI:将任何文本转换为有声读物质量的声音。

    AudiowaveAI是一款利用人工智能技术将文本转换成高质量音频的应用程序。它与传统的文本到语音技术不同,提供了更加自然、富有情感的语音输出,让听众在学习和享受内容时获得更好的听觉体验。产品背景信息包括它是由全球创新公司和自由职业者信赖的产品,其主要优点在于其引人入胜的声音、自然的声音效果以及令人愉悦的听觉享受。产品定位为教育工具,旨在帮助用户在移动中学习,享受夏日阳光。

今日大家都在搜的词: