AI画画通用模型,新增一员大将!
由阿里达摩院副院长周靖人等人打造的可控扩散模型Composer,一经发布就小火了一把。
这个模型由50亿参数训练而来,和Stable Diffusion原理不同。
它更进一步把训练图像拆解成了多个元素,然后基于这些元素训练扩散模型,让它们能够灵活组合。
由此一来,模型的创造能力就比仅基于图像大很多。
如果有100张能拆分成8个元素的图像,那么就能生成一个数量为100的8次方的结果组合。
网友们看了纷纷表示,AI画画发展速度也太快了!
团队表示,模型的训练和推理代码都在路上了。
观察到现下很多AI画画模型,在细节的可控性上还没有做到很好,比如准确改变颜色、形状等。
研究团队认为,想要实现图像的可控生成,不能依赖于对模型的调节,重点应该放在组合性上,这种方式可以将图像的创造力提升到指数级。
引用语言学大师诺姆·乔姆斯基的经典语录来解释模型,就是:
有限手段的无限使用。
具体来看,该模型就是将每个训练图像拆解成一系列基础元素,如蒙版图、草稿图、文字描述等,用它们来训练一个扩散模型。
然后让这些被拆分的元素,在推理阶段灵活组合,生成大量新的图像输出。
它可以支持多种形式作为输入。比如文字描述作为全局信息,深度图和草图作为局部引导,颜色直方图为低级细节等。
在保证生成图像可控的基础上,作为一个通用框架,该模型还能不用再训练就可以完成大量经典生成任务。
举例来看,图(a)中,最左边的是原图,后面4个是通过对Composer不同子集的表示进行调节而生成的新结果。
图(b)展示的是图像插值的结果。
图像重构的话是酱婶儿的,Composer能够简单地改变图像表示来重新配置图像,比如草稿图和分割图。
还有对图像的特定部分进行编辑。
比如给蛋糕派换口味、把珍珠耳环少女的脸换成梵高、让兔子长一张熊猫脸等。
比较经典的图像生成任务也能挑战,而且无需再训练。
团队表示,现有成果还存在一定局限性,比如在单一条件输入的情况下,生成效果不是很好。以及输入不同语义的图像和文本嵌入时,生成结果会降低对文本嵌入的权重。
而针对AI画画模型都需要面对的风险问题,团队表示为避免被滥用,他们会在公开模型前先创建一个过滤版本。
该研究由阿里及蚂蚁团队完成。
通讯作者为周靖人。
他现任阿里达摩院副院长、阿里云智能CTO,是IEEE Fellow。
2004年于哥伦比亚大学获得计算机博士学位,后加入微软担任研发合伙人。
2015年,周靖人加入阿里巴巴集团,先后负责过达摩院智能计算实验室、大数据智能计算平台、搜索推荐事业部等。
论文一作Huang Lianghua同样来自达摩院,研究方向为扩大模型规模和数据来表示学习和内容生成。
作为头部在线旅游平台,携程显著受益于疫后行业恢复。今年二季度,平台国内酒店预订量较 2019 年同期增长超六成,出境酒店和机票预订量恢复至 60% 以上,大幅跑赢同期国际航班客运...
2 去年以来减少 6.6万人 美国电信运营商疯狂裁员“降本增效”压力巨大不少T-Mobile的员工,这些天陷入不安的情绪之中。“8月25日早上收到了CEO的邮件,说从即日起到9月底,除了零售和消费者维护部门的员工之外,...
3 微软高估了Bing,低估了Open AI利益面前无兄弟微软与Open AI的关系,愈发微妙了。日前,Bing首席执行官米哈伊尔・帕拉欣在互联网上公开表示,Bing的AI能力比OpenAI的GPT-4更好,而前者的AI技术源自后者。拉踩之...
4 抖音“嫌弃”数字人坑多、钱少,麻烦多。午夜1点的直播间,一位女主播还在引导用户购买团购券。“她”是王力餐饮店的主播,最长记录持续卖货13个小时,偶尔有路过的观众提问,“她&rdq...
5 TikTok在美推电商服务:入口在首页,超20万商家入驻短视频巨头TikTok在美国推出电商服务。美国时间9月12日,TikTok官网宣布,在美正式上线电商服务TikTok Shop(下称TikTok电商)。据悉,此前TikTok电商已在美国TikTok用户中进行数月...
6 4700万人在线刷崩BOSS直聘?回应:服务器崩是真,网传数据是假9月15日,有传言称,求职平台“BOSS直聘”突然崩溃,许多用户无法刷新页面,无法查看新的招聘信息,甚至无法进行聊天交流。在社交媒体上,一位自称是BOSS直聘员工表示,金九银...
7 因违反儿童隐私保护法,TikTok 被罚款 3.45 亿欧元月16日消息,据路透社报道,欧洲监管机构宣布,TikTok 因违反欧盟有关儿童个人数据处理的隐私法而被罚款3.45亿欧元(备注:当前约26.77亿元人民币)。调查人员指出,TikTok 在注册时默认...
8 微信上线秒简相机APP,推出摄影录像工具产品加码内容生态独家获悉,微信于近日在App Store上线了一款名为“秒简相机”的APP,集拍摄、影像美化、拼图分享一体。据其官方的介绍,秒简相机,能够让拍摄变得轻松愉悦,按下快门就能...
9 Windows的AI时代从下周开始 Office也将在11月跟进当地时间周四,美国科技公司微软在纽约举办秋季发布会,除了常规的Surface硬件升级外,今天的重头戏依然是AI。微软CEO纳德拉在开场时表示,当年他加入微软时,公司的目标是让每个家...
10 GPT-4被曝重大缺陷,35年前预言成真!所有LLM正确率都≈0,惹Karpathy马库斯惊呼最近,一项研究发现,大模型身上存在一种「逆转诅咒」,即使学会「A是B」,它们也无法推理出「B是A」!大语言模型,竟然存在一种「逆转诅咒」?所谓逆转,也就是说,一个训练于「A是B」的语...
备案号:粤ICP备2023097408号 Copyright © 2020-2021 海南金游汇电子竞技有限公司 版权所有