欢迎大家来到腾讯混元文生图的世界,这里有一份详细的操作指南,请查收!
为了便于大家全面了解和操作腾讯混元文生图,该操作指南大概从以下几个方面展开:
1、 腾讯混元文生图简介
2、 腾讯混元文生图技术创新
3、 prompt使用注意事项
4、 腾讯混元文生图测试尝鲜
5、 one more thing——彩蛋时刻
一、腾讯混元文生图简介
今天上午,腾讯混元大模型迎来全新升级,并正式对外开放“文生图”功能。升级后的腾讯混元中文效果整体超过GPT3.5,代码能力大幅提升20%,达到业界领先水平。
相比其他大模型,腾讯混元的文生图应用,在人像真实感、场景真实感上有比较明显的优势,同时,在中国风景、动漫游戏等场景等生成上有较好的表现。在业界公认难度较高的人脸画像生成上,腾讯混元也交出了比较令人满意的作品。
作为“从实践中来,到实践中去”的大模型,腾讯混元文生图能力,目前已经被用于素材创作,商品合成,游戏出图等多项业务中,此外在广告业务下的多轮测评中,腾讯混元文生图的案例优秀率和广告主采纳率分别达到86%和26%,均高于同类模型。
二、腾讯混元文生图技术创新
大模型文生图的难点体现在对提示词的语义理解,生成内容的合理性以及生成图片的效果,针对这三个技术难点,腾讯进行了专项的技术研究,提出了一系列原创算法,来保证生成图片的可用性和画质。
1、在语义理解方面,腾讯混元采用了中英文双语细粒度的模型,模型同时建模中英文实现双语理解,而不是通过翻译,通过优化算法提升了模型对细节的感知能力与生成效果,有效避免多文化差异下的理解错误。
2、在内容合理性方面,AI生成人体结构和手部经常容易变形。混元文生图通过增强算法模型的图像二维空间位置感知能力,并讲人体骨架和人手结构等先验信息引入到生成过程中,让生成的图像结构更合理,减少错误率。
3、在画面质感方面,混元文生图基于多模型融合的方法,提升生成质感。经过模型算法的优化之后,混元文生图的人像模型,包含发丝、皱纹等细节的效果提升了30%,场景模型,包含草木、波纹等细节的效果提升了25%。
三、prompt 使用注意事项
1、如果你想生成一张更接近真人感的照片,或接近实拍的图片。请使用“生成一张XX的图片”或者“生成一张XX的照片”,并加上“真实感”或“摄影风”等描述,如果使用“画一幅xx画”,会被识别成其他风格的图画。
2、如果你想要特定风格的图片,建议在提示词中加入该风格的描述,如油画风、赛博朋克风、水墨画风格、像素风、日漫动画风、儿童画等,或者使用灵感发现中的特定风格,不给出明确画风指示时,混元大模型随机生成常见风格图片。
3、对你想要的画面进行尽可能详细的描述,并建议多次调整你的提示词,比如“生成一副照片:亚洲女子,魅力,长发,戴墨镜,站在长城上,背景有红叶”、“画一幅亚洲女生的画,黑色与绿色相间的中短发,卡通人像,迪士尼风,民俗肖像,宁静脸孔”。
四、腾讯混元文生图尝鲜
1.1 真实感人像
生成可爱的亚洲 4 岁女孩穿着棉质连衣裙,大眼睛,古代中国,摄影风格,汉服
生成一个亚洲青年男生在高铁站,穿着休闲服装,背着双肩包,等待出行,高铁站内部,摄影风格,高度详细
生成生成一个亚洲中老年男人在乡野,穿着朴素,站在稻田旁,远处山峦,近景,摄影风格,摄影照片
生成一幅照片:亚洲女子,魅力,中短发,戴墨镜,站在长城上,背景有红叶
生成一张古风美女的照片,穿着汉服,扎着发髻,摄影风
1.2 真实感场景(人文&风景)
生成图片,一个城市CBD办公楼,现代化设计,高层建筑,玻璃幕墙,近景拍摄,摄影风格,摄影照片
生成日式酒店外观,传统建筑风格,瓦片屋顶,樱花树,远景,摄影风格,摄影照片
雪山,高耸入云,白雪皑皑,远景,摄影风格,摄影照片
云海,晨光照耀,云层层叠,宁静的气氛,远景,摄影风格,摄影照片
生成一幅照片:桂林漓江的山水,江上有一艘小船
生成一张长城的照片,摄影风,真实感
生成图片,布达拉宫风景,金黄色的屋顶,蓝天白云,雪山环绕,广角,摄影风格,摄影照片
2.1 2D动漫人像
生成2D 现代动漫,一个身穿黑色长裙,头戴黑色蝴蝶结发饰的少女,近景的图片
一个穿着淡黄色衣服的年轻女孩的卡通图画,头发是黑色的,卷曲的中长头发,戴着大框的眼镜,郁金香元素。用迪士尼动漫风格的人物设计,宁静的面孔,民俗肖像
生成2D Q版古风动漫,一名身着黑色道袍的道士,手执法器,面容阴沉
帮我画一个拿着奶茶的甄嬛,扁平插画,可爱Q版
画一幅画:一位女性,她穿着灰色的夹克和黑色的衬衫。她坐在一张桌子前,桌子上堆满了物品,可能是货物或工作设备
2.2 平面场景
生成2D 水墨,水彩风,一个古风农庄,稻田麦浪,农家小院,清新自然,与自然和谐
生成2D 现代场景动漫,一个都市街道,高楼大厦,车水马龙,繁忙喧嚣,商业气息
生成2D 古风场景,一个古风酒楼,古色古香,美食的香气,温馨舒适,美食的殿堂
画一幅画:小企鹅在树下行走,突然一个苹果从树上掉下
3.1 3D/CG风格人像
生成一张图片:白色银发的女生,戴着耳环,看着前方,CG风格
生成 3D 科幻人物,一名身穿黑色铠甲,身上散发着蓝光的机甲战士。他站在一片城市废墟中
生成3D 西方魔幻人物,亡灵领主,威震鬼域,统治着幽冥的亡灵世界
3D 游戏军事人物,一个身着迷彩服的陆地士兵
生成3D Q版动物,小企鹅,呆萌可爱,生活在南极的冰川边缘
3.2 3D/CG场景
生成3D 游戏军事场景动漫,雪地战场,白茫茫一片,暴风雪肆虐,寒冷刺骨
生成3D 游戏军事场景动漫,城市战区,废墟瓦砾,焦黑的建筑,空气中弥漫硝烟
生成3D 赛车动漫,一辆红色跑车在城市街道上疾驰而过,风景在车窗外迅速闪过
3.3 3D氛围感场景
帮我生成一张图片:一个小女孩在森林中奔跑、带着灯笼、身旁飞着萤火虫、月亮很亮,氛围感,CG风格
生成一张赛博朋克风格的图片:一只立体的猫穿着赛博朋克风的衣服,周围是灯红酒绿的城市场景,潮湿的地面上反映了城市的倒影
4 古诗词
帮我生成一张图片:空山新雨后,天气晚来秋,水墨风格
请帮我生成一张图片:轻舟已过万重山,水墨画风格
请帮我生成一张图片:春江水暖鸭先知,水墨画风格
帮我生成一张图片:墙角数枝梅,凌寒独自开,水墨风格
画一幅渔舟唱晚的画
生成一幅水墨画:窗前明月光,疑是地上霜。举头望明月,低头思故乡
五、one more thing-彩蛋时刻
过去一个月,腾讯混元大模型不仅各项能力均有升级,代码、数学能力也大幅提升。
经过对32种主流语言代码文件、各类计算机书籍和博客的学习增训,腾讯混元代码处理水平提升超过20%,代码处理效果胜出ChatGPT 6.34%,在HumanEval公开测试集指标上全面超过Starcoder、Codellama等业界头部开源代码大模型。
只需输入简单的指令如“帮我用前端语言实现一个贪吃蛇”,腾讯混元便能自动生成可运行的代码,快速制作出一个贪吃蛇小游戏。此外,腾讯混元还支持Python、C 、Java、Javascript等多种语言的指令生成,比如输入“用Python画红色的心形线”,腾讯混元会提供代码库选择、安装命令、绘制代码等具体操作步骤的指引。
腾讯内部目前已经有多个开发平台接入了腾讯混元大模型,工程师们可以使用腾讯混元来进行代码生成、代码补全、代码漏洞检测和修复、表格数据处理、数据库查询等工作。
比如,在IDE编程场景中,腾讯工蜂Copilot通过接入混元大模型,可根据注释生成对应代码,或基于上下文智能补全代码,大大提高了编程效率。混元大模型还可以帮助用户进行代码漏洞检测和修复,保障软件开发过程中的安全性。
腾讯混元大模型持续升级背后,离不开腾讯自研一站式机器学习平台Angel的支撑。自研AngelPTM训练框架可提供高效的分布式训练解决方案,具备业界领先的内存利用率和训练吞吐效率,训练速度相比业界主流框架提升1 倍;自研AngelHCF训练框架,具备从蒸馏、微调、压缩到模型加速的完整能力,支持多种模型并行,保证模型的最小化部署及最大化吞吐,推理速度相比业界主流框架FasterTransformer快1.3倍。
作为实用级的通用大模型,目前,超过180个腾讯内部业务已接入腾讯混元,包括腾讯会议、腾讯文档、企业微信、腾讯广告和微信搜一搜等。服务公司外部零售、教育、金融、医疗、传媒、交通、政务等多个行业客户。