微信扫一扫,关注公众号

  • 科技行者

  • 算力行者

见证连接与计算的「力量」

首页 快手发布文生图大模型“可图”,探索AI新玩法

快手发布文生图大模型“可图”,探索AI新玩法

2023-09-19 16:58
分享至:
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-
2023-09-19 16:58 业界供稿

近日,快手在短视频评论开始内测「快手AI玩评」,用户可以通过输入各种创意文字,一键生成海量风格图片,可以更轻松、便捷地在评论区进行趣味互动。这是继“AI对话”之后,快手在短视频场景内落地的又一AIGC能力。

据悉。快手“AI玩评”依托于快手自研文生图大模型“可图”(Kolors)强大的图像生成能力实现。可图大模型能够基于开放式文本生成风格多样、画质精美、创意十足的绘画作品,让用户可以轻松高效地完成艺术创作。这也是快手AI团队在大语言模型「快意」之后,再次公布了其在AIGC领域的最新突破和布局。

随着AI技术的不断突破创新,AIGC未来会成为内容创作者“突破边界”的工具,它会让更多“脑中有画面,心中有故事”的人能够进行更轻松、高效的创作。据了解,可图大模型的三大特点保证了出色的图像生成效果:

首先,强大的文本理解能力。快手AI构建了数十亿的图文训练数据,数据来自开源社区、内部构建和自研AI技术合成。这些数据覆盖了常见的三千万中文实体概念,兼具世界知识。在此基础上训练研发了一个强大的中文CLIP模型,不仅懂我们的语言,也更懂中文世界的图像;其次,快手AI利用自研的中文LLM,融合CLIP的图文特征作为文生图的文本理解模块,不但实现了中文特色概念的理解,更解决了复杂概念、属性混淆等文生图领域常见问题。

其次,丰富的细节刻画。快手AI研究团队更改了去噪算法的底层公式和加噪公式;同时精选了一批高细节、高美感的优质数据,在模型学习的后期进行有侧重学习。实现了单一基座模型在主体完整的前提下,可生成具有丰富细节和纹理的图片。同时,基座模型也实现了输入图片,输出细节丰富图片的图生图能力。

第三,多样的风格转化。可图大模型具有基于Prompt的自动学习模型,基于知识的理解与扩充,为用户提供不同的风格模版。依据提示词自动扩充模块,可以丰富化用户描述,包括风格、构图、视觉要素等。配合强大的文生图基座模型,Kolors 可以帮助用户准确理解自己的需求,通过简单描述即可生成多样化风格的图片。

在可图大模型强大的图像生成能力背后,是快手AI团队在多模态内容理解和生成方面的长期积累,和在大模型领域的持续创新性探索。
据了解,从8月下旬开始,快手AI团队已在公司内部开启了可图大模型平台的内测,面向内部业务团队提供丰富全面的AI绘画创作能力,并支持网页版工具和标准化API两种使用方式。

快手AI团队表示,「可图」大模型仍在持续优化效果、丰富能力。未来,可图将会与快手的更多业务开展合作,用AI技术丰富业务的想象力,探索更多有趣、有价值的创新应用落地,让人机共创成为现实。

分享至
0赞

好文章,需要你的鼓励

推荐文章
  • 奖励设计:让AI学会智能使用工具的关键
    2025-04-23 17:39

    奖励设计:让AI学会智能使用工具的关键

    想象一下,你有一个非常聪明的朋友,他知道很多知识,但每当需要使用计算器、搜索引擎或查询最新天气时,却变得像个笨手笨脚的孩子。这正是当前大语言模型(简称LLMs,如ChatGPT这类AI系统)面临的尴尬处境。

  • ToolRL:奖励设计是工具学习所需的全部
    2025-04-23 17:34

    ToolRL:奖励设计是工具学习所需的全部

    想象一下,你拥有一个聪明的助手,它知道很多知识,但在面对需要使用计算器、搜索引擎或查询最新信息时却显得笨手笨脚。这正是当前大语言模型(LLMs)面临的困境。虽然这些模型已经通过监督微调(SFT)学会了使用工具的基本能力,但它们常常在面对复杂或不熟悉的场景时表现不佳。

  • X-Teaming:使用自适应多智能体进行多轮越狱攻击和防御
    2025-04-23 14:08

    X-Teaming:使用自适应多智能体进行多轮越狱攻击和防御

    想象你正在和一个智能助手聊天。如果你直接要求它提供有害信息,它很可能会礼貌拒绝。但如果你通过一系列看似无害的对话,逐步引导它走向你的真实目标呢?这就是当前AI安全领域面临的一个严峻挑战——多轮对话中的安全漏洞。

  • "思考操纵":用外部思考让大型推理模型更高效
    2025-04-22 16:43

    "思考操纵":用外部思考让大型推理模型更高效

    想象你在使用一个非常聪明的AI助手完成一项复杂任务,比如解决一道数学难题。你可能注意到这个助手会花很长时间"思考",一步一步写下大量推理过程,最后才给出答案。虽然这种详细的思考过程确实帮助AI做出了更准确的判断,但同时也带来了一个明显的问题:它太"啰嗦"了,消耗了大量的计算资源和时间。

----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-