如果只看标题,你可能会觉得奇怪:一份传媒板块的投资研报,为什么把“估值低位”“游戏”“多模态 AI”“IP 潮”写在同一个句子里?这几个词看起来分别属于资本市场、内容行业和人工智能,硬放在一起像是话术缝合。但我这几年一直在观察内容生产和 AI 工具的结合,拆开看之后发现,它们其实指向的是同一条产业链上的三段变化:传媒是内容资本的存量池,游戏是内容消耗和资产沉淀的主场景,而多模态 AI 是决定这些内容能否被重新生产、重新组合、重新变现的技术变量。
所以我更愿意把这份研报标题当成一个产业信号,而不是一条买卖指令。估值是否处于五年低位,那是市场参与者需要验证的事情,我作为技术从业者没有能力也不应该给结论。我更关注的是:当一个行业同时出现“估值便宜”和“多模态 AI 加速落地”这两个信息时,背后的内容生产方式到底正在发生什么变化?作为开发者、内容技术负责人或独立创作者,这个变化意味着你要补什么能力、跑通什么流程、避开什么坑?这篇文章就围绕这个问题来写。
1. 研报关键词背后,是同一条内容产业链的温度差异
1.1 传媒板块估值处在低位,说明市场对预期已经压得很低
先不说多模态 AI,先谈“估值处于五年低位”这个表述为什么值得技术从业者留意。
估值低位在很多情况下意味着两件事同时发生:一是市场对行业的增长预期已经降到一个较低水平,二是行业内部的企业、内容和用户规模往往并没有崩塌,只是没有出现足够强的增量叙事。从过去几次内容行业周期的经验看,这种阶段往往是技术变量最容易发挥作用的时期,因为旧的增长方式已经很难带来超额回报,企业被迫寻找新的生产方式,个体创作者也开始愿意尝试效率工具。
这里要强调一下边界:估值低位不等于马上会有行情,也不等于行业里的每个公司都会受益。它只说明市场情绪已经相对冷淡,如果后续出现一个能让内容生产成本显著下降、产出效率明显提升的技术变化,这种变化就容易被放大观察。多模态 AI 恰好就站在这个放大观察的窗口上。
1.2 游戏、多模态 AI 与 IP 潮为什么会被放在一起
游戏行业是 IP 内容最重要的消化场景之一,也是最早尝试大规模使用 AIGC 工具的内容领域。多模态 AI 对游戏行业的意义,不在于某个画图工具能快速出一张插画,而在于它改变了游戏资产的制作流程:从原画、立绘、场景建模参考、UI 素材到角色表情、剧情文本、配音素材,过去每个环节都是独立工种、独立管线,现在它变成了同一个多模态模型可以覆盖的连续生产任务。
IP 潮则代表另一层变化:当内容可以被数字化沉淀成一个完整的多模态资产库之后,IP 不再只是版权层面的一组商标和故事设定,而是变成可以用文本、图像、视频、3D 模型、声音等多种形式反复调用的内容基础设施。一个 IP 要进入游戏、短剧、周边、互动内容,过去需要为每个渠道重建一套素材,现在最理想的状态是同一套底层资产通过不同模型和流程快速扩展。
所以这三个词放在一个标题里并不是偶然,它反映的是内容行业的三种状态:估值是市场对它的冷热判断,游戏是 IP 资产最典型的使用场景,多模态 AI 是让 IP 实现跨形态流转的技术杠杆。对技术人来说,与其纠结估值数字,不如去判断多模态 AI 在游戏和 IP 生产流程里到底有没有形成可复用的工程链路。
2. 多模态 AI 真正改变的不是“识别”,而是内容生产与内容资产的组织方式
2.1 从单模态到多模态,关键词不是“能处理更多格式”,而是可组合
早期大家谈 AI,更多是单点模型:OCR 识别文字、语音转文字、图像分类、文本生成。这些模型是割裂的,就像公司里没有打通的信息系统,每个部门有自己的数据库,但很难互相调用。多模态 AI 的关键变化在于,同一个模型体系里可以同时处理图像、文本、音频和视频,更重要的是可以在模态之间做转换和组合。
举个常见的例子:过去你要做一个游戏角色的说明页,需要先由文案写背景故事,再由原画师根据文字想象画面,再由 UI 设计师把两者排版成最终素材。如果文案修改,原画不一定同步,UI 也要重做。而在多模态 AI 的工作流里,一段角色背景描述可以同时作为图像生成、语音风格设定、剧情树和百科页面的共用输入,修改一段描述后可以重新生成一组候选素材。
这才是多模态 AI 对内容行业最重要的贡献:它不只是在某个单点上帮你省了几分钟,而是把原本割裂的内容生产环节变成同一份输入可以驱动多条输出链路的系统。一旦这个系统形成,内容资产本身就开始具备可复用性。
2.2 内容资产的边界正在变化:从交付文件到交付可调用资源
传统内容生产的目标是交付文件:一张原画、一个模型、一段视频、一篇文案。文件一旦交付,修改成本就很高,后续使用基本是静态引用。多模态 AI 影响下的内容生产,目标逐渐变成交付可调用的资源:一段描述词、一个经过微调的基础模型、一组风格统一的可编辑资产、一个可以接收新输入并产生新输出的接口。
这意味着内容团队的思维方式也要变。如果你还是把 AI 当作“更快地完成单张图、单篇文案”的工具,你只是在提高某一环节的效率;如果你把它当作一个能持续生成、持续扩展、持续保持风格一致的内容生产系统,你才真正用上了多模态能力。这个差别,是新手团队和成熟团队之间最容易拉开差距的地方。
实际落地时,我看到更多团队卡在“风格一致性”上。单个图像生成很容易,但一个 IP 需要几十张到上百张风格统一、人设一致的素材。这时候不是靠一条好的 prompt 就能解决,而是要靠底模、LoRA、参考图、后处理流程和人工筛选机制组合起来。也就是说,多模态 AI 不是给你省掉美术环节,而是把美术工作从“每次从零画”变成“搭一套能持续产出的风格流水线”。
3. 游戏行业真正值得验证的是三条消耗多模态能力的路径
3.1 角色与叙事资产的快速生成
游戏内容生产里最典型的多模态场景,是角色资产的生成和衍生。
一个角色通常包含身份设定文字、立绘、表情、语音和剧情文本。传统流程里,这些内容由文案、原画、配音、策划等多个角色先后完成,沟通成本和返工成本很高。多模态 AI 可以把一条角色设定作为输入,先生成形象候选图,再基于确认后的形象做表情扩展和不同服装版本的衍生,同时配合文案模型生成角色语音台词的初稿。
这里有一个很实用的落地建议:团队可以先拿 20 到 30 个角色做小批量测试,而不是一开始就把所有历史资产全部接入模型。先验证两个问题,一是风格统一度能不能达到可接受水平,二是同一角色在立绘、头像、表情包和剧情插画之间的一致性是否够用。只有这两个问题通过了,才考虑扩大产能。
很多项目死在第一步:角色形象好看,但换一个姿势、换一件衣服、换一个场景后就“变脸”了。多模态生成的内容不是一次性交付,而是要在多次生成中保持可以被辨认的同一性。
3.2 UGC 工具链和玩家共创
游戏行业对多模态 AI 的另一层期待,是玩家侧的内容共创。比如玩家在捏脸、建场景、创作同人图文、剪辑游戏视频时,如果官方提供的不只是一个简单的素材库,而是一套可以让玩家用自然语言描述需求、再由多模态模型生成候选素材的工具,玩家的表达成本和门槛就会显著降低。
这条路径对中大型游戏尤其重要,因为它可能改变游戏的长期内容供给方式。过去玩家 UGC 的瓶颈是生产工具的使用门槛:3D 建模、动画、视频剪辑都不是普通用户能快速掌握的。多模态 AI 的介入,把门槛从“会不会做”变成“会不会描述”,这是一个非常大的转移。当然这里也要注意边界:玩家生成内容仍然需要审核机制、版权规则和风格约束,否则容易产生内容质量和合规风险。
3.3 测试、运营和营销素材的批量生产
游戏行业消耗 AI 产能的不只是研发环节,测试和发行侧的体量同样很大。
版本更新需要大量宣传图、商店页截图、视频广告;本地化版本需要多语言的文案、配音和符合当地文化习惯的视觉素材。这些内容单人工做很慢,多模态 AI 的介入可以把基础素材生成环节自动化,比如先生成多种版本的商店头图候选,再由运营人员筛选和微调。对发行团队来说,AI 并不直接产出最终投放素材,但可以让团队在同样时间内覆盖更多语言、更多渠道、更多文案组合,然后集中精力优化数据表现最好的几条。
这条路径给开发者的启示是:不要只把 AI 当成研发提效工具,它可以进入产品、增长、运营和客服的整套内容生产链条。谁能先把单条链路跑通,谁就能在后续版本迭代里拥有一套更厚的内容生产基础。
4. IP 潮的内容侧变量:如何把 IP 做成可复用、可演化的多模态资产库
4.1 “AI+IP”不是给旧 IP 做几张新图,而是重构二次开发流程
IP 这些年一直是内容行业绕不开的叙事,因为流量红利减弱之后,确定性更强的还是拥有稳定受众基础的内容。但传统 IP 开发有一个很大的痛点:IP 的每一次新应用,比如做动画、做游戏、做盲盒、做线下主题空间,几乎都要从已有的故事和视觉设定出发,重新组织一支团队,重新制作大量素材。
多模态 AI 对这个流程的改造,可以理解成把 IP 从“一本书”“一部动画”“一组原画”升级成一个多模态的知识库和素材系统。这个系统里既包括文字层面的世界观、人物设定、剧情时间线,也包括视觉层面的标志元素、风格参考和角色特征。
从这个角度看,IP 运营方真正需要建设的不是再雇更多画师或文案,而是搭建一个能对 IP 核心资产做结构化拆解、并让 AI 基于拆解结果做一致性生成的基座。具体包括几个步骤:先把历史内容归档成统一格式的文本和图像资料,再通过多模态模型对关键角色、场景和风格元素做提取和标注,形成一个小型资产库,然后基于这个资产库微调出属于该 IP 风格的底模或 LoRA,后续所有衍生内容都优先在这个模型轨道上生成。
4.2 一致性、版权和人工审核:IP 资产库建设的三道坎
第一道坎是一致性。文字设定可以说“主角穿红色外套”,但模型每次生成同一件红色外套的细节都可能有差异。要解决这个问题,可以在资产库里给关键视觉元素建立独立标签,并且使用参考图控制技术,让生成流程强制参考同一张设定图。对工程经验还不足的团队来说,一个容易错的做法是盲目扩大素材库,而不是建立“关键元素少而准”的约束体系。
第二道坎是版权归因。基于 IP 素材微调的模型,其训练素材、生成结果和原有版权内容之间的边界需要非常谨慎地处理。生成结果不能直接认为天然可用,生成内容的版权归属也取决于平台规则和合同约定。相关内容我无法给出法律建议,但从工程实践角度,建议团队在接入生成流程时就保留好素材来源、模型版本和处理记录,避免后期无法追溯。
第三道坎是人工审核。IP 内容面向大众,品牌形象的风险管理比生成效率更重要。多模态 AI 可以负责批量生产和多样化产出,但最终放行前至少需要一套包含文本安全、视觉合规、风格自检和对原设定一致性的审核机制。
对一个 IP 团队来说,多模态 AI 是一个内容产能放大器,但它不会自动替你守住 IP 的核心人设、价值观和审美边界。这些东西仍然要靠人来定义和维护。
5. 从研报关键词到开发者技术栈:多模态内容生产需要怎样的工程能力
5.1 单点体验项目和技术工程项目的差别,很多人没有意识到
如果只是在自己的电脑上跑一个多模态模型玩一玩,看到效果不错就拍板投入业务,后续通常会在工程化阶段撞墙。因为玩票级使用只需要处理好输入输出和显存,而生产级使用至少需要关注四个问题:素材和数据的组织方式、模型版本和风格控制、批量生成与任务队列、结果审核和反馈回流。
我见过不少团队尝试在游戏或 IP 内容流程里用 AI,前两周只是各自用在线工具生成图片,后来发现无法统一风格、无法批量修改、也无法沉淀素材。真正的工程起点不是选哪个模型,而是先定义清楚:你希望系统接收什么输入、输出什么格式、由谁审核、成功标准是什么。比如输入是“角色设定描述 + 参考图 + 风格标签”,输出是“角色全身图、头像、表情包和文字设定”,审核人不是提示词工程师,而是熟悉 IP 的策划或美术,这个流程才可持续。
5.2 最小可用技术栈:从向量数据库、CLIP 到生成模型与人工反馈
下面用一个常见的内容生产场景来拆解技术栈:给一个游戏角色库批量生成宣传图。
先建立一个角色资产库,每个角色在数据库中至少包含以下字段:
- 角色名称、身份简介、性格标签、关键外观描述
- 参考图地址、基础立绘、角色关键元素标签
- 风格标签,例如“国风”“幻想”“赛璐璐”等
内容的语义检索能力可以依赖多模态 embedding 模型或者 CLIP 这类跨模态表示,把文本描述和图像映射到同一个向量空间;资产组织则可以依赖带元数据的对象存储和轻量级数据库。生成环节可以使用支持文生图的基础模型,配合 LoRA 或 ControlNet 等控制手段,保证角色一致性和构图可控。最后要加一层输出记录:把每次生成的 prompt、模型版本、输入图片、输出图片和时间点都记录下来,方便回溯。
需要说明的是,这个技术栈只是一个通用示例,不是推荐某一家具体产品。不同基础模型的优势、开源协议、硬件占用差异很大,选择前必须用实际素材做小样本测试。
5.3 面向多模态生产,开发者需要补强的三块能力
第一块是格式编排能力。多模态内容生产涉及文本、图片、音视频的互相转换,每个环节都要求明确的输入输出格式和校验逻辑。做内容生产的开发者,某种程度上更像在做数据管道。
第二块是模型评测能力。多模态模型的输出质量不能完全用准确率衡量,还要看风格一致性、美学评分、与原始设定的匹配度。建议团队针对自己的内容和素材,建立一套 20 到 50 个样本的小型评测集,每次更换底模或调整参数时都能做出横向对比。
第三块是异常处理能力。批量生成时难免出现内容违规、加载失败、输出不符合预期等异常。系统不能把失败结果直接丢给用户,而要有失败重试、候选排序、风险拦截和人工标记流程,这样整个工作流才能稳定运转。
6. 多模态内容生产落地模板:从单条链路跑通到批量化扩展
6.1 阶段一:先跑通一个极小的单点闭环
任何项目都别急着全面铺开,先选一个能判断价值的最小场景。比如“为一个角色生成一张符合官方人设立绘风格的标准头像”。
这一步的输入应该包括三样东西:角色文字设定、风格参考图、可用于生成的基础模型。验证标准也可以直接定:输出结果与参考图的风格相似度是否达到可接受水平、角色是否具有可辨认的五官特征、是否能稳定复现。
在技术操作上,你不需要一开始就追求复杂的微调。可以用现成模型配合提示词和参考图控制,先把“风格统一”这件事验证出结论。如果连现在的主流模型加上 ControlNet 都无法稳定保持角色一致性,再来决定是否进入 LoRA 微调或训练专属底模。
6.2 阶段二:跑通 10 到 50 个样本的批量生成与人工审核循环
单点跑通后,下一步不是扩充素材量,而是把数量扩大到 10 到 50 个样本,验证批量生成的稳定性。
批量生成时你要关注的参数通常包括:单个任务的并发数或排队机制、单张图的生成时长、失败率、风格一致率。常见的问题是:单张图效果好,批量处理时因为提示词标签不一致,导致每人物的角色特征漂移。解决办法是先建立一份统一的“标签模板”,把每个角色的身份特征和外观标签用同一套规则表达,再让所有生成任务共享这份模板。
建议在这个阶段就引入“人工评价表”,把每个生成结果按相似度、质量、合规程度分成不同等级,并记录原因。这样后续不需要每次靠感觉判断效果。
6.3 阶段三:接入版本管理、任务队列和建议反馈机制,进入工程化
批量验证通过后,多模态内容生产才算真正进入工程化阶段。此时通常要走完这几步:
- 为每套风格和每个角色建立可复用的配置版本,而不是把 Pormpt 和参考图随便放在文件夹里。
- 为批量生成任务设置队列、超时机制、失败重试和结果归档,避免一次长任务卡死影响全局。
- 用日志记录每次生成任务的输入、模型版本、出图结果和人工审核结果,方便后续复现和排查问题。
多数多模态内容项目不是死在模型效果不好,而是死在管理方式还停留在“建一个聊天窗口,复制一段 Prompt,等一张图”的阶段。工具越强,管理方式越要跟上。
7. 多模态内容效果不稳定时,按这个顺序排查
多模态 AI 的问题排查和传统后端开发不太一样,它的结果不是简单对错,而是“好不好、稳定不稳定”。遇到效果变差、风格漂移、内容违规等状况,我一般会按下面的顺序追查。
7.1 先看输入源:素材质量、标签统一度和上下文完整度
第一个要排查的是输入。很多角色一致性出问题的项目,根本原因不是模型不够强,而是每个角色的标签表述不一致。同一个角色在不同任务里,有时候写“红色短发”,有时候只写“短发”,甚至参考图角度换了,都会导致漂移。排查时把每个任务的输入文本和输入图片放在一起,看表述是否统一、素材是否模糊、参考图是否包含多层叠加元素。
7.2 再看模型和参数:版本漂移、参考图控制强度、随机种子是否设置
第二个层面是模型配置。基础模型版本升级后,往往输出风格会潜移默化地变化,需要重新跑评测样本。参考图控制强度设置太弱时,漂移明显;太强时,又会压缩创意空间。随机种子如果完全放开,同一输入每次输出都不同,批量任务无法比较,也会增加审核成本。建议在正式批量任务中固定一个种子,或至少记录每个任务的种子值。
7.3 再看任务链路:是生成环节出错,还是后处理、编目、流转环节出错
多模态内容生产通常不是一次生成就结束。生成结果后面还有去背景、加文字、调整尺寸、编码入库等环节。如果产出不稳定,可能是后处理程序用了不同的图像处理逻辑导致色彩不一致,也可能是生成结果在流转过程被压缩、改名、丢失了元数据。这个层面的排查重点是直接对比初始生成图与最终交付图,观察变化发生在哪一段。
7.4 最后看人的判断:人工筛选标准是否明确,反馈是否回流
最后容易忽略的是人的环节。如果不同审核者对“风格一致”的理解不一致,那系统无论怎么调都无法收敛。所以团队需要对合格结果做书面定义,比如用三张基准图当参照:符合基准、基本符合、不符合。同时,审核结果要定期抽回来,作为下一轮调优的样本,而不是审核完就丢弃。测试模型或调整流程时,也要让审核者知道这次改动可能带来哪些风格变化,避免用同一套标准误伤新结果。
8. 关注长期价值前,先分清三件事:概念热度、行业渗透与工程成熟度
现在回到研报标题里的多模态 AI。技术领域有一个常被混淆的问题:概念热度和行业渗透率不是一回事,行业渗透率和工程成熟度也不是一回事。
概念热度阶段的特点是:很多人讨论、很多演示、很多大会分享,但这不意味着企业已经把 AI 放进日常生产流程。行业渗透阶段的特点是:一部分头部团队开始尝试,单点环节找到应用场景,但不同团队之间的效率差距非常大。工程成熟阶段的特点是:工具链稳定、成本可控、失败可排查、可持续迭代,不再是“靠运气出好图”的状态。
从我接触的案例看,游戏和 IP 内容行业整体还处在从概念热度走向行业渗透的早期阶段。大部分团队做过尝试,但对多模态技术的接受程度、投入深度、工程化水平差异很大。那些能在未来几年形成优势的团队,不是一次性使用了最贵的模型或最多的 GPU,而是先完成了内容资产的结构化整理,并通过小样本评测建立了自己可控的生成与审核闭环。
如果你也是内容行业的开发者、策划或独立创作者,最好的时间窗口可能不是去追逐每天更新的新模型,而是先把自己手头最熟悉的角色设定、故事设定或商品素材整理成结构化资产库。只有当你定义清楚输入、输出和成功标准,多模态 AI 才能真正成为你生产流程的一部分。
这份研报标题里到底有多少投资机会,我无法回答,也不适合回答。我能确定的是另一个判断:当一个行业在低预期阶段遇上一项正在逼近工程化临界点的技术,真正发生变化的通常不是某一款产品,而是一群从业者开始重新设计自己的内容生产流程。对写代码和做内容的我们来说,这个窗口才是更值得关注的入口。