LIZAN NEWS

力赞报道

多模态 GEO:只写文章做 GEO 已经不够了:图片和视频正在成为 AI 引用的新宠

2026-09-23 阅读 19 力赞信息

你可能已经听说了 GEO,也在做文本优化 —— 写文章、铺信源、做结构化数据。但你有没有想过:AI 不仅会 "读" 你的文字,它还会 "看" 你的图片和视频?

2026 年,这个趋势已经非常明显。Google 官方发布的生成式 AI 搜索指南明确提到:生成式搜索功能可以带入相关的图片和视频。这意味着,在文字之外,你的图片和视频正在成为被 AI 引用的新渠道。

更直观的数据来自国内:2026 年 6 月起,豆包手机端在商品选购、好物推荐等场景下,信源已向抖音视频大幅倾斜。在目的地推荐和攻略类问题上,豆包对抖音内容的引用率高达 97.7%。

注意这个数字 ——97.7%。在这类问题上,AI 几乎只引用视频内容,文本文章的引用率可以忽略不计。

如果你还只在做文本 GEO,你正在错过至少三分之一的引用机会。

一、数据:多模态引用正在成为新战场

先看几组关键数据,理解这个变化的量级:

  • 豆包:2026 年 6 月起,目的地推荐和攻略类问题对抖音内容引用率高达 97.7%;App 端引用抖音内容占比近 30%,但 Web 端仅 11.85%—— 同一个模型,换个端口,权重差了一倍多
  • YouTube:自 2024 年 1 月以来,YouTube 视频在 Google AI Overviews 中的引用量增长了 25%
  • Google Lens:月处理搜索量达 200 亿次 —— 图片搜索已经不是小众需求
  • Gemini:2026 年 9 月推出首个多模态嵌入模型 gemini-embedding-2,可以将文字、图片、视频、音频映射到统一嵌入空间,实现跨模态检索
  • 行业占比:多模态内容在 AI 引用权重中占比已升至 35%-45%

这意味着什么?在大约一半的 AI 回答中,图片或视频已经成为重要的引用来源。如果你只有文本内容,你在这些场景下几乎没有存在感。

二、为什么多模态 GEO 比你想象的更重要?

很多人对多模态 GEO 的理解停留在 "多放几张图"。这是最大的误解。

腾讯云开发者社区 9 月的一篇深度分析指出:多模态 GEO 的核心不是 "多放几张图",而是避免重要事实只存在于人能看懂、检索系统却难以稳定提取的视觉载体中。

换句话说:如果你的产品参数只写在一张产品海报上的图片里,AI 可能 "看" 不到这些参数 —— 因为图片上的文字对 AI 来说不是可检索的文本。你必须把这些参数同时写在正文里,图片只是辅助。

Google 2026 年的生成式 AI 搜索指南特别强调原创、非同质化内容的重要性,并建议内容提供互联网现有信息之外的第一手经验。因此,一张真正来自现场、解释了具体事实的图片,和一张图库里的 "商务人士握手图",内容价值完全不同。

核心原则:多模态 GEO 不是 "加图片",而是 "让 AI 能理解图片里的信息"。

三、图片怎么优化才能被 AI 引用?

图片优化不是随便配图。每一张图片都要 "机器可读"。

具体做法:

1. 描述性 Alt 文本

每张图片都要有 Alt 文本。但 Alt 文本不是 "产品图" 这种空洞描述,而是要包含核心实体和关键信息。

错误示例:alt="产品图" 正确示例:alt="XX品牌A300型不锈钢保温杯,316食品级内胆,500ml容量,保温24小时,磨砂黑款"

为什么?因为 AI 的多模态模型会同时读取图片内容和 Alt 文本,Alt 文本是 AI 理解这张图的 "文字索引"。

2. 描述性文件名

图片文件名也要有意义。IMG_20260923_001.jpg对 AI 来说毫无信息。

正确示例:xx-brand-a300-stainless-steel-water-bottle-500ml-black.jpg

3. 配置 ImageObject Schema

在网页中加入 ImageObject Schema 标记,明确告诉 AI 这张图是什么:图片内容、作者、版权、主题实体。

4. 图表用 SVG,关键文字在正文重述

如果你有数据图表,不要用 PNG/JPG 格式 ——AI 无法读取图片中的数字。用 SVG 格式,或者把关键数据在正文里用文字重述一遍。

5. 四类高价值图片

不是所有图片都有 GEO 价值。四类图片最容易被 AI 引用:

  • 现场实拍图:真实使用场景、产品实拍、实地考察照片(非图库素材)
  • 过程 / 测试图:产品测试过程、实验步骤、数据变化过程
  • 对比图:产品对比、前后对比、竞品对比
  • 带标注的解释图:在图上标注关键参数和说明

四、视频怎么优化才能被 AI 引用?

视频是当前多模态 GEO 中权重最高的形态 —— 尤其是在豆包等国内平台上。

具体做法:

1. 上传 SRT 字幕文件

AI 读取视频内容主要靠字幕,不是靠 "看" 视频画面。没有字幕的视频,对 AI 来说内容基本不可见。

2. 加章节标记 + VideoObject Schema

在视频中加入章节标记(如 0:00 介绍、1:30 产品参数、3:00 使用场景),并配置 VideoObject Schema。这样 AI 可以精确定位视频中的特定时间段。

3. 关键画面硬码文字≥5 秒

如果视频中有关键信息(如产品参数、价格、联系方式),要在画面上硬码文字,并且停留至少 5 秒。因为 AI 的视频理解模型会定期截取关键帧,文字停留时间太短 AI"看" 不到。

4. 前 5 秒直接给答案

和文本 GEO 一样,视频开头就要直接回答问题。不要先铺垫 30 秒背景 ——AI 更倾向于引用开头就有答案的视频。

5. 每月至少生产一个视频

行业建议:品牌每月至少生产一个高质量视频。视频不需要很长,2-5 分钟的垂直内容就够了,但必须有明确的主题、结构化的内容、完整的字幕。

五、跨模态一致性:图文视频不能各说各话

多模态 GEO 最容易忽略的一点是:图文视频的语义必须一致。

如果你官网文章里说产品 "续航 24 小时",但抖音视频里说 "续航 12 小时",AI 会困惑 —— 到底哪个是对的?这种不一致会严重降低 AI 对你品牌的信任度。

正确做法:

  • 图文、视频、音频中的品牌实体名称完全统一
  • 核心参数(产品规格、价格、认证、数据)在所有渠道保持一致
  • 图文之间、视频之间相互链接交叉引用
  • 定期审计所有内容中的品牌信息,发现不一致立即修正

六、一个可执行的多模态 GEO 清单

把以上内容整理成一个可执行的清单:

图片类:

  • 每张图片有描述性 Alt 文本(含核心实体 / 型号)
  • 图片文件名有语义(不是 IMG_xxxx)
  • 配置 ImageObject Schema
  • 数据图表用 SVG,关键数据在正文重述
  • 优先使用现场实拍图、过程图、对比图、带标注解释图

视频类:

  • 每个视频有 SRT 字幕文件
  • 视频有章节标记 + VideoObject Schema
  • 关键画面硬码文字≥5 秒
  • 前 5 秒直接回答问题
  • 每月至少一个高质量视频

跨模态:

  • 图文视频中的品牌实体名称统一
  • 核心参数(规格 / 价格 / 认证)所有渠道一致
  • 图文 / 视频交叉链接
  • 定期审计品牌信息一致性

结语:多模态不是加分项,是必选项

很多人把多模态 GEO 当作 "加分项"—— 文本做好了再加图片视频。但数据告诉我们,在将近一半的 AI 回答场景中,多模态内容已经是主要引用来源。

特别是在豆包这种国内主流平台上,目的地推荐、商品选购、生活服务类问题对视频内容的引用率已经接近 100%。如果你在这些场景下只有文本文章,你根本不在 AI 的候选名单里。

多模态 GEO 的核心不是 "多放几张图",而是 "让 AI 能理解图片和视频里的信息"。Alt 文本、字幕、Schema 标记、跨模态一致性 —— 这些看似技术细节的操作,决定了你的图片视频是 "AI 可读" 还是 "AI 看不见"。

当 AI 开始 "看" 世界,你的品牌不能只 "写" 在文字里。

推荐标签 / 关键词

GEO、多模态 GEO、AI 搜索、图片优化、视频 SEO、豆包、抖音内容、AI 引用、生成式引擎优化、内容优化

← 下一篇:把 20 个客户常问的问题丢给 AI… 上一篇:不信任 AI 搜索的人正在变多,但用… →
返回力赞报道列表