本篇属「AI 知识」板块,供广告、图文、设计与 AI 应用从业者日常速查。内容整理自公开资料与行业通行做法,涉及数值与工艺的条目,实际生产请以制作方工艺单与设备规格为准。
计算机视觉是什么
计算机视觉,简称 CV,是研究如何让机器从图像或视频中提取信息的领域。它让 AI 不仅能’存下’图片,还能理解画面里有什么、在哪里、是什么形态。
在广告与图文行业,CV 支撑着素材识别、内容审核、智能裁切等多种能力。了解其任务分类,有助于判断某项功能背后的技术类型。
值得一提的是,视觉能力常与文本理解结合,形成能’看图说话’的多模态系统,例如为图片自动生成描述文字、按语言指令检索画面。这类交叉能力正在持续拓宽广告与设计行业的应用边界。
图像分类
图像分类是最基础的任务:给定一张图,判断它属于哪个预设类别,例如’风景”人物”食品’。它回答的是’这张图整体是什么’的问题。
分类常用于内容打标、相册整理与推荐匹配。它关注全局判断,不关心物体在图中的具体位置,是许多上层功能的基础。
需要留意的是,分类结果依赖训练时设定的类别范围。若遇到训练未覆盖的新类别,模型可能强行归入相近项而产生偏差,因此类别体系的设计要贴合真实业务需求,并随业务扩展而更新。
目标检测
目标检测不仅要判断图中有哪些物体,还要用方框标出每个物体在图中的具体位置与大小。它回答’有什么、在哪里’两个问题。
在创意与运营场景,检测可用于自动识别画面中的 Logo、商品或人物,辅助合规检查与元素统计,是比单纯分类更细致的能力。
- 图像分类:判断整图所属类别
- 目标检测:定位并识别多个物体
- 图像分割:精确到像素的区域
- 其他:关键点、视频理解等
图像分割
图像分割进一步把图像按物体或区域切分,逐像素标明归属,例如把前景人物与背景精确分离。它比检测框更精细,常用于抠图与换背景。
在广告设计中,分割能力可支持自动去背、局部替换等高效操作。此外还有关键点识别、视频理解等任务,共同构成视觉能力的版图。
分割的精细程度直接影响后续处理的质量。例如换背景时边缘是否干净,取决于分割是否准确;也正因如此,它常作为智能抠图、局部替换等工具的核心底层能力,对设计效率帮助明显。
任务之间的关系
这些任务并非彼此孤立:分类可为检测提供候选,分割常以检测结果为起点。工程上常把多个任务组合,形成更完整的视觉处理流水线。
具体到某工具支持哪些任务、效果如何,因实现而异,实际以产品官方说明为准。
一句话总结:计算机视觉通过分类、检测、分割等任务让机器理解图像,各自解决’是什么”在哪里”精确到哪片区域’的问题。对图文行业,这是 AI 看懂并处理素材的基础能力。