说话人的身份、在航海、航空红外照片中进行自动目标的识别。对人脸及其特征检测的研究有益于相似特征提取及目标检测和识别问题的研究。人脸检测任务的完成涉及从复杂的背景中分割、抽取、验证人脸区域和可能乃至的人脸特征(如眼睛、唇色等)。成功的人脸检测系统应能处理实际存在的光线、人脸方向和距离照相机远近变化等各种情况。
(二)人脸检测技术的发展背景
人脸检测没什么近些年发展的如此迅速,主要原因有正面两种:一是人机交互方式的发展,二是生物特征识别的发展。首先,人脸检测技术的提出是人机交互发展的需要。人机交互方式,经过第一代的单一文本形式到第二代的图形用户接口的发展,正在向以人为本的方向发展。人们提出了智能人机接口的概念,希望计算器具有或部分具有人的某些智能内同计算机的交流变得像人与人之间的交流一样轻松自如。
用户是人机界面中的主体,计算机作为一种“智能体”参与了人类的通讯活动。在处理人——机关系时,根据“人为中心”的思想,应当康健老虎人的因素。因此,智能接口系统要解决的首要问题是计算机如何感知使用者的存在,这是人机交互的前提。脸部是人类携带信息最丰富的部位,是人类的重要特征。从认知角度讲,人们在视觉信道层次上感知和识别人的首要信息载体就是人脸。使计算器具有感知到人是否存在的视觉功能,这项技术就是人脸检测。
其次,在生物特征识别技术中,作为人脸自动识别系统的先决条件,人脸检测技术有着十分重要的作用。在现代社会中,传统的身份鉴定方式(例如口令、信用卡、身份卡等),存在携带不便、容易遗失、或者由于使用过多或不当而损坏、不可读和密码易被破解等诸多问题,已不能很好地满足各种安全需要并显得越来越不适应现代科技的发展和社会的进步。因此,人们希望有一种更加可靠的办法来进行身份鉴定;生物特征识别技术给这一切带来可能。生物特征识别技术是通过利用个体我有的生理和行为特征来达到身份识别和个体验证目的的一门科学。尽管人们可能会遗忘或丢失他们卡片或忘记密码,但是却不可能遗忘或丢失他们的生物特征如人脸、指纹、虹膜、掌纹等的特征或声音等。
在生物特征识别技术中,近年来以人脸为特征的识别技术发展十分迅速。相对而言,人脸识别是一种更直接、更方便、更友好、更容易被人们接受的非侵犯性识别方法。作为人脸自动识别系统的第一步,人脸检测技术有着十分重要的作用,它为后续的人脸分类提供了待识别人脸的具体信息。
(三)人脸检测的分类
人脸检测问题所包含的内容十分广泛,从不同的角度可以有多种分类方法如(表1)。
表1 人脸检测的分类
分类依据 图像来源 颜色信息 人脸姿态 人脸个数 图像复杂程度 彩色图像 正面 单人人脸检测 简单背景人脸检测
(四)人脸检测方法
类别 静态图像 动态图像 灰色图像 多姿态 未知人脸个数的检测 复杂背景人脸检测 经过了几十年的研究发展,人们对人脸检测的学习和研究主要形成以下几大类的方法:
1.基于统计模型的方法
总的来说,这种方法遵循一种统一的模式,即首先通过学习,在大量训练样本集的基础上建立一个能对人脸和非人脸样本进行正确识别的分类器,然后对被检测图像进行全局扫描,用分类器检测扫描到的图像窗口中是否包含人脸。若有,则给出人脸所在的位置。
采用这种检测模式的理论依据是:人脸具有统一的结构模式(都是由眉毛,眼睛,鼻子和嘴唇等人脸器官构成),如果把所有的图像集看作一个高维线性空间,那么整个人脸图像集仅对应于其中的某个子空间。于是可以通过检验待测图像窗口是否落在这个子空间中来是否为人脸。因此,可以通过大量的人脸和非人脸样本来建立一个分类器,使它能够正确分辨这两种不同的图像模式,再利用训练好的分类器在未知的图像中检测人脸。采用这种检测策略的关键在于如何选取大量的具有代表性的图像样本 。特别是非人脸图像样本训练分类器。
具体分类器的实现可以采用不同的策略,下面就介绍几种方法:
(1)人工神经网络
MIT(麻省理工大学)的学者首先对人脸样本集和非人脸样本集聚类,以测试样本与人脸样本集和非人脸样本集的子类之间的距离作为识别特征微量,利用多层感知(MLP)网络作为分类器。CMU的研究人员直接以图像作为神经网络的输入,设计了一个具有
独特结构的适用于人脸特征的神经网络分类器,并且通过前馈神经网络对检测结果优化。他们工作的共同之处是都采用了自调整(bootstrap)的学习原理,对分类器一边训练,一边测试,并把在测试过程 中的错误分类结果作为反倒样本加入学习过程,从而减少了样本集的规模,并表叔的提高了神经网络的分类性能。
特别值得一提的是CMU的Rowley等的工作,他们使用了多个ANN检测多姿态的人脸,算法的框架如图1所示。图中显示了两类ANN:一个位姿检测器用于估计输入窗口中人脸的位姿、三个检测器分别检测正面、半侧面和侧面的人脸。使用经过对准和预处理的“人脸”样本以及采用“自举”方法收集分类器错分的样本作为“非人脸”样本训练各个ANN,进一步修正分类器。检测时对输入图像中所有可能位置和尺度的区域首先使用位姿检测器估计人脸位姿,经校准和预处理后送入三个检测器中,最后对检测器的分类结果进行仲裁。
正面人脸检测 输 入 图 象 窗口提取 位姿估计 预处理 结果仲裁 检测 结果 侧面人脸检测 半侧面人脸检测 图1 Rowley的基于人工神经的人脸检测框架
在上述框架下,Rowley等对正面端正人脸和正面旋转人脸的检测单独进行了研究。对于正面端正的人脸,仅使用了正面人脸检测ANN,是一种三层前向网:输入层对应20*20像素的图像区域;隐层节点分为对应不同人脸区域的若干组,与输入层部分连接;ANN输出1到-1区间的值表示这个区域是否为人脸。Rowley等使用相同的“人脸”样本和不同“自举”过程收集的“非人脸”多个正面人脸检测ANN,对它们的检测结果进行仲裁,以进一步减少错误报警。对于正面旋转人脸的检测使用了旋转角度检测器及正面人脸检测ANN,并使用相似的多ANN仲裁方法降低错误报警。
(2)支持向量机
支持向量机此方法由Boser、Guyon、Vapnik等人在COLT-92上首次提出。作为一种分类算法,广泛应用于模式识别的各个分支。支持向量机方法是建立在统计学习理论的VC(Vapnik Cherovnenkis)维理论和结构风险最小代原理基础上的,根据有限的样本信息在模型的复杂性和学习能力之间寻求最佳斤斤折衷,以期获得最好的推广能力。传统
的使用经验风险最小代的分类训练方法,例如神经网络,人间缺少严密的数学解释。而支持向量机使用结构风险最小代来寻找最优类面,在数学上,证明了这等价于寻找最小真实风险。所以支持向量机在有限样本的条件下的推广能力很好。
支持向量机通过构造风险最小的分类面来解决一个二类问题,这相当于使训练集中的最靠近分类的点距离分类面最远。这些距离分类面最近的点叫做支持向量。
如图2所示这是一个二维线性可分的例子,灰色的区域表示所有可能将数据正确分类的分类面的集合。在图3中最优分类面距离支持向量的距离最远。
图2 图中的灰色区域表示所有可以把数据正确分类的分类面的集合
图3 最优分类面f=0到最近的点的距离最远,这些距离分类面最远的点叫做支持向量
(3)基于隐马乐可夫模型的方法
隐马乐可夫模型是用于描述信号统计我的一组统计模型。HMM使用隐马乐可夫链来模拟信号统计特征的变化,而这种变化又是间接地通过观察序列来描述的,因此,隐马乐可夫过程是一个双重的随机过程。在HMM中,节点表示状态,有向边表示状态之间的转移,一个状态可以具有特征空间中的任意特征,对同一特征,不同状态表现出这一特征的概率不同。由于HMM是一个稀有统计模型,对于同一特征序列,可能会对应于许多序列,特征序列与状态序列之间的对应关系是非确定的。这种模型对于状态序列来说是隐的。外界只能看到各个时刻的输出值,故称为隐马乐科夫模型。
HMM的打分、解碼和训练相应的算法是前向算法、Viterbi算法和前向后向算法。它把人扔模式看作参数化的随过程,把人面部的额头、眼睛、鼻子、嘴巴和下巴等器官所在部位看作随机过程的状态,通过对符合人脸各器官公布的随机过程 的检测来实现对人脸检测。这正好是隐马乐可夫模型容易做到的。
Nefian等采用隐马乐可夫模型检测人脸。检测区域中的每个子区域采用主要的Karhunen-loeve变换系数作为观察适量,通过Baum-Welch算法和Viterbi分割算法获得HMM的模型参数,根据检测区域的观察序列的输出概率进行判决。 2.基于范本匹配的方法
早期的基于范本匹配的方法是这样做的:首先建立一个标准的人脸模板,由包含局部人脸特征的子模板构成,然后对一幅输入图像进行全局搜索,对应不同尺度大小的图像窗口,计算与标准人脸模板中不同部分的相关系数,通过预先设置的阈值来判断该图像窗口中是否包含人脸。Poggio利用基于模板的方法来定位眼睛的位置,他们把标准的眼睛模板调整为5个不同的尺寸,然后在输入图像中找寻眼睛。这种简单范本匹配的方法易于实现,但是也存在着缺点:图像噪声对检测结果影响很大,因此需要对输入图像做适当的预处理;标准模板的大小是人为设定的,因此不能动态检测眼睛的位置。下面是2种范本匹配方法。
(1)固定模板匹配法
根据人脸的先验知识先设计出人脸轮廓模板以及各个器官特征的子模板,然后通过计算样本图像中区域和人脸轮廓模板的相关值来检测出人脸候选区域,最后利用器官特征子模板验证上一步检测出的人脸候选区域是否包含人脸。但由于人脸特征的变化很大,很难得到有效的模板来表示人脸的共性,也不能有效处理尺度、姿态和形状的变化。这种方法目前已不多见,但人们在有的系统中将其作为粗检测或预处理的手段。