前往小程序,Get更优阅读体验!
立即前往
首页
学习
活动
专区
工具
TVP
发布
社区首页 >专栏 >腾讯 AI Lab 计算机视觉中心人脸 & OCR 团队近期成果介绍(1)

腾讯 AI Lab 计算机视觉中心人脸 & OCR 团队近期成果介绍(1)

原创
作者头像
周景超
修改2017-07-25 10:31:32
3.1K1
修改2017-07-25 10:31:32
举报

导语:腾讯 AI Lab 计算机视觉中心人脸&OCR 团队专注于领域内国际前沿技术研究与应用,近期取得部分成果,这里和大家分享一下。

1. 人脸检测研究进展 

1.1 WIDER FACE 评测结果

WIDER FACE 是由中国香港中文大学维护的人脸检测国际权威评测平台,包含训练集、验证集和测试集,总共有 3.2 万张图像,39 万个标注人脸,标注人脸有很大程度的尺寸、姿态和遮挡等变化,是目前国际上最大的也是最有挑战性的人脸检测的国际评测平台。WIDER FACE 数据集提供了三个子数据集(Easy、Medium、Hard)用于性能评估,采用 PR 曲线评测算法性能。我们团队研发的人脸检测算法 Face R-CNN 在 WIDER FACE 的三个子数据集(Easy、Medium、Hard)的验证集和测试集上均取得了第一的成绩(如下图),该结果已于 6 月初发表于 WIDER FACE 的官网上(http://mmlab.ie.cuhk.edu.hk/projects/WIDERFace/WiderFace_Results.html) 。相关技术文档(Hao Wang, Zhifeng Li, Xing Ji, Yitong Wang. Face R-CNN. arXiv preprint arXiv:1706.01061, 2017.)也已发布在 arXiv 上(https://arxiv.org/abs/1706.01061)

图 1. WIDER FACE 上的评测结果对比 

图 2. WIDER FACE 上的人脸检测结果样例(绿框是我们检测到的人脸,红框是官方发布的人脸)。

1.2 FDDB 评测结果

FDDB(Face Detection Data Set and Benchmark)是美国马萨诸塞大学维护的人脸检测国际评测平台。它是一个无约束自然场景的人脸检测数据集,该数据集总共包含不同自然场景下拍摄的 2845 张图像,5171 个标注人脸,使用 ROC 曲线评测算法性能。我们团队研发的 Face R-CNN 算法在 FDDB 上也取得了国际领先的成果,我们在 2000 个误报样本的条件下取得了 98.74%的召回率,排名第一。该结果也已于 6 月初发表在 FDDB 的官网上。

相关链接:http://vis-www.cs.umass.edu/fddb/results.html

图 3. FDDB 上我们的离散 ROC 曲线(discrete ROC curve)和近期 published 经典方法的对比。

 表一. FDDB 上的离散得分性能对比(2000 误检数时)

图 4. FDDB 上的人脸检测结果样例(绿框是我们检测到的人脸,红圈是官方发布的人脸)。

2. OCR 研究进展 

ICDAR(International Conference on Document Analysis and Recognition)是一个聚焦于 OCR 领域技术研究的国际权威会议,设有多项竞赛,和公司业务接近的有互联网图片(Born-Digital Images)和自然场景图片(Focused/Incidental Scene Text Images)中的文本提取的竞赛,每个竞赛包含定位、分割、识别和端到端四个任务。近来由于 RNN 的出现,对于检测到的单词可以直接去做识别,所以分割这个任务已没有太大意义。我们团队针对 TEG 的业务范围,目前聚焦在互联网图片上。 

2.1 ICDAR Born-Digital Images Task1 Text Localization

Born-Digital 文本检测任务在网页图像构成的数据集上进行,训练集 410 幅,测试集 141 幅。在训练网络时,对训练集进行多种变形,扩充,实际训练集在 4000 幅左右。采用 FCN 作为检测网络,在文本检测任务上取得了第一名的成绩。

相关链接:http://rrc.cvc.uab.es/?ch=1&com=evaluation&task=1

图 5. 文本检测任务上的排名

图 6. 部分检测结果及评价标准,更多的结果可在网站上查询。 

2.2 ICDAR Born-Digital Images Task3 Word Recognition

Born-Digital 单词识别任务在上述图像中抠出单词区域,四个边界向外扩展 4 个像素点,构成数据集,训练集 3567 幅,测试集 1439 幅。在训练网络时,使用外部数据集约 900 万幅。采用 CNN 提取图像特征,采用 RNN 学习序列关系,进行识别,在单词识别任务上取得了第一名的成绩。

相关链接:http://rrc.cvc.uab.es/?ch=1&com=evaluation&task=3

图 7. 单词识别任务上的排名

图 8. 部分识别结果及其评价标准,更多的结果可在网站上查询

团队秉承"专业、服务、伙伴"的理念,不断夯实基础,做有原创性的研究和坚实的工作,为伙伴部门提供高品质的技术支持,目前已承担多项部门内和跨部门的合作项目。

原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。

如有侵权,请联系 cloudcommunity@tencent.com 删除。

原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。

如有侵权,请联系 cloudcommunity@tencent.com 删除。

评论
登录后参与评论
0 条评论
热度
最新
推荐阅读
目录
  • 1. 人脸检测研究进展 
    • 1.1 WIDER FACE 评测结果
      • 1.2 FDDB 评测结果
      • 2. OCR 研究进展 
        • 2.1 ICDAR Born-Digital Images Task1 Text Localization
          • 2.2 ICDAR Born-Digital Images Task3 Word Recognition
          相关产品与服务
          人脸识别
          腾讯云神图·人脸识别(Face Recognition)基于腾讯优图强大的面部分析技术,提供包括人脸检测与分析、比对、搜索、验证、五官定位、活体检测等多种功能,为开发者和企业提供高性能高可用的人脸识别服务。 可应用于在线娱乐、在线身份认证等多种应用场景,充分满足各行业客户的人脸属性识别及用户身份确认等需求。
          领券
          问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档