当前位置:首页 > 文章列表 > 科技周边 > 人工智能 > 腾讯OCR团队斩获ICDAR大赛四项冠军

腾讯OCR团队斩获ICDAR大赛四项冠军

来源:机器之心 2023-10-21 19:18:01 0浏览 收藏

本篇文章给大家分享《腾讯OCR团队斩获ICDAR大赛四项冠军》,覆盖了科技周边的常见基础知识,其实一个语言的全部知识点一篇文章是不可能说完的,但希望通过这些问题,让读者对自己的掌握程度有一定的认识(B 数),从而弥补自己的不足,更好的掌握它。

在全球文字识别(OCR)领域顶级盛会ICDAR 2023上,腾讯OCR团队基于自研算法,斩获四项冠军,这是继2017年、2019年、2021年以来,连续四届参会同时创造佳绩,共获得18项官方认证冠军,展示了腾讯OCR技术在全球的一流水平。

ICDAR大会是全球文档图像分析识别领域公认的权威学术会议,每两年举办一次,赛事举办至今已经吸引了超过100多个国家的近8000支队伍参与其中。ICDAR竞赛因其极高的技术难度和强大的实用性享誉国内外,与赛后非正式刷榜不同,ICDAR官方认证的正式竞赛采用全新的数据集,并且在比赛期间不公布参赛团队的信息和成绩,同时限制了结果提交时间和次数,属于高难度的“盲打”。

今年,腾讯OCR参赛团队是由腾讯数据平台部、微信技术架构部联合组成,重点参加了DSText(稠密小文本视频文本识别)和SVRD(结构化信息抽取)两大项目的比赛,取得4项赛道冠军。

DSText赛道,腾讯包揽全部两项冠军

DSText(稠密小文本视频文本识别)竞赛设置了2个任务:视频文本跟踪、视频文本端到端识别。由于文字非常密集且非常小,再加上环境干扰(相机抖动、运动模糊、光照变化等)与后期编辑(多镜头切屏、人工背景、游戏界面切换等),从视频帧中准确检测、跟踪、识别文本对算法鲁棒性要求很高,挑战性极大。部分比赛视频帧展示如下:

腾讯OCR团队斩获ICDAR大赛四项冠军

ICDAR-DSText竞赛示意帧

在DSText竞赛的全部2个任务中,腾讯OCR团队均以绝对领先的优势获得冠军。

其中,任务1中,旨在跟踪视频中所有文本流,将视频帧间属于同一个文本实例的检测框聚合起来,评价指标是MOTA,腾讯以领先第二名12.04%的成绩取得冠军。

腾讯OCR团队斩获ICDAR大赛四项冠军视频文本跟踪:冠军证书

在任务2中,旨在评估视频文本识别的端到端性能,任务要求在每一帧上正确检测文本,在视频帧上正确跟踪,并在序列级别正确识别,评价指标是OCR-MOTA,腾讯以领先第二名11.93%的成绩取得冠军。

腾讯OCR团队斩获ICDAR大赛四项冠军视频文本端到端识别:冠军证书

SVRD赛道,腾讯以绝对优势获得两项冠军

SVRD(结构化信息抽取)竞赛包含HUST-CELL和BAIDU-FEST两大赛道共4个任务:复杂文档实体关系提取(E2E Complex Entity Linking)、复杂文档实体语义提取(E2E Complex Entity Labeling)、零样本结构化信息抽取(E2E Zero-shot Structured Text Extraction)和小样本结构化信息提取(Few-shot Structured Text Extraction)。由于文档图像版式复杂、结构多样,自然场景图像采集不规范、存在背景复杂、折损、弯曲、形变等问题,竞赛存在较大的挑战难度。部分比赛图片展示如下:

腾讯OCR团队斩获ICDAR大赛四项冠军

ICDAR-SVRD结构化信息抽取大赛样例

在SVRD竞赛中腾讯OCR团队共获得了2个冠军。

其中,任务2(E2E Complex Entity Labeling)旨在提取复杂文档图像上的语义实体,如标题、机构名、日期、金额、数字、商品名、人名等,腾讯在这个任务上以较大优势取得了冠军

腾讯OCR团队斩获ICDAR大赛四项冠军

E2E Complex Entity Labeling:冠军证书

任务4(E2E Few-shot Structured Text Extraction)赛题需要在提供非常少量训练数据的前提下,提取10个不同场景下的图像的关键信息,如银行卡、营业执照、出租车发票、购物小票、交通发票、定额发票、论文等场景下的关键信息,腾讯同样取得了冠军。

腾讯OCR团队斩获ICDAR大赛四项冠军

E2E Few-shot Structured Text Extraction:冠军证书

据介绍,腾讯OCR团队是腾讯内部致力于研究和开发OCR技术的专业团队,团队在技术上自主研发了高精准度、高稳定性的文本检测和识别技术,在应用上,支持了腾讯内数百个业务场景,如腾讯广告、微信、QQ、腾讯云、腾讯视频、腾讯信息流产品。

终于介绍完啦!小伙伴们,这篇关于《腾讯OCR团队斩获ICDAR大赛四项冠军》的介绍应该让你收获多多了吧!欢迎大家收藏或分享给更多需要学习的朋友吧~golang学习网公众号也会发布科技周边相关知识,快来关注吧!

版本声明
本文转载于:机器之心 如有侵犯,请联系study_golang@163.com删除
新一代vivo X100系列手机获得工信部认证 支持120W有线快充新一代vivo X100系列手机获得工信部认证 支持120W有线快充
上一篇
新一代vivo X100系列手机获得工信部认证 支持120W有线快充
阿里达摩院发布遥感AI大模型,让AI进一步下沉到田间地头
下一篇
阿里达摩院发布遥感AI大模型,让AI进一步下沉到田间地头
查看更多
最新文章
查看更多
课程推荐
  • 前端进阶之JavaScript设计模式
    前端进阶之JavaScript设计模式
    设计模式是开发人员在软件开发过程中面临一般问题时的解决方案,代表了最佳的实践。本课程的主打内容包括JS常见设计模式以及具体应用场景,打造一站式知识长龙服务,适合有JS基础的同学学习。
    542次学习
  • GO语言核心编程课程
    GO语言核心编程课程
    本课程采用真实案例,全面具体可落地,从理论到实践,一步一步将GO核心编程技术、编程思想、底层实现融会贯通,使学习者贴近时代脉搏,做IT互联网时代的弄潮儿。
    508次学习
  • 简单聊聊mysql8与网络通信
    简单聊聊mysql8与网络通信
    如有问题加微信:Le-studyg;在课程中,我们将首先介绍MySQL8的新特性,包括性能优化、安全增强、新数据类型等,帮助学生快速熟悉MySQL8的最新功能。接着,我们将深入解析MySQL的网络通信机制,包括协议、连接管理、数据传输等,让
    497次学习
  • JavaScript正则表达式基础与实战
    JavaScript正则表达式基础与实战
    在任何一门编程语言中,正则表达式,都是一项重要的知识,它提供了高效的字符串匹配与捕获机制,可以极大的简化程序设计。
    487次学习
  • 从零制作响应式网站—Grid布局
    从零制作响应式网站—Grid布局
    本系列教程将展示从零制作一个假想的网络科技公司官网,分为导航,轮播,关于我们,成功案例,服务流程,团队介绍,数据部分,公司动态,底部信息等内容区块。网站整体采用CSSGrid布局,支持响应式,有流畅过渡和展现动画。
    484次学习
查看更多
AI推荐
  • 赛林匹克平台:科技赛事聚合,赋能AI、算力、量子计算创新
    赛林匹克平台(Challympics)
    探索赛林匹克平台Challympics,一个聚焦人工智能、算力算法、量子计算等前沿技术的赛事聚合平台。连接产学研用,助力科技创新与产业升级。
    16次使用
  • SEO  笔格AIPPT:AI智能PPT制作,免费生成,高效演示
    笔格AIPPT
    SEO 笔格AIPPT是135编辑器推出的AI智能PPT制作平台,依托DeepSeek大模型,实现智能大纲生成、一键PPT生成、AI文字优化、图像生成等功能。免费试用,提升PPT制作效率,适用于商务演示、教育培训等多种场景。
    19次使用
  • 稿定PPT:在线AI演示设计,高效PPT制作工具
    稿定PPT
    告别PPT制作难题!稿定PPT提供海量模板、AI智能生成、在线协作,助您轻松制作专业演示文稿。职场办公、教育学习、企业服务全覆盖,降本增效,释放创意!
    17次使用
  • Suno苏诺中文版:AI音乐创作平台,人人都是音乐家
    Suno苏诺中文版
    探索Suno苏诺中文版,一款颠覆传统音乐创作的AI平台。无需专业技能,轻松创作个性化音乐。智能词曲生成、风格迁移、海量音效,释放您的音乐灵感!
    16次使用
  • PicDoc:AI文本转视觉图表,告别枯燥文字,一键生成PPT图例
    PicDoc
    PicDoc,AI驱动的文本转视觉平台,轻松将文字转化为专业图表、思维导图、PPT图例。免费试用,无需下载,提升职场汇报、教学资料、文章配图等场景的表达力。
    17次使用
微信登录更方便
  • 密码登录
  • 注册账号
登录即同意 用户协议隐私政策
返回登录
  • 重置密码