研究生毕业,9年媒体算法开发经验,涉及音视频图像文本,负责过音频前后端处理,弱网优化,音视频质量提升,智能内容安全审核“T网”,内容理解“T悟”等大型项目。曾作为“灵声讯”创始人,参与智能媒体技术自媒体运营和推广。
随着泛娱乐社交和 AIGC 的快速发展,积极响应国家号召打造天朗气清的互联网环境成了内容审核的关键。为了实现高效的、准确的实时审核,基于AI技术打造一站式智能审核平台变得尤为重要。
本次分享主要是针对海量语音内容的审核场景提出了四维一体的多媒体审核技术和流程,其中包括音频事件检测,语音识别,语义理解,音频+文本多模态识别,图像识别等内容。通过对特定场景的分析和优化,建设性的提出了基于多模态内容识别的怒骂和炸房标签,为进一步净化语音生态提供了技术支撑。
最终,通过多轮迭代,怒骂和炸房多模态标签准确率达到业界领先水平。其它常规标签,如娇喘,涉政,涉黄,涉爆,违禁,广告,一号领导人声纹等都与业内水平持平,以一系列AI技术构建的大规模多模态智能内容审核平台“T网”也承接了集团内绝大部分内容审核流量。同时,对于目的爆火的 AIGC 应用也严格按照国家要求进行了相关内容审核,保证了生成式内容的可管可控。
演讲提纲:
你将获得:
前沿亮点:



