来源:Multimedia 发布时间:2026/9/4 15:40:05
选择字号:
一种由 Airflow 编排、用于播客转录、主题建模与内容推荐的 AI 流水线 | MDPI Multimedia

论文标题:An Airflow-Orchestrated AI Pipeline for Podcast Transcription, Topic Modeling, and Recommendation System

论文链接:https://www.mdpi.com/3042-6308/2/1/1

期刊名: Multimedia

期刊主页:https://www.mdpi.com/journal/multimedia

一、引言

播客已经成为教育、信息传播和娱乐领域的重要内容载体,但音频本质上属于非结构化数据,无法直接被搜索引擎读取和分析,必须先经过语音识别、内容分类和语义表示,才能转化为可检索、可组织的数字资源。Youth Radio平台目前已收录超过1.1万期多语言播客,总时长达到2431小时26分27秒,并且仍在持续增长。录音设备、音质、背景噪声、语言环境和节目长度各不相同,进一步增加了自动化处理的难度。

这项研究的主要贡献不在于提出新的基础模型,而在于将多个成熟的AI组件整合为一套可扩展、可监控、可维护的生产级工作流,从而打通播客从原始音频处理到智能检索与个性化推荐的完整链路。

二、相关工作

围绕播客智能处理,现有研究已覆盖内容检索、节目分段、自动摘要、章节生成、语音识别和用户推荐等方向。TREC播客检索任务、Spotify播客数据集、多模态主题分割研究及希腊语播客语料库,也为相关模型的开发与评估奠定了基础。

不过,单项任务表现良好,并不意味着多个模型能够直接在真实平台中稳定运行。任务依赖、数据同步、计算资源分配、异常恢复和增量更新等工程问题仍需统一管理。因此,从实验原型走向生产环境,不仅需要性能良好的模型,还需要能够调度和监控各处理环节的系统架构,Airflow在该平台中正承担这一工作流编排角色。

三、系统架构概述

平台将在线服务与AI计算分开部署:两台Web服务器负责用户交互、播客管理和搜索,独立的AI服务器承担转录、分类、主题建模和推荐等任务,音频及相关数据则集中存储。

处理后的文本向量与节目元数据被写入Qdrant向量数据库。多服务器架构既能避免后台AI计算影响用户访问,也便于根据业务需求独立扩展各类服务。

四、AI流水线

转录与上下文相关的语法校正:播客首先由FasterWhisperXXL生成带时间戳的转录文本。该模型在多种Whisper模型的对比中取得了11.0%的词错误率和4.3分的人工质量评分,在准确率、处理速度和资源占用之间表现出较好的平衡。

随后,Gemini 2.5 Flash-Lite结合上下文修正拼写、标点和局部识别错误,同时保留原有语义。在100期人工校正的参考样本中,词错误率低于10%的文本比例由41%提高至55%。

音频分类与主题建模:BEATs用于识别语音、音乐、掌声和环境声等音频事件,BERTopic则从转录文本中提取潜在主题。对于预设的教育类别,系统通过MPNet进行主题匹配;在包含47个类别的测试中,正确主题排名第一的比例为39%,进入前三名的比例达到68%。

嵌入生成、检索与推荐系统:完整的播客文本通过LaBSE转换为语义向量,并与主题、语言和音频类别等元数据一同存入Qdrant。即使向量规模扩展至100万个,平均查询延迟仍低于20毫秒。推荐系统根据用户的收听、点赞和收藏记录寻找相似内容。人工盲评显示,分别保留不同兴趣向量比将其合并为单一平均向量更能反映用户的多样化偏好,因此被选为默认推荐策略。

五、Airflow编排与部署

播客与用户流水线: Airflow将处理流程分为播客与用户两类任务。播客任务每30分钟运行一次,负责处理新增或更新的内容;用户任务每5分钟运行一次,使收听、点赞和关注等行为能够较快反映在推荐结果中。

新节目上传后,音频文件和元数据首先写入NAS及Web端数据库,并进入MySQL任务队列。Airflow在下一调度周期依次触发转录、校正、分类、向量生成和数据同步,处理结果写入Qdrant后即可用于搜索与推荐。内容的更新和删除也由相应流水线完成,以保持元数据、向量索引与用户画像的一致性。

可扩展性与批处理性能:增加后端副本能够明显提升处理效率。采用4个后端副本时,系统每小时约可处理120期10分钟播客、60期20分钟播客或45期30分钟播客。随着音频时长增加,AI模型推理逐渐成为主要性能瓶颈。

生产可靠性与MLOps实践:系统设置了自动重试、失败通知和任务恢复机制,出现异常时可以单独重新执行失败环节。Airflow还用于记录运行状态和历史日志,并结合版本管理与人工部署验证,保障系统的长期稳定运行。

分类任务所使用的数据和类别约每六个月更新一次,模型本身暂时保持不变。所有生产更新仍需经过人工审核和部署,以避免未经验证的变化影响系统稳定性。

图1. 由 Airflow 编排的播客处理 AI 流水线

六、实施考量

平台目前管理着European School Radio十三年来积累的超过350 GB音频及相关数据。随着内容库不断扩大,系统不仅需要考虑计算效率,也需要兼顾数据治理、隐私保护和长期保存。服务器之间通过RESTful API和异步API通信,使在线请求与后台批处理保持相对独立。增量索引和事件驱动的数据同步机制,则使新内容或用户行为发生变化后,无须重新处理整个数据库。

用户数据经过假名化处理,并结合数据最小化、用户同意和AI透明度机制支持相关隐私保护要求。元数据参考Dublin Core和Schema.org标准进行整理,长期存储采用带有RAID-5和AES-256加密的NAS基础设施。模块化架构、增量更新、任务监控、版本追踪和数据保护,共同构成了这套生产级AI系统持续运行的基础。

七、结论

经过转录、分类和语义分析,播客不再只是一段难以浏览的长音频,而是能够被搜索、组织、引用和推荐的数字内容资源。

普通用户可以通过自然语言发现真正相关的节目;教师和教育工作者可以根据主题快速筛选音频,将带时间戳的文本用于课堂讨论、语言练习、作业设计或教学材料;推荐系统还能够发现不同节目和主题之间的潜在联系,帮助用户跨越栏目和系列的边界探索内容。

目前的评估数据仍以希腊语播客为主,推荐效果主要依据人工相关性判断,尚未通过点击率、收听时长等真实用户指标完成系统性的A/B测试;性能评估也主要集中于流水线内部组件,未与其他端到端系统进行基准比较。因此,现有结果更适合用于说明系统的工程可行性,而非证明其算法优于其他方案。未来还需纳入更多语言与用户行为数据,进一步验证系统的通用性和实际推荐效果。

尽管如此,这套系统已经展示出一条清晰的工程实践路径:AI在音频平台中的价值,不仅取决于某个模型的单项性能,更取决于转录、理解、检索和推荐等环节能否被可靠地组织为一个完整、可持续运行的系统。

Kazlaris, I.; Papadopoulos, G.; Diamantaras, K.; Delianidi, M.; Touliou, E.; Yenitzes, A. An Airflow-Orchestrated AI Pipeline for Podcast Transcription, Topic Modeling, and Recommendation System. Multimedia 2026, 2, 1.

期刊介绍

主编:Prof. Dr. Michele Nappi, University of Salerno,Italy

期刊Multimedia(ISSN 3042-6308)创刊于2025年,是一个国际性的、经同行评审的开放获取期刊。期刊致力于通过计算驱动的解决方案推进多媒体计算的技术基础以及其社会应用。

期刊旨在发表推动多媒体系统基础(如算法、架构与计算框架)的创新研究,和运用计算方法探究多媒体技术在全球范围内影响和塑造人类行为、文化习俗与社会规范的原创工作。

期刊欢迎基于多媒体数据与系统的计算研究,以分析个体、群体与社会的行为与互动,以及其与数字、物理和自然环境的关系。

 
 
 
特别声明:本文转载仅仅是出于传播信息的需要,并不意味着代表本网站观点或证实其内容的真实性;如其他媒体、网站或个人从本网站转载使用,须保留本网站注明的“来源”,并自负版权等法律责任;作者如果不希望被转载或者联系转载稿费等事宜,请与我们接洽。
 
 打印  发E-mail给: 
    
 
相关新闻 相关论文

图片新闻
新设计多孔电极提升液流电池性能 带电雨滴会引起腐蚀
罗曼太空望远镜将对宇宙进行全景式观测 NASA放弃空间望远镜救援任务
>>更多
 
一周新闻排行
 
编辑部推荐博文