AI虚拟点读机,手势识别+OCR+语音TTS

开发 前端 人工智能
TTS​如果是Mac​可以使用系统自带的,不需要安装其他程序。如果是Windows​可以使用微软的edge-tts。edge-tts​效果比大部分tts强太多。

哈喽,大家好。

最近在研究AIGC方面的内容,好久没有更新公众号内容。

今天给大家分享的是用计算机视觉技术做一个虚拟点读机。

图片图片

技术上很简单,只不过工程实现先有些细节需要注意。

1. 思路

  1. OpenCV读取视频流,识别食指坐标
  2. 用两个食指坐标作为顶点,画一个矩形框
  3. 截取矩形框,送入OCR模型识别文本
  4. 用语音合成引擎TTS将文本合成语音
  5. 调用音频播放模块,播放声音

2. 细节处理

OpenCV读取视频流、mediapipe识别食指坐标,之前的分享的文章都有代码,这里就不贴了,重点说下需要处理的细节。

细节1. 检测到两个食指时,需要设置一个时间间隔,这样可以给你预留一些时间来调整矩形框

if self.point_start_time is None:
    # 首次同时检测到左右食指
    self.point_start_time = time.time()
else:
    time_del = time.time() - self.point_start_time
    if time_del > 3:

图片图片

细节2. 设置标记,防止重复识别

矩形框一旦确定,如果没有标记,每一帧都会送入OCR模型识别、然后播放声音,这样程序就会卡死。

需要设置标记,保证任何时刻只处理一个矩形框。

if not self.is_processing:
  # 开始识别
  self.is_processing = True
  # ocr识别选定的图片
  t, b = min(p0_y, p1_y), max(p0_y, p1_y)
  l, r = min(p0_x, p1_x), max(p0_x, p1_x)

  selected_frame = frame[t:b, l:r]
  # ocr识别文字
  text = self.ocr_rec(selected_frame)
  # 文本转语音
  voice = self.tts.get_speech(text)
  # 播放语音
  self.player.play(voice, False, notallow=lambda: self.stop_play())
  self.pc_time = time.time()

细节3. 多线程处理

播放音频的时候需要用多线程播放,不然主程序会卡死,知道音频播放完成才能继续运行。

如果识别的内容很多,播放时间长,程序就会一直卡着很长时间没有反应。

3. 其他技术

关于OCR和TTS技术之前的文章都有介绍过。

OCR直接用Paddle框架和预训练好的模型就行。

TTS如果是Mac可以使用系统自带的,不需要安装其他程序。如果是Windows可以使用微软的edge-tts。edge-tts效果比大部分tts强太多。

也可以用d-id、wav2lip或者sadtalker实现唇形合成,让静态图片朗读文本内容。

责任编辑:武晓燕 来源: 渡码
相关推荐

2022-10-24 08:40:14

AI虚拟手势计算

2021-05-06 11:13:06

人工智能语音识别

2021-05-06 11:18:23

人工智能语音识别

2021-12-24 10:34:11

鸿蒙HarmonyOS应用

2014-11-12 10:16:43

人工智能灵云

2022-05-17 12:25:59

物联网智能建筑楼宇自控

2020-09-21 07:00:00

语音识别AI人工智能

2011-03-01 15:02:54

Qt

2024-06-20 11:11:07

2023-09-07 10:37:43

OCR项目字符串

2024-07-30 11:21:17

TTSAIAgent

2024-05-31 08:12:19

2013-05-07 17:21:09

ELMOS芯片手势识别

2010-11-01 09:46:21

ViewAndroid

2023-12-25 19:21:55

ocr人工智能

2021-04-09 20:49:44

PythonOCR图像

2020-12-25 09:29:40

人工智能AI深度学习

2019-05-14 10:02:43

AI 数据人工智能

2015-07-09 13:58:28

tesseract教程OCR教程

2011-05-31 16:38:47

Android 实现语音
点赞
收藏

51CTO技术栈公众号