← 返回簡憶生詞本文章

使用 Google Colab 和 OpenAi 語音轉文字 API(Whisper)提取並學習音訊、影片中的單字

本文介紹如何在 Google Colab 中使用 Open AI 的 Whisper 語音轉文字 API 將音訊或影片轉換為 SRT 文件並匯入《簡憶生詞本》的音訊目錄,以便學習和記憶其中的單字並練習外語聽力。

1. 在瀏覽器中打開網址 https://colab.research.google.com

2. 點選「添加筆記本」,在上方「程式碼執行程式」選單中選擇「更改執行階段類別」,在「硬體加速器」中選擇 GPU。

3. 在筆記本中輸入以下程式碼並點選左側執行按鈕:

!pip install git+https://github.com/openai/whisper.git

!sudo apt update && sudo apt install ffmpeg

4. 如果要提取影片文件中的文字,可以在 Mac 上輸入以下命令將影片轉換為 mp3:

brew install ffmpeg

ffmpeg -I input.mp4 input.mp3

5. 點選 Colab 左側目錄圖示,將音訊文件拖曳到 Colab 文件視圖中並等待上傳完成。

6. 在筆記本中輸入以下程式碼並執行:

!whisper input.mp3 —-model medium (英文語音使用)

!whisper input.mp3 —-model medium —-language ja (日語語音使用)

7. 執行完成後,在左側文件視圖中選擇 input.srt,並點選右側三個圓點,選擇「下載」。

8. 打開《簡憶生詞本》APP,點選添加目錄,並選擇「添加音訊目錄(文件)」或「添加影片目錄(文件)」,並選擇影片或語音文件的位置。

9. 在新添加的音訊/影片目錄中,點選右上角三個圓點的圖示,並選擇「導入歌詞、字幕文件」,並選擇剛剛下載的 SRT 文件。

進一步參考

  1. https://www.youtube.com/watch?v=8SQV-B83tPU

評論

評論提交後會進入審核,通過後顯示在文章下方。

還沒有評論,歡迎留下第一則。

留下評論