今日はTogoTVの新しい動画を見ました。この動画なんですが1細胞レベルのRNA-seqの話で、解析にAIをどう活用するかの実例を披露されている動画です。
『Agent-readyなデータ解析ワークフローの構築』
大変面白い動画でしたが、一細胞レベルのRNA-seqの専門用語に馴染みがない私には理解できない部分があちこちにありました。自動文字起こしは例えばこんなふうです。これは最後の質疑応答の部分の文字起こしです。
【ああ、そっか。そういうことであれば この細胞型ノテーション っていうのがすごい複雑な作業だっていう 話をしたと思うんですけど、これあの論文 にはこういうラベルが付いてるのにGO みたいな公共データベースではついてない んですよね。で、みんながメタデータとし てそのラベ情報を当てがっていたり、ま、 あとは解析済みのスーラとかスキャンパー みたいな、え、ファイをGOでも共有し てればこんな苦労はないんですけど、 なかなかそういうのをGOがやってくれ ないっていう、やってくれないていうか なんてだろう、やらなくてもデータとして 受け付けるような状況になっていて、で、 毎回このデータは、あ、この細胞は何の 細胞ですか?ての著者に問い合わせたりと かしてきてるんですけど、そこがま、 ちょっとデータ側にはやってほしいなって 感じですね。ただAIが結構高制度に予測 してくるようになったってのが現状には なります。】
スーラとかスキャンパーとか、なんのことかわからない文字起こしや、GOなど誤りらしい部分を青字で示してみました。スーラとかスキャンパーってなんなのでしょう?「バイオインフォマティクス」などの単語と合わせてGoogle検索してもなんのことかわかりませんでした。GOと文字起こしされているのは、実はGEOです。Geminiに動画のurlを入れて聞いてみると、スーラとスキャンパーというのは実は、SeuratとScanpyというのが正しい用語だとわかりました。以下はこの2つのGeminiによる解説です。
Seurat(スーラ)とScanpy(スキャンピー)は、どちらもシングルセルRNA-seq(scRNA-seq)で得られた膨大なデータを解析し、生物学的な意味を見出すための総合的な解析パッケージ(フレームワーク)です。
-
Seurat: R言語ベースのパッケージ。Satijaラボが開発しており、世界中で最も広く使われている事実上の標準ツールです。ドキュメントやチュートリアルが非常に豊富です。
-
Scanpy: Python言語ベースのパッケージ。Theisラボが開発。Pythonの機械学習ライブラリとの連携がしやすく、数百万細胞規模の巨大なデータセットに対しても高速に処理できるのが強みです。
これはGeminiのプロンプトに動画のurlを貼り付けて質問して、「スーラというのはsraファイルのことですか?」などとプロンプトでたずねたときの回答です。この後は、シングルセルRNA-seqの実習をしてみますか?というようなチャットが続いて、scRNA-seqデータの解析をRやPythonで体験する教科書をつくってくれました。すごい時代になったと実感します。その後、YouTube動画を正確に文字起こしする方法を教えてもらおうと次のプロンプトを入力しました。
【ところで、YouTube動画の文字起こしで、科学的内容を正確に文字起こしできるものでおすすめのソフトやサービスがありますか?Googleのものが良いと、この動画の演者が述べていましたが。】
回答では3つの方法を教えてくれました。記事の最後に回答をそのまま貼り付けますが、私は2番目のGoogle AIStudioを使ってみました。使い方は明日書きますが、無料でこの程度の動画なら2分もかからず全文文字起こししてくれます。モデルは最新のGemini 3.8 Flashを選び、プロンプトは以下のものを考えて使ってみました。
『読み込んだ動画の音声を、タイムスタンプ付きで全文文字起こししてください。
【指示ルール】
> 1. **省略禁止:** 要約はせず、発言内容をすべてテキスト化してください。
> 2. **タイムスタンプ:** 内容の区切りが良いところ(おおむね3〜5分間隔)で、見出しとともにタイムスタンプ(例:)を挿入してください。
> 3. 音声が聞き取れない箇所や、専門用語の正確なスペル・意味に確信が持てない単語については、無理に推測せず 【?:聞こえたままのカタカナ】 のように目立つ印をつけて出力してください。
> 4. **ケバ取り:** 意味を持たない言い淀み(あー、えーっと等)のみ削除し、自然な日本語の文章にしてください。』
このプロンプトの3番目は、AIが勝手に推測して適当な単語に変換してしまうのを防ぐものです。AIが知らない、あるいは聞き取りにくかった部分は【】にかこんで表示してくれるようになります。
最初に自動文字起こしで表示された部分の文字起こし結果は以下のように完璧です。
『Google AIStudioによる文字起こし:
ああ、そっか。そういうことであれば、この細胞型アノテーションというのがすごい煩雑な作業だという話をしたと思うんですけど、論文にはこういうラベルが付いているのに、GEOみたいな公共データベースでは付いていないんですよね。みんながメタデータとしてそのラベル情報を当てがっていたり、あとは解析済みのSeuratとかScanpyみたいなファイルをGEOでも共有していればこんな苦労はないんですけど、なかなかそういうのをGEOがやってくれないというか、やらなくてもデータとして受け付けるような状況になっていて。毎回「このデータは、この細胞は何の細胞ですか」というのを著者に問い合わせたりとかしてきているんですけど、そこはちょっとデータ側にはやってほしいなという感じですね。ただAIが結構高精度に予測してくれるようになったというのが現状にはなります。』
GOと自動文字起こしで書かれていた部分も、ちゃんとGEOになっていますし、スーラとかスキャンピーとか意味不明な文字起こしの部分も、正確な解析パッケージ名であるSeuratとScanpyになっています。他の部分も完璧で人名、大学名などもちゃんと認識していました。このGoogle AIStudioなら長い動画の文字起こしも、あっと言う間に完了してしまいます。これはすごいのでぜひ活用してみてください。詳しい利用法は明日書きます。
以下はGeminiが教えてくれた3つの高精度で文字起こしできるツールについての回答です。
1. Google NotebookLM(演者が言及していたツール)
-
特徴: Googleが提供する無料のリサーチアシスタントツールです。
-
YouTube対応: ソース追加画面で YouTubeのURLを貼り付けるだけ で内容を読み込みます。
-
強み:
-
背景にあるGeminiが文脈(ライフサイエンス、情報科学など)を理解した上で処理するため、専門用語の認識率が非常に高いです。
-
文字起こし全体を出力させるだけでなく、「この動画で説明されている解析手順を箇条書きでまとめて」「〇〇について話している部分を抜き出して」といった対話形式の抽出が強力です。
-
2. Google AI Studio(Gemini を直接利用)
-
特徴: Googleが開発者・一般向けに公開しているAIの実験環境(無料で利用可能)。
-
YouTube対応: プロンプト入力欄に YouTube のURLを直接貼り付ける、またはダウンロードした音声/動画ファイルをアップロードできます。
-
強み:
-
長時間の動画を丸ごと読み込める非常に大きなコンテキスト窓を持っています。
-
「バイオインフォマティクスおよびシングルセル解析に関する動画です。専門用語(Seurat、Scanpy、PCA、UMAP、クラスタリングなど)を正確に反映して、タイムスタンプ付きで全文書き起こしてください」といった指示(プロンプト)を与えることで、極めて高い精度の全文文字起こしが得られます。
-
3. OpenAI Whisper(特に large-v3 モデル)
-
特徴: 音声認識(STT)に特化したオープンソースの最高峰モデル。
-
利用方法:
-
Macならアプリ MacWhisper
-
Webブラウザ完結なら Hugging Face上のWhisperスペース
-
コマンドライン(Python)
-
-
強み:
-
単語単位のタイムスタンプ付きSRT(字幕ファイル)を作りたい場合に最適です。
-
プロンプト(initial_prompt)機能: あらかじめ「Seurat, Scanpy, scRNA-seq, UMAP, 単一細胞」といった専門用語の単語リストをプロンプトとして渡しておくことで、発音の似た一般的な単語への誤変換を防ぐことができます。
-
完全に自分のパソコン内(ローカル環境)で動かせるため、未公開の研究データや機密動画でも安全に使えます。
-
実務でのおすすめの使い分け
-
手軽に内容を把握・要約・参照したい場合:NotebookLM に動画URLを貼り付けるのが最も簡単でおすすめです。
-
完全な文字起こしテキスト(全文)が欲しい場合:Google AI Studio(Gemini) にURLを渡し、専門用語の前提条件をプロンプトで指定して書き出させるのが最も精度が高くなります。
-
字幕ファイル(.srt)を作成したい、または機密データを扱う場合:Whisper(largeモデル) に専門用語プロンプトを添えてローカルで処理するのがベストです。