ロシア語音声の無料文字起こし — ブラウザで完結
VoxScriber Nanoはロシア語(Русский)を理解し、デバイス上でローカルに処理します。無料モードでは10分制限があります。
VoxScriber Nano(オープンソース)をブラウザで実行 — ローカルAI、最大10分/ファイル、精度約85%。プロ用途はPremiumをご利用ください。
文字起こしはブラウザ内でローカルに実行されます。任意で結果をサーバーに共有(同意が必要)することで、サービス改善にご協力いただけます。制限:10分/ファイル、精度~85%。
無料 vs Premium — 比較
| 無料(ブラウザ) | Premium(クラウド) | |
|---|---|---|
| ファイル制限 | 10 min | 10 horas |
| 精度 | ~85% | >95% |
| 話者分離 | ❌ | ✅ |
| 単語単位のタイムスタンプ | ❌ | ✅ |
| ビデオサポート(MP4/MOV) | ❌ | ✅ |
| エクスポート形式 | TXT, SRT, VTT | DOCX, PDF, JSON… |
| 速度(1h音声) | ~2 min / 1h | ~2 min / 1h |
| プライバシー | 100% local | ☁️ + 🔒 |
ローカルAI
ブラウザ内で文字起こし。サーバーへの送信は任意(同意が必要)です。
高速・ローカル処理
ブラウザ内でAI処理 — 待ち時間なし。
99言語対応
音声の言語を自動検出します。
登録不要
アカウント作成なしで今すぐ開始。
使い方
音声をアップロードまたは録音
MP3、WAV、M4A、OGGファイルをドラッグ&ドロップ、またはマイクを使用。
AIがデバイス上で動作
Whisper AIは一度ダウンロードしてキャッシュに保存。次回以降は待ち時間なし。
テキストをコピーまたはダウンロード
数秒で結果が表示。.txtでダウンロードするか、ワンクリックでコピー。
Whisperはロシア語をどの程度処理できますか?
ロシア語はWhisperが最も得意とするキリル文字言語の一つです。モデルは複雑な格体系を処理し、正しいキリル文字の正書法を出力します。速い口語やウクライナ訛りのロシア語も良好に文字起こししますが、強い背景ノイズは英語よりもロシア語のNanoモデルに悪影響を与えます。
ロシア語の音声は通常どこから来ますか?
Telegramの音声メッセージ — ロシア語圏で支配的なメッセンジャー — に加え、講義、インタビュー、仕事の会議の録音。
ブラウザ文字起こしの精度はどのくらいですか?
ブラウザ文字起こしは、OpenAIのWhisperモデルをWebAssemblyを使用してデバイス上で直接実行します。3つのモデルサイズを提供しており、精度は選択したモデルに依存します:
- Nano(約40MB) — デフォルト。明瞭な音声で約85%の精度。簡単なメモ、ボイスメッセージ、下書きに最適。iOSで動作する唯一のモデル。
- Mini(約150MB) — 約90%の精度。デバイスに4GB以上のRAMがあり、よりクリーンな出力が必要な場合の良い中間点。
- Plus(約500MB) — 最も正確なローカルオプションで、明瞭な音声で93%に近づきます。ダウンロードと実行が遅く、8GB以上のRAMを搭載したデスクトップマシンに最適。
ローカルモデルの精度を低下させる要因:背景ノイズ、複数人の同時発話、強いアクセント、圧縮ボイスノートなどの低ビットレート録音。95%以上のプロフェッショナルな精度、単語レベルのタイムスタンプや話者ラベルが必要な場合は、クラウドモデルが必要です—上記の比較をご覧ください。
ブラウザ vs クラウド文字起こし:どちらが必要ですか?
ブラウザ文字起こしは、プライバシーが最も重要な場合や音声が短い場合に適したツールです:何もアップロードされず、後で削除するものもなく、費用もかかりません。トレードオフは速度と精度です—CPUは約1時間の音声を20分で処理し、ローカルモデルは話者ラベルと単語レベルのタイミングをスキップします。
クラウド文字起こしは、仕事中(会議、インタビュー、講義、法的録音)に適したツールです。専用GPUが1時間の音声を約2分でテキストに変換し、95%以上の精度、最大30人の話者ラベル付け、最大10時間のファイル受け入れ、字幕形式に加えてDOCX、PDF、JSONへのエクスポートが可能です。
実用的な目安:カフェで録音を声に出して読んでも問題ない場合は、クラウドの速度と精度が勝ります。音声が機密性の高いもの(医療相談、機密会議、プライベートボイスノート)であれば、ブラウザツールはすべてをマシン上に保持し、数分で使用可能な文字起こしを提供します。多くのユーザーは両方を組み合わせています:ブラウザでの簡単なプライベートノート、クラウドでのプロフェッショナルな作業。
プレミアムプランを見る →対応音声フォーマット
MP3、WAV、M4A、OGG、OPUS、FLAC、WEBMをアップロードできます—ブラウザがデコードできるものであれば何でも。一般的なソースはそのまま動作します:WhatsAppボイスノート(OPUS)、iPhoneボイスメモ(M4A)、Androidレコーダーファイル、Zoom録音(M4A/MP4)、Telegramボイスメッセージ(OGG)、ポッドキャストファイル(MP3)。MP4やMOVなどのビデオコンテナは、ブラウザがコーデックをサポートしている場合、オーディオトラックがデコードされます。ファイルの読み込みに失敗した場合、通常の原因は一般的なコンテナ内の珍しいコーデックです—最初にMP3に変換することでほぼすべての場合に解決します。
別のフォーマットが必要ですか?無料のコンバーターをご利用ください: 無料のMP3/WAV/OGG/AAC音声コンバーター
さらに必要ですか?Premiumをご覧ください
プロ向け機能 — 話者識別、長時間ファイル、AI分析、全フォーマット対応エクスポート。
話者識別(ダイアリゼーション)
各セグメントで誰が話しているかを自動識別。会議、インタビュー、ポッドキャストに最適。
最大10時間のファイル対応
ローカルモデルは10分まで対応。Premiumでは最大10時間のファイルを処理できます。
要約・感情分析・トピック抽出
AIがコンテンツを分析し、要約、感情分析、トピック抽出を生成します。
多彩なエクスポート形式
SRT、VTT、DOCX、JSON、PDFでエクスポート — 字幕、文書、自動化に最適。
よくある質問
音声はサーバーに送信されますか?
文字起こしはブラウザ内で100%ローカルに動作します。完了後、サービス改善のために音声とテキストを任意でご共有いただけます(同意チェックボックス)。完全に任意であり、同意なしには送信されません。
対応している音声フォーマットは?
MP3、WAV、M4A、OGG、FLAC、WEBM、MP4、MOVなど、ブラウザがデコードできるあらゆるフォーマットに対応しています。
最大何分の音声を文字起こしできますか?
無料モードでは1ファイルあたり最大10分。より長い音声にはPremiumプラン(最大10時間対応)をご利用ください。
対応言語は何ですか?
Whisperモデルは日本語、英語、ポルトガル語、スペイン語、フランス語、ドイツ語、アラビア語など99言語に対応。自動検出機能付き。
インストールが必要ですか?
いいえ。ブラウザ上で直接動作します。AIモデル(約40MB)は一度ダウンロードされてキャッシュに保存されます。
文字起こし結果は保存されますか?
デフォルトでは保存されません — 結果はブラウザ内にのみ留まります。同意チェックボックスをオンにすると、音声とテキストがサーバーに送信され7日後に削除されます。同意はいつでも取り消せます。
Premiumとの違いは何ですか?
無料モードはVoxScriber Nano(4ビット量子化q4)をローカルで使用:10分制限、精度~85%、話者分離なし、~30sセグメント単位のタイムスタンプのみ。Premiumはクラウドモデル(AssemblyAI + Whisper Large float32)を使用:精度>95%、最大30話者の分離、単語単位のタイムスタンプ、最大10時間対応、MP4/MOV/MKVのビデオサポート、DOCX/PDF/JSONエクスポート。速度:1時間の音声がローカルCPUで約20分 vs PremiumのGPUで約2分。
スマートフォンでも使えますか?
はい。ただしパフォーマンスはデバイスによって異なります。RAMの少ないスマートフォンでは処理が遅くなる場合があります。
本当に無料ですか?
はい。ブラウザ文字起こしは本当に無料で、試用期間、ウォーターマーク、サインアップは一切ありません。私たちは無料ツールではなく、プレミアムクラウドプランで収益を得ています。
音声はデバイスから送信されますか?
いいえ—文字起こしはWebAssemblyを介してローカルで実行されます。唯一の例外は、録音を共有するためにオプションの同意チェックボックスを明示的にチェックした場合です。
ファイルサイズの制限はありますか?
実際の制限は、メガバイト数ではなく、時間(ファイルあたり10分)とデバイスのメモリです。10分のMP3は通常10〜20MBで、ほとんどのデバイスで問題なく動作します。
文字起こしにはどのくらい時間がかかりますか?
Nanoモデルの場合、最新のラップトップで音声時間の約1〜2倍を見込んでください—5分のファイルには約5〜10分かかります。初回実行時には約40MBのモデルダウンロードが追加されます。
字幕(SRT)をエクスポートできますか?
はい—無料エクスポートには、セグメントタイムスタンプ付きの.txt、.srt、.vttが含まれます。単語レベルのタイムスタンプ精度やDOCX/PDF/JSONエクスポートについては、プレミアムをご覧ください。
複数のファイルを一度に文字起こしできますか?
はい—最大5ファイルをキューに入れることができ、ブラウザで順次処理されます。プレミアムではキュー制限がなくなり、クラウドでファイルを並列処理します。
最初の文字起こしがなぜ時間がかかるのですか?
初回訪問時にAIモデルがブラウザによってダウンロードおよびコンパイルされます。その後キャッシュされるため、以降の文字起こしはすぐに開始されます。
オフラインでも動作しますか?
部分的に—モデルがキャッシュされると、文字起こし自体は接続を必要としません。ただし、ページ自体を読み込むにはオンラインである必要があります。
Telegramの音声メッセージに対応していますか?
はい — Telegramの.ogg/.oga音声ファイルを直接サポートしており、変換は不要です。
ロシア語とウクライナ語を混同しますか?
自動検出は短いクリップで時々誤ったラベルを付けることがあります — ロシア語を事前選択することで(このページが自動的に行います)回避できます。
出力はキリル文字ですか?
はい — 標準的なロシア語キリル文字の正書法です。