分析と広告のためのCookie
分析と広告のためにCookieを使っており、どちらもGoogleに送られます。拒否しても、目に見える動作は何も変わりません。プライバシーポリシーを読む
ここで JPG を TXT に変換できます。無料、アカウント不要です。ファイルを上の枠に落とせば、数秒で結果がダウンロードできる状態になります。 変換はお使いのブラウザーの中で行われるので、ファイルはアップロードされません。Windows でも macOS でも Linux でも、iPhone でも Android でも同じように動き、通信を切っても動き続けます。
一度に100ファイルまで。フォーマットが混ざっていても構いません。
順番に変換し、まとめてZIPでダウンロードします。
JPG から TXT
看板やホワイトボード、紙の書類を撮影した写真から、文字だけを取り出してコピーしたい、検索できるようにしたいという場面でこの機能を使います。
この処理は Tesseract という光学文字認識(OCR)エンジンをブラウザーの中で動かして行われ、画像がどこかへアップロードされることはありません。
このサイトが自前で用意している認識モデルは、英語・ドイツ語・フランス語・スペイン語の 4 言語だけです。日本語のモデルは含まれていません。
日本語の文字が写った画像にこの機能を使うと、文字を検出できないか、まったく違う文字列として誤認識される結果になります。日本語の文書からテキストを起こしたい場合、この機能は今のところ目的に合いません。
指定した言語が画像の中の文字と合っていない場合、認識結果はエラーにはならず、文字として成立しているのに意味の通らない文章が返ってきます。見た目には自然な文章に見えてしまう点が、この失敗のいちばんの問題です。
結果をそのまま信用せず、必ず元の画像と見比べて確認する必要があります。
認識結果は改行や空白がそのまま返され、段組みや表の構造を復元するような後処理は一切行われません。認識エンジンが返した通りの文字列がそのまま出力されます。
検索可能な PDF を作る機能や、文字の位置を示す座標情報を出す機能はこの変換にはありません。
文字認識は画素を並べ替えるだけの画像変換とは違い、文字を一つずつ判別していく処理なので、他の変換に比べて明らかに時間がかかります。大きな画像や文字数の多い画像ほど、その差は顕著になります。
モデルファイル自体は初回だけ端末に読み込まれ、その後はブラウザーの中に保存されるため、2 回目以降の実行は初回より速く始まります。
この処理は、他の画像変換のように機械的に正確な結果を返すとは限りません。画像がぼやけていたり、文字の向きが傾いていたりすると、文字として成立しているのに元の文章とは違う結果を返すことがあります。
重要な文書であるほど、認識結果をそのまま使わず、元の画像と一字一句突き合わせて確認することを勧めます。
JPG のほか、PNG、WebP、AVIF、JPEG XL、GIF、BMP、TIFF、HEIC、HEIF から文字を読み取れます。PDF はこの機能の対象には入っていません。スキャンした PDF から文字を起こすことはできません。
複数の JPG を一度に置いても、順番に処理されて結果がまとめて返ってきます。アップロードは発生しませんが、1 回にまとめられるのは 100 ファイルまでです。
文字認識は処理時間が長いため、大量の画像を一度に置くと、他の変換に比べて待ち時間が長くなります。
| JPG | TXT | |
|---|---|---|
| 正式名称 | JPEG 画像 | プレーンテキスト |
| 拡張子 | .jpg, .jpeg, .jpe | .txt, .text, .log |
| メディアタイプ | image/jpeg | text/plain |
| 圧縮方式 | 非可逆 — サイズを画質で買う | — |
| 最初の公開 | 1992 | 1963 |
| 発行元 | Joint Photographic Experts Group | — |
| 仕様 | ITU-T T.81 | Unicode |
| ライセンス | オープン標準 | オープン標準 |
| 現在の位置づけ | 現行 | 現行 |
| ビット深度 | 8 | — |
| 扱える色 | RGB, グレースケール, YCbCr | — |
| 最大の画像 | 1辺 65,535 px | — |
| ブラウザで開けるか | すべてのブラウザ | すべてのブラウザ |
| 代わりに検討される形式 | WebP, AVIF, HEIC | MD, RTF |
TXT は作業のための形式で、JPG は完成したものを渡すための形式です。戻ってくるのはページの絵ではなく、編集できる文字です。たいていはそれがこの変換の理由であり、同時にこの変換の限界でもあります。
開くプログラムが重なりません。JPG はAdobe Photoshop、GIMP、Previewで、TXT はNotepad、TextEdit、Visual Studio Codeで開きます。結果を渡す相手には後者のどれかが要ります。
結果は元より大きくなり、そして良くはなりません。JPG はすでに細部を捨てており、TXT は残っているものをそれ以上捨てずに保持します。これは今後の劣化を止めますが、すでに起きた劣化を戻しはしません。
2 つは狙っている用途が違います。JPG は写真、ウェブ、メール、完成したファイルの受け渡し、TXT はプログラム間のデータ受け渡しと長期保存です。ここは考える価値があります。一方が存在する理由が、そのままもう一方が使いにくい理由になっていることが多いからです。
JPG は Joint Photographic Experts Group の形式です(1992 年に登場)。 記録は 1 チャンネルあたり 8 ビットです。
TXT は 1963 年から使われています。規定は Unicode です。Notepad、TextEdit、Visual Studio Codeがこの形式を読めます。
TXT は 1963 年、JPG は 1992 年に登場しました。人に渡すならたいてい古いほうが安全で、新しいほうは同じ仕事をより少ないバイト数で片づけます。
いいえ。この変換は完全にブラウザーの中で行われるので、ファイルが端末から出ることはありません。ご自分で確かめられます。開発者ツールのネットワークタブを開いて、何か変換してみてください。ページそのものと、このサービスの費用をまかなっている分析・広告のリクエストは見えますが、あなたのファイルを運んでいるリクエストはひとつもありません。
はい。アカウントも透かしもなく、消費される 1 日の割り当てもありません。お使いの機械の上で動くので、何度でも戻ってきていただけます。ブラウザーが扱えるのは 100 MB までのファイルで、一度に 100 本です。
JPG と TXT は、内容の表し方が根本から違います。ですからこの変換は複製ではなく再構築です。誠実ではありますが、1 バイトも同じというわけではありません。 文字はパターン認識で読み取られるため、これは最善の推測であって、書き起こしではありません。まっすぐで汚れのない、十分な明るさと解像度の活字ならほぼ正確に出てきますが、斜めから撮った写真、かすれたファックス、変わった書体、手書きは必ず間違いを生みます。結果を頼りにする前に、必ず原本と読み合わせてください。言語の設定は効きます——間違った言語で読み取られた文字は、エラーとしてではなく、自信たっぷりの意味不明な文章として返ってきます。
結果は元より大きくなり、そして良くはなりません。JPG はすでに細部を捨てており、TXT は残っているものをそれ以上捨てずに保持します。これは今後の劣化を止めますが、すでに起きた劣化を戻しはしません。
TXT は作業のための形式で、JPG は完成したものを渡すための形式です。戻ってくるのはページの絵ではなく、編集できる文字です。たいていはそれがこの変換の理由であり、同時にこの変換の限界でもあります。
このページがJPGとTXTについて述べていることは検証できます。根拠となる資料は次のとおりです。