Захват: OCR и распознавание речи
Origa умеет читать японский с изображений и расшифровывать его из аудио. Обе функции работают на вашем устройстве — обработка никогда не отправляет ваши фото или записи на сервер. На этой странице — как ими пользоваться и какие у них ограничения.
Оптическое распознавание текста (OCR)
OCR извлекает японский текст из изображений. Используйте, когда у вас есть фото меню, страницы, вывески, скриншота или другого визуального источника японского текста.
Как пользоваться:
- Откройте экран слов и выберите вкладку Изображение.
- Перетащите или вставьте изображение либо выберите файл на устройстве.
- Origa выполнит OCR и покажет распознанный текст.
- Просмотрите извлечённые слова, выберите нужные и добавьте как карточки.
Поддерживаемые форматы: PNG, JPEG, WebP. Действует ограничение на размер файла.
Когда скачивается модель: Модель OCR не поставляется с установщиком. Она скачивается при первом использовании функции с индикатором прогресса. После первой загрузки OCR работает офлайн.
Где OCR работает хорошо: печатный текст, чистые скриншоты, набранный японский.
Где OCR пасует: сильно стилизованные шрифты, фотографии с низким контрастом, вертикальный текст в необычных раскладках, очень мелкие знаки. Рукописный текст не поддерживается.
Распознавание речи (STT)
STT расшифровывает устный японский из аудиофайла. Используйте, когда у вас есть запись речи — фрагмент подкаста, реплика из сериала, голосовая заметка.
Как пользоваться:
- Откройте экран слов и выберите вкладку Аудио.
- Загрузите аудиофайл.
- Origa расшифровывает его на устройстве и показывает распознанный текст.
- Просмотрите и добавьте нужные слова.
Поддерживаемый формат: только WAV. Другие распространённые форматы (MP3, M4A, OGG) сейчас не принимаются — конвертируйте файл перед загрузкой.
Когда скачивается модель: Как и в случае с OCR, модель STT не поставляется с приложением. Она скачивается при первом использовании и затем работает офлайн.
Где STT работает хорошо: чистое аудио с одним говорящим, медленный или умеренный темп.
Где STT пасует: перекрывающиеся голоса, сильный фоновый шум, очень быстрая речь, выраженные акценты. Распознавание приблизительное — проверяйте вывод перед добавлением слов.
Приватность
И OCR, и STT выполняются полностью на вашем устройстве. Изображение или аудио, которые вы предоставляете, обрабатываются локально и никогда не загружаются. Единственный сетевой трафик — разовая загрузка модели с CDN Origa.
Когда пользоваться захватом
Захват — не основной способ добавления лексики: ввод текста быстрее для слов, которые вы уже знаете. Захват выигрывает, когда:
- Вы читаете печатный материал (книгу, вывеску) и хотите зафиксировать незнакомые слова без ввода.
- У вас есть скриншот из ридера манги или субтитров, и вы хотите превратить его в карточки.
- Вы услышали слово в аудиоконтенте и хотите найти его, не вводя то, что вы (приблизительно) услышали.
