Источники данных
Origa строится на открытых данных и моделях. Ниже — что именно используется внутри приложения и на каких условиях распространяются производные материалы.
Словарь и чтения
Словарные статьи, переводы и фуригана — JMdict / EDRDG под лицензией CC BY-SA 4.0. Проект словаря ведёт Electronic Dictionary Research and Development Group.
Анимации кандзи
Порядок чертей и анимации — KanjiVG под лицензией CC BY-SA 3.0.
Токенизация
Разбор текста на слова — SudachiDict под лицензией Apache-2.0.
OCR
Распознавание текста на изображениях — NDLOCR-Lite от Национальной парламентской библиотеки Японии под лицензией CC BY 4.0.
Распознавание речи
Расшифровка аудио — Whisper под лицензией MIT.
Аудио фраз
Записи фраз для тренировки listening — корпусы носителей языка, включая материалы NHK.
Наборы слов
Готовые наборы слов для импорта — Irodori от Japan Foundation.
Шрифты
- Cormorant Garamond — SIL Open Font License
- IBM Plex Mono — SIL Open Font License
- Noto Sans JP — SIL Open Font License
