👉 English Readme 👈
- 현재 사용되는 기계 번역(machine translation) 및 OCR(Optical Character Recognition) 기반의 대부분의 번역 및 삽입 기법은 단순히 인식된 텍스트를 기계적으로 치환하거나 이미지를 덮어쓰는 기법이므로 더 고도화된 방법이 필요
- 글꼴, 색상, 크기, 위치와 같은 시각적 요소까지 자연스럽게 반영하도록 구현하는 것이 목표
각 파트별 자세한 내용은 아래 Repository에 접속하여 확인할 수 있습니다.
| 분류 | URL | 설명 |
|---|---|---|
| 텍스트 변환 모델 | TextCtrl-Translate | 한국어 환경에 맞게 파인튜닝된 텍스트 변환 모델 |
| ko-trocr-tr | 한국어 환경 TextCtrl에 필요한 한국어 OCR 모델 | |
| SRNet-Datagen(ko) | 한국어 환경의 TextCtrl 학습에 필요한 데이터셋 Generator | |
| 웹 서비스 | 웹(FE) | TMOJI 프론트엔드 |
| 서버(BE) | TMOJI 백엔드 |
1️⃣ 사진 업로드 및 언어 선택
2️⃣ 이미지 내 번역할 영역 지정
3️⃣ 감지된 텍스트 확인 및 수정
4️⃣ 번역된 텍스트 확인 및 수정
5️⃣ 최종 이미지 합성 진행
TMOJI.For.Github.720p.mp4
| 문경환 | 이동훈 | 이승재 |
|---|---|---|
| drmoon@pusan.ac.kr | therqq13@pusan.ac.kr | leesj6717@pusan.ac.kr |
| 실험 환경 구축 및 실험 OCR 모델 및 TextCtrl 실험 및 분석 방법론 탐색 및 결과 분석 보고서 및 관련 문서 작성 |
서비스 파트 담당 UI/UX 구상 API 명세 및 데이터베이스 ERD 작성 FE & BE & Infra 총괄 |
딥러닝 모델 분석 및 개발 OCR 모델과 TextCtrl 모델 실험 및 재학습 데이터 생성 파이프라인 재구성 모델 SSH 연결 관련 BE 파트 개발 |
[1] Josh Achiam, Steven Adler, Sandhini Agarwal, Lama Ahmad, Ilge Akkaya, Floren-cia Leoni Aleman, Diogo Almeida, Janko Altenschmidt, Sam Altman, Shyamal Anad-kat, et al. Gpt-4 technical report. arXiv preprint arXiv:2303.08774, 2023.
[2] Kyunghyun Cho, Bart Van Merriënboer, Caglar Gulcehre, Dzmitry Bahdanau, Fethi Bougares, Holger Schwenk, and Yoshua Bengio. Learning phrase representa-tions using rnn encoder-decoder for statistical machine translation. arXiv preprint arXiv:1406.1078, 2014.
[3] Sepp Hochreiter and Jürgen Schmidhuber. Long short-term memory. Neural computa-tion, 9(8):1735–1780, 1997.
[4] Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan NGomez, Łukasz Kaiser, and Illia Polosukhin. Attention is all you need. Advances in neural information processing systems, 30, 2017.
[5] Linting Xue, Noah Constant, Adam Roberts, Mihir Kale, Rami Al-Rfou, Aditya Sid-dhant, Aditya Barua, and Colin Raffel. mt5: A massively multilingual pre-trained text-to-text transformer. arXiv preprint arXiv:2010.11934, 2020.
[6] Weichao Zeng, Yan Shu, Zhenhang Li, Dongbao Yang, and Yu Zhou. Textctrl: Diffusion-based scene text editing with prior guidance control. Advances in Neural Information Processing Systems, 37:138569–138594, 2024.



