안녕하세요. 오랫만에 PDF 번역 프로그램을 업데이트합니다.
소개
PDF의 페이지 레이아웃을 그대로 유지하면서 페이지를 번역하는 프로그램입니다.
번역 엔진은 자체 개발한 번역엔진과 구글, DeepL, ChatGPT, Gemini 번역 API를 이용할 수 있습니다.
번역 가능한 언어는 영어,일본어,중국어 등 18개의 언어를 지원합니다(자체 번역엔진은 영어만 가능)
1.3 버전 변경 사항
- 기본 번역엔진을 사용자의 컴퓨터에 직접 설치해서 번역하도록 변경
- 기본 번역엔진에 용어집을 이용한 맞춤 번역 기능 추가
- 번역엔진에 ChatGPT, Gemini 추가
- AI를 이용해 표나 수식과 같은 레이아웃을 정확히 분석하도록 개선
- 번역 PDF에 사용 가능한 글꼴 추가
- 문서 번역 시 번역 가능한 페이지 수 제한 제거
설치
프로그램의 크기가 커서 홈페이지에서 다운로드 받으신 후 압축을 풀어주세요.
번역 서버 설치
번역 프로그램이 있는 디렉토리의 하위 디렉토리인 Server 디렉토리에 있는 setup.bat 또는 setup_gpu.bat를 실행합니다.
Nvidia 그래픽 카드가 있고 GPU를 이용해 번역하고자 하는 경우에는 setup_gpu.bat를
그렇지 않으면 setup.bat를 실행합니다.
실행
1. 번역 서버 실행
Server 디렉토리에 있는 run.bat 파일을 실행합니다.
2. 번역 프로그램 실행
번역->번역 엔진 메뉴에서 번역에 사용할 번역 엔진을 선택합니다.
DeepL, ChatGPT, Gemini를 사용하는 경우 환경 설정에서 API 키를 등록해야 합니다.
용어집을 이용한 번역
번역 시 용어집을 이용하면 용어집에 있는 용어를 지정한 번역 용어로 번역합니다.
용어집 파일은 Server 디렉토리 밑에 있는 glossary 디렉토리에 있습니다.
번역 서버는 기본적으로 default.txt를 용어집 파일로 사용하기 때문에 default.txt에 필요한 용어를 등록해서 사용하면 됩니다.
만약 분야별로 다른 용어집을 사용하려면 run.bat 배치 프로그램으로 서버 구동시 아래와 같이 용어집 파일을 지정해 주면 됩니다.
python server.py -m ./models/BluePaper -p 5000 -b 16 -g ./glossary/ml.txt -l debug

감사합니다. 알려주신 버그는 확인 후 수정하도록 하겠습니다.
좋게 봐주셔서 감사합니다.
과분한 말씀 감사합니다.
제가 맥을 써 본 적이 없어서 맥 버전은 힘들 것 같습니다.
잘쓰고 계신다니 고맙습니다.
홍보까지 해주신다니 정말 감사합니다.
이번 번역 모델은 논문 번역에 특화된 모델이라 논문 번역에 도움이 될 걸로 생각합니다.
그리고 용어집을 이용하면 논문에 사용하는 용어 번역에도 도움이 됩니다.
저 같은 경우는 텍스트 인식이 되는 일본어PDF를 넣고 번역을 돌렸는데, 우측 페이지는 흰 페이지로만 나오고 내용이 없네요 ㅜㅜ
그리고, 사용 설명 중에
run.bat 는 매번 먼저 구동해야하는지,
마지막, 번역 작업이 끝나면 번역 서버를 종료시킵니다. 는 BluePDF.exe 를 종료시키면 자동 종료가 되는것인지요? 궁금합니다 ㅎㅎ
번역 서버는 아래 두가지 경우에 사용됩니다.
1. 기본 번역엔진을 이용해 번역하는 경우
2. 페이지 레이아웃을 분석하는 경우
따라서 항상 번역 전에 run.bat를 이용해 서버를 구동해줘야 합니다.
그리고 번역이 끝나면 따로 번역 서버를 종료해 줘야 합니다.
이 부분은 자동으로 서버를 구동/종료할 수 있는 방법을 검토해 보겠습니다.
저 같은 경우는 텍스트 인식이 되는 일본어PDF를 넣고 번역을 돌렸는데, 우측 페이지는 흰 페이지로만 나오고 내용이 없네요 ㅜㅜ
+)서버 종료 방법은 어떻게 하는 것일까요?
빈 페이지로 출력이 된다면 텍스트가 이미지 형식으로 되어 있거나 언어 설정을 일본어로 하지 않아서 그럴 가능성이 있습니다. 그렇지 않다면 프로그램의 문제인데 이 경우는 해당 pdf를 분석해 봐야 하는데, 공개된 pdf이면 다운로드 받을 수 있는 주소를 알려주시면 분석해 보겠습니다.
서버 종료는 해당 창에서 Ctrl+C 키를 누르거나 그냥 창을 닫으면 됩니다.
https://www.aij.or.jp/images/prize/2025/pdf/5_award_003.pdf
https://www.aij.or.jp/jpn/design/2025/data/5_award_003.pdf
바쁘신 와중에 한번 챙겨봐주시면 감사하겠습니다 ㅎㅎ
제가 테스트해 보니 이미지처럼 번역이 됩니다. 혹시 번역 서버를 먼저 실행시켰는지요?
아니라면 Server 디렉토리에 있는 run.bat를 실행하여 서버를 먼저 실행해 주세요.
일본어 문서를 찾아 번역할 때 경험해보니,
일본어를 ->영어->한국어로 한번 거쳐 번역하니 훨씬 매끄러워지더라구요.
다음에 가능하면, 번역 후 언어를 한국어나 영어로 선택할 수 있는 환경도 구축되면 더 좋겠네요 ㅎㅎ
잘 쓰겠습니다. 감사합니다.!
기본 번역엔진은 로컬에서만 동작하기 때문에 전혀 외부 서버를 사용하지 않습니다.
구글이나 ChatGPT를 사용하는 경우에는 페이지의 단락 단위로 번역을 요청하기 때문에 해당 서버의 내부 기준에
달려 있습니다.
따라서 보안이 걱정되면 로컬에서만 돌아가는 기본 번역엔진을 사용하시면 됩니다.
먼저 setup.bat나 setup_gpu.bat를 실행해 번역에 필요한 번역 모델 및 라이브러리를 먼저 설치하면
run.bat 파일이 생성됩니다.
실행하기까지 단계가 많아서 이 부분은 좀 더 손쉬운 방법을 고려해 보겠습니다.
제안 감사합니다.
검토해 보고 가능하면 지원하도록 하겠습니다.
먼저 번역하기 전에 번역 서버가 실행되어 있어야 합니다.
Server 디렉토리에 있는 run.bat를 실행해서 번역서버를 실행해 주세요.
만약 run.bat 파일이 없으면 서버를 설치하지 않은 상태기 때문에 Server 디렉토리에 있는 setup.bat를 실행해서 서버를 설치해 주세요.
재설치는 Server 디렉토리에 있는 .env, _pycache__ 디렉토리를 모두 삭제하고 setup.bat를 다시 실행해 보세요.
run.bat 파일이 있는 걸 보면 서버가 설치는 된 것 같은데요. 설치 과정에서 오류 내역이 많이 보여서 제대로 설치는 안된 것 같습니다.
설명해주신 바와 같이 run.bat 실행 상태에서 번역서버를 구동했는데 제대로 동작이 안되었던 상태입니다.
재설치는 "Server 디렉토리에 있는 .env, _pycache__ 디렉토리를 모두 삭제하고 setup.bat를 다시 실행해 보세요."라고 하셨는데 "D:\Init\BluePDF_v1.3\Server" 디렉토리 안에 그런 디렉토리는 보이지가 않네요.
(첨부 화면 참조)
보기 옵션에 전부 보기로 해 두었는데 위치가 잘못 된거일까요?
화면을 보니 Server 디렉토리에 있는 download.py 파일을 찾지 못해서 번역 모델을 다운로드하는 데 실패했네요.
파일 목록에 download.py가 있는 걸로 보아 setup.bat를 Server 디렉토리가 아닌 다른 디렉토리에서 실행했을 가능성이 있습니다.
Server 디렉토리에서 setup.bat를 다시 실행해 보거나 아니면 Windows Shell에서 아래의 명령어로 수동으로 다운로드 해보세요.
uv run download.py "Darong/BluePaper" --save_dir models
한 가지 사용 중에 문의 사항이 있는데 알려주시면 감사하겠습니다.
페이지 수가 좀 많은 PDF (193페이지)를 일괄 번역 할 때 80~90 페이지 정도 진행되다가 첨부 그림처럼 오류 메시지가 나오고 번역이 멈춰버립니다.
물론 적당한 페이지 수로 나누어 번역을 시키면 잘 되는데 어떤 상황인지 (메모리 부족??) 살펴봐 주시기 바랍니다.
화면을 보니 프로그램의 버그로 인한 오류로 보입니다. 특정한 페이지에서 오류가 발생하는 것 같은데, 보여주신
화면만으로는 무슨 문제인지 파악하기가 어렵습니다.
혹시 해당 pdf 파일을 공개적으로 받아볼 수 있다면 다운로드 받아서 테스트해 보겠습니다.
https://www.scribd.com/document/894739548/Archwg-Whitepaper-v1-3-Final-23may-Clean
2) 아래 pdf의 경우, 자체 번역 엔진으로 했을 때 번역은 되지만 오류가 났다고 알림이 뜨네요.
Your input_length: 325 is bigger than 0.9 * max_length: 255. You might consider increasing your max_length manually, e.g. translator('...', max_length=400)
INFO: 127.0.0.1:53044 - "POST /translate HTTP/1.1" 200 OK
You seem to be using the pipelines sequentially on GPU. In order to maximize efficiency please use a dataset
INFO: 127.0.0.1:53053 - "POST /translate HTTP/1.1" 200 OK
https://ezywureyi7i.exactdn.com/wp-content/uploads/2024/07/eucnc24_paper_6g-global-landscape_ucs_kpis_enablers_v1.0-2.pdf
1) 테스트해 보니 1.3 버전에서는 에러가 발생하지만 1.3 버전 이후 코드를 개선한 버전에서는 오류가 나지 않았습니다. 다음 버전부터는 해당 문제는 발생하지 않을 걸로 보고 있습니다.
2) 이 메세지는 오류는 아니고 입력 텍스트의 길이가 길어서 나는 정보성 메세지입니다.
번역 모델의 최대 토큰 수를 늘려주면 되는데 향후에 점차 늘릴 계획을 가지고 있습니다.
gpu를 사용하면 정확성은 동일하지만 기본 번역엔진을 사용하는 경우 속도면에서 많은 차이가 납니다. 대신에 설치가 복잡해서 문제가 발생할 소지가 있습니다. 구글 API를 사용하여 대량의 pdf 번역 시 구글 API 응답에 가끔씩 오류가 발생하고 이것 때문에
프로그램에서 오류 처리 시 문제가 있었습니다. 지금은 해결한 상태입니다.
현재로서는 가급적 번역 페이지 범위를 제한해서 사용하시길 바랍니다.
유료 사용을 해도 1개 파일당 1백만자 이상이면 번역이 안되는데요. 제한 걸릴 때마다 파일 쪼개기를 하고 있습니다.
올려주신 자료는 페이지나 글자 제한이 없나요?
PDF 문서 번역 시 파일 자체를 업로드하는 게 아니고 각 페이지의 단락 텍스트별로 번역을 요청하기 때문에
파일 용량 제한은 없을 걸로 생각합니다. 문서 번역 시 페이지 범위를 지정할 수 있기 때문에 파일을 쪼갤 필요는
없습니다. 대용량 번역 시 오류가 발생하면 저장이 안될 수 있으니 페이지 범위를 조절해서 번역을 해보시길
바랍니다.
라고 에러가 나는데 어떻게 조치해야할까요?
먼저 아래의 명령어를 실행해서 python_installer.exe 다운로드가 제대로 되는지 확인해 보세요.
curl -L -o python_installer.exe https://www.python.org/ftp/python/3.11.5/python-3.11.5-amd64.exe
다운로드가 안되고 Windows 7 사용자시라면 curl 설치가 안되어 있을 수도 있으니 아래 주소에서
curl를 다운로드 받아서 설치한 후에 setup.bat를 다시 실행해 주세요.
https://curl.se/windows/
원활하게? 빠르게? 사용하고자 한다면 하드웨어 사양을 대략 알 수 있을까요? (너무 느려서요ㅠㅠ)
PPT 템플릿을 PDF로 변환한 경우 아니면 목차가 있는 문서의 경우 번역이 틀어지는 거 같습니다.
회사PC에서는 정상적으로 설치는 되는데 실행은 안되네요 ㅠㅠ
로그는 서버 실행 시 -l DEBUG 옵션을 주면 nmt.log라는 파일에 로그를 기록합니다.
기본 번역은 최신의 NVidia GPU를 사용할수록 번역 속도가 빨라집니다. 또한 CUDA 뿐만 아니라
cuDNN까지 설치하면 더 빨라집니다.
목차 레이아웃이 깨지는 문제는 현재 개발 중인 버전에서 많이 개선한 상태입니다.
실행이 안되면 좀 더 자세한 상황을 알려주시면 답변을 드릴 수 있을 것 같습니다.
그리고 현재 1.6버전까지 나왔으니 최신 버전이 아니시면 최신 버전을 다운로드 받아 사용해 보세요.
아무래도 보안 정책 때문에 AI Site, Tool 모두 차단해서일까요 OTL
구글 번역기도 사용할때마다 주의창 팝업 될 정도이니.. ㅜㅜ
실행 자체가 안되는 걸 보니 사내 보안 정책상 허가 받지 않은 프로그램을 실행하지 못하게 막은 것 같기도 합니다.
번역을 하지 않는 이상 외부와 연결하지 않기 때문에 실행 자체는 되어야 합니다.
아래 OpenAI 사이트에서 API키를 생성하세요.
https://platform.openai.com/settings/profile/api-keys
생성한 API키를 환경설정->ChatGPT Key에 입력하시면 됩니다.