
* 겪고 있는 문제 상황을 최대한 자세하게 작성해주세요.
* 문제 해결을 위해 어떤 시도를 해보았는지 구체적으로 함께 알려주세요.
2-5. 파일 읽고 분석 결과 녹여내기
pdf 실습 중 아래와 같이 계속 돌고 도는 오류가 발생하였습니다.
pdf 파일에는 이상이 없습니다.
하단분에 있는 pdf 앱도 설치 했는데, 같은 현상이 계속 발생하고 있습니다.
PDF 내용을 제대로 읽어오겠습니다.
Read c:\Users\user\Desktop\claude-practice\sample-contract.pdf
PDF 렌더링 도구가 없어 직접 읽기에 실패했습니다. 텍스트 추출을 다른 방법으로 시도해 보겠습니다.
Bash Extract text from PDF using available Python libraries
IN
python -c "
import sys
try:
import pdfplumber
with pdfplumber.open(r'c:\Users\user\Desktop\claude-practice\sample-contract.pdf') as pdf:
for i, page in enumerate(pdf.pages):
print(f'--- Page {i+1} ---')
print(page.extract_text())
except ImportError:
try:
import pypdf
reader = pypdf.PdfReader(r'c:\Users\user\Desktop\claude-practice\sample-contract.pdf')
for i, page in enumerate(reader.pages):
print(f'--- Page {i+1} ---')
print(page.extract_text())
except ImportError:
try:
import PyPDF2
with open(r'c:\Users\user\Desktop\claude-practice\sample-contract.pdf', 'rb') as f:
reader = PyPDF2.PdfReader(f)
for i, page in enumerate(reader.pages):
print(f'--- Page {i+1} ---')
print(page.extract_text())
except ImportError:
print('No PDF library available')
"
OUT
Exit code 49 Python
Bash Try PDF text extraction with python3
IN
python3 -c "
try:
import pdfplumber
with pdfplumber.open(r'c:/Users/user/Desktop/claude-practice/sample-contract.pdf') as pdf:
for i, page in enumerate(pdf.pages):
print(f'--- Page {i+1} ---')
print(page.extract_text())
except Exception as e:
print(f'pdfplumber error: {e}')
try:
import pypdf
reader = pypdf.PdfReader(r'c:/Users/user/Desktop/claude-practice/sample-contract.pdf')
for i, page in enumerate(reader.pages):
print(f'--- Page {i+1} ---')
print(page.extract_text())
except Exception as e2:
print(f'pypdf error: {e2}')
"
OUT
Exit code 49 Python
PowerShell
IN
{
"command": "Get-Command python, python3, py -ErrorAction SilentlyContinue | Select-Object Name, Source",
"description": "Check available Python interpreters"
}
OUT
Exit code 1
Name Source
---- ------
python.exe C:\Users\user\AppData\Local\Microsoft\WindowsApps\python.exe
python3.exe C:\Users\user\AppData\Local\Microsoft\WindowsApps\python3.exe
PowerShell
IN
{
"command": "& \"C:\\Users\\user\\AppData\\Local\\Microsoft\\WindowsApps\\python.exe\" -c \"import pypdf; reader = pypdf.PdfReader('C:/Users/user/Desktop/claude-practice/sample-contract.pdf'); [print(f'--- Page {i+1} ---\\n' + page.extract_text()) for i, page in enumerate(reader.pages)]\" 2>&1",
"description": "Extract PDF text using Windows Python and pypdf"
}
OUT
Exit code 49
python.exe : Python
At line:1 char:1
+ & "C:\Users\user\AppData\Local\Microsoft\WindowsApps\python.exe" -c " ...
+ ~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~
+ CategoryInfo : NotSpecified: (Python :String) [], RemoteException
+ FullyQualifiedErrorId : NativeCommandError
PowerShell
IN
{
"command": "Get-Command pdftotext, mutool, gs -ErrorAction SilentlyContinue | Select-Object Name, Source",
"description": "Check for PDF CLI tools"
}
OUT
Exit code 1
PowerShell
IN
{
"command": "Add-Type -Path \"C:\\Windows\\System32\\PresentationFramework.dll\" -ErrorAction SilentlyContinue\n$bytes = [System.IO.File]::ReadAllBytes(\"C:\\Users\\user\\Desktop\\claude-practice\\sample-contract.pdf\")\n$text = [System.Text.Encoding]::UTF8.GetString($bytes)\n# Extract readable text portions\n$matches = [regex]::Matches($text, '[\\p{IsHangul}\\p{IsBasicLatin}\\p{IsLatin-1Supplement}]{4,}')\n$matches | ForEach-Object { $_.Value } | Select-Object -First 200 | Out-String",
"description": "Attempt raw text extraction from PDF bytes"
