Altbilgi içeriğine atla
PYTHON IçIN IRONPDF KULLANARAK

Python'da Bir PDF Dosyası Ayrıştırma

1.0 Giriş

Modern kütüphaneler PDF oluşturmayı düzgünleştirdi. PDF projeleri için bir kütüphane seçerken, yapı, okuma ve dönüştürme yeteneklerini dikkate alın, optimal entegrasyon ve performans için. Python, mevcut PDF'leri verimli bir şekilde ayrıştırabilen IronPDF gibi araçlar sunar.

IronPDF

Python, geliştiricilerin hızla ve kolayca grafiksel kullanıcı arayüzleri oluşturmalarını sağlayan bir programlama dilidir. Diğer dillere kıyasla programcılara daha büyük bir dinamizm sunar. Bu nedenle, IronPDF kütüphanesini Python ile entegre etmek kolay bir işlemdir.

Tam donanımlı bir GUI'yi hızlı ve güvenli bir şekilde oluşturmak için çeşitli önceden yüklenmiş araçlar, arasında PyQt, wxWidgets, Kivy ve diğer sayısız paket ve kütüphaneler kullanabilir. Not edilmelidir ki, IronPDF saf bir Python PDF kütüphanesi değildir; bunun yerine .NET Core gibi diğer çerçevelerden çeşitli özellikleri dahil etmenizi sağlar.

IronPDF, özellikle Django, Flask ve Pyramid gibi Python web geliştirme yaklaşımlarının popüler olması nedeniyle, Python web tasarımı ve geliştirmesini kolaylaştırır. Reddit, Mozilla ve Spotify gibi tanınmış web siteleri ve çevrimiçi hizmetler bu çerçeveleri kullandı. IronPDF ile ilgili daha fazla bilgiyi IronPDF Python için web sitesinde öğrenebilirsiniz.

IronPDF Özellikleri

Python Kurulumu

Ortam Kurulumu

PC'nizde Python yüklü olduğundan emin olun. Resmi Python web sitesini ziyaret ederek işletim sisteminize uygun en son Python sürümünü indirip yükleyin. Python yüklendikten sonra, projenizin bağımlılıklarını izole etmek için sanal bir ortam kurun. Sanal ortamlar oluşturmak ve yönetmek için 'venv' modülünü kullanarak dönüştürme projenize temiz ve bağımsız bir çalışma alanı sağlayın.

PyCharm'da Yeni Proje

Bu gösterim için Python kodu yazmak amacıyla bir IDE olan PyCharm'ı kullanacağız.

PyCharm IDE'yi başlattıktan sonra "Yeni Proje"ye tıklayın.

Python'da PDF Dosyası Nasıl Ayrıştırılır, Şekil 1: PyCharm hoş geldiniz ekranı PyCharm hoş geldiniz ekranı

"Yeni Proje" seçimi yaptığınızda, projeye olanak tanır, proje konumunu ve ortamını belirtmenizi sağlayan yeni bir pencere açılacaktır. Aşağıdaki ekran alıntısında bu yeni pencere görülebilir.

Python'da PDF Dosyası Nasıl Ayrıştırılır, Şekil 2: PyCharm'da yeni proje ekranı PyCharm'da yeni proje ekranı

Proje konumunu ve ortam yolunu ayarladıktan sonra Oluştur" butonuna tıklayın. Programın geliştirilebileceği yeni bir pencere açılacaktır. Bu öğretici, Python 3.9 önerdi.

Python'da PDF Dosyası Nasıl Ayrıştırılır, Şekil 3: PyCharm'da açılmış bir ana dosya PyCharm'da açılan bir ana dosya

IronPDF Kütüphane Gereksinimi

Python kütüphanesi olan IronPDF, temel olarak .NET 6.0 üzerine dayanır. Sonuç olarak, Python için IronPDF'i kullanmak için, PC'niz üzerinde .NET 6.0 çalışma zamanı yüklü olmalıdır. Linux ve Mac kullanıcıları bu Python modülünü kullanabilmek için .NET kurmaları gerekebilir. Gerekli çalışma zamanı ortamını .NET web sitesinden edinebilirsiniz.

IronPDF Kütüphane Kurulumu

"IronPDF" paketi, ".pdf" uzantılı dosyaları oluşturmak, düzenlemek ve açmak için yüklenmelidir. Paketi PyCharm'da kurmak için bir terminal penceresi açın ve aşağıdaki komutu yazın:

pip install ironpdf

Alttaki ekran görüntüsü 'IronPDF' paketinin kurulumunu göstermektedir.

Python'da PDF Dosyası Nasıl Ayrıştırılır, Şekil 4: IronPDF'in pip ile kurulumunu gösteren bir terminal Terminalde pip kullanarak IronPDF yüklemesinin gösterimi

IronPDF ile PDF Ayrıştırma

IronPDF kütüphanesinin yardımıyla, PDF dosyalarından metin çıkarmak mümkündür. IronPDF, metin çıkarımı için çeşitli teknikler sunar. İlk yaklaşım, sayfadaki tüm içeriği tek bir dize olarak almaktır. İkinci yaklaşım, içeriği sayfa sayfa okumaktır, ilk sayfadan başlayarak. Aşağıdaki kod parçacığı, IronPDF kullanarak mevcut PDF dosyalarını incelemek için bir şablon gösterir.

PDF'den veri çıkarmak için iki yöntem mevcuttur:

  1. PDF'den sayfa sayfa çıkarmak.
  2. Tüm PDF'yi metin olarak çıkarmak.

Aşağıda, bu makale için kullanacağımız PDF dosyası yer almaktadır. İki sayfası vardır.

Python'da PDF Dosyası Nasıl Ayrıştırılır, Şekil 5: Her sayfanın üst kısmında sayfa numarası olan bir PDF Her sayfanın üst kısmında sayfa numarası olan bir PDF

SAYFA SAYFA METİN ÇIKARIMI

Aşağıda sağlanan örnek kod, PDF dosyasından veri almak için sayfa numarasını kullanma yöntemini açıklar.

from ironpdf import PdfDocument

# Open a PDF file and create a PDF document object
pdfDocument = PdfDocument.FromFile("F:\\PDF\\1.pdf")

# Extract text from the first page (index 0)
AllText = pdfDocument.ExtractTextFromPage(0)

# Print the extracted text from the first page
print(AllText)
from ironpdf import PdfDocument

# Open a PDF file and create a PDF document object
pdfDocument = PdfDocument.FromFile("F:\\PDF\\1.pdf")

# Extract text from the first page (index 0)
AllText = pdfDocument.ExtractTextFromPage(0)

# Print the extracted text from the first page
print(AllText)
PYTHON

Kod parçası, bir PDF dosyasını okumak ve bir PDF belge nesnesi oluşturmak için FromFile işlevinin kullanımını göstermektedir. Bu nesne, PDF içindeki metinlere ve görüntülere erişim sağlar. Belirli bir sayfadan metin çıkarmak için, sayfa numarasını bir parametre olarak sağlayarak ExtractTextFromPage yöntemi kullanılabilir. Bu yöntem, belirtilen sayfadaki tüm kelimeleri içeren bir dize döndürecektir. Çıktı aşağıda görüldüğü gibi gösterilecektir.

How to Parse A PDF File in Python, Figure 6: A screenshot of the terminal with text output Page 1 Terminalde metin çıktısı "Sayfa 1" ile ekran görüntüsü

Sonuçta vurgulanan dikdörtgen kutu, sayfa numarası 1 olan PDF dosyasından çıkarılmış metin verisidir ve indeksi 0'dır.

TÜM SAYFALARDAN ÇIKARIM

Tüm PDF içeriğini hızlı ve kolay bir şekilde tek bir dize olarak almak için ilk yaklaşım, aşağıdaki kod örneğinde gösterilmiştir.

from ironpdf import PdfDocument

# Create a PDF file object from the file path
pdf = PdfDocument.FromFile('F:\\PDF\\1.pdf')

# Extract all text from the entire PDF
all_text = pdf.ExtractAllText()

# Print the extracted text from the entire PDF
print(all_text)
from ironpdf import PdfDocument

# Create a PDF file object from the file path
pdf = PdfDocument.FromFile('F:\\PDF\\1.pdf')

# Extract all text from the entire PDF
all_text = pdf.ExtractAllText()

# Print the extracted text from the entire PDF
print(all_text)
PYTHON

Yukarıda gösterilen örnek kod, mevcut bir dosya yolundan bir PDF okuma ve bunu FromFile işlevi kullanarak bir PDF dosya nesnesine dönüştürme işlemini açıklar. PDF'in düz metni çıkarılacak ve nesnenin ExtractAllText işlevi kullanılarak bir stringe dönüştürülecek ve çıkarılan metin terminalde yazdırılacaktır. Sonuç aşağıdaki gibi gösterilecektir.

How to Parse A PDF File in Python, Figure 7: A screenshot of the terminal with text output Page 1, and Page 2 Terminalde metin çıktısı "Sayfa 1", ve "Sayfa 2" ile ekran görüntüsü

Sonuçta vurgulanan dikdörtgen kutular, PDF dosyasının tüm sayfalarından çıkarılan metni içermektedir.

IronPDF yardımıyla C# kullanarak PDF'ler oluşturabiliyoruz. IronPDF hakkında daha fazla bilgi edinmek için IronPDF web sitesini ziyaret edin.

Sonuç

Riskleri minimuma indirmek ve veri korumasını sağlamak için IronPDF kütüphanesi güçlü güvenlik önlemleri sağlar. Tüm yaygın kullanılan tarayıcılarla uyumludur ve hiçbirine sınırlı değildir. IronPDF, programcıların yalnızca birkaç satır kod ile PDF dosyaları oluşturmasını ve okumasını kolaylaştırır. Geliştiricilerin çeşitli ihtiyaçlarına uyum sağlamak için IronPDF kütüphanesi, ücretsiz geliştirici lisansı ve ek geliştirme lisansları dahil çeşitli lisanslama seçenekleri sunar.

$999 Lite paketi, süresiz bir lisans, 30 günlük para iade garantisi, bir yıl yazılım desteği ve yükseltme olanakları ile birlikte gelir. İlk satın almanın ötesinde, ek bir ücret yoktur. Bu lisanslar, üretim, aşama ve geliştirme ortamlarında kullanılır. IronPDF ayrıca, zaman ve yeniden dağıtım kısıtlamaları ile birlikte ücretsiz lisanslar da sunmaktadır. Ücretsiz deneme süresi boyunca kullanıcılar, ürünü gerçek kullanımda filigran olmadan test edebilirler. IronPDF'in deneme sürümünün maliyeti ve lisanslaması hakkında daha fazla ayrıntı için IronPDF lisanslama sayfasını ziyaret edin.

Sıkça Sorulan Sorular

Python'da PDF belgelerini nasıl ayrıştırabilirim?

IronPDF kullanarak Python'da PDF belgelerini ayrıştırabilirsiniz. Kütüphane, belirli sayfalardan metin çıkarmak için ExtractTextFromPage gibi yöntemleri veya tüm belgeden metin çıkarmak için ExtractAllText kullanmanıza olanak tanır.

Python ortamında IronPDF'yi çalıştırmak için ön koşullar nelerdir?

IronPDF'yi bir Python ortamında çalıştırmak için, sisteminizde .NET 6.0 çalıştırma ortamının yüklü olması gerekir, çünkü IronPDF işlemleri için .NET'e dayanır.

IronPDF popüler Python web çerçeveleriyle kullanılabilir mi?

Evet, IronPDF, Django, Flask ve Pyramid gibi popüler Python web çerçeveleri ile sorunsuz bir şekilde entegre olur, bu da onu web geliştirme projeleri için çok yönlü bir araç yapar.

Python sanal ortamında IronPDF nasıl yüklenir?

Python sanal ortamında IronPDF'yi yüklemek için, öncelikle Python'un yüklü olduğundan emin olun ve sanal bir ortam oluşturun. Paket yüklemek için IDE'nizin terminalinde pip install ironpdf komutunu kullanın.

Python geliştiricileri için IronPDF'nin bazı temel özellikleri nelerdir?

IronPDF, HTML, görüntüler, dizeler ve akışlardan PDF oluşturma, etkileşimli PDF'ler oluşturma, formları doldurma, PDF'leri bölme ve birleştirme, ve metin ve görüntüleri çıkarma gibi özellikler sunar.

IronPDF farklı işletim sistemleriyle uyumlu mu?

Evet, IronPDF farklı işletim sistemleriyle uyumludur. Ancak, Linux ve Mac kullanıcıları, Python modülünü kullanmak için sistemlerinde .NET'in yüklü olduğundan emin olmalıdırlar.

IronPDF için hangi lisans seçenekleri mevcuttur?

IronPDF, sınırları olan ücretsiz bir geliştirici lisansı ve süresiz bir lisans ve 30 günlük para iade garantisi ile bir Lite paket içeren ücretli seçenekler de dahil olmak üzere birkaç lisans seçeneği sunar. Bu seçenekler geliştirmenin ihtiyaçlarına göre esneklik sunar.

PyCharm'da yeni bir IronPDF projesi nasıl kurulur?

PyCharm'da yeni bir IronPDF projesi kurmak için, IDE'yi açın, 'Yeni Proje'ye tıklayın, projenin konumunu ve ortamını yapılandırın. Terminali kullanarak IronPDF'yi pip install ironpdf komutu ile yükleyin.

IronPDF, PDF belgelerinin güvenliğini nasıl sağlar?

IronPDF, PDF belgelerinin güvenliğini ve bütünlüğünü sağlamak için güçlü güvenlik önlemleri entegre eder ve PDF işleme gerektiren uygulamalar için güvenilir bir seçim yapar.

IronPDF, PDF'lerden görüntü çıkarmak için kullanılabilir mi?

Evet, IronPDF, belge nesnesine erişerek ve görüntü verilerini almak için uygun yöntemleri kullanarak PDF'lerden görüntü çıkarmak için kullanılabilir.

Curtis Chau
Teknik Yazar

Curtis Chau, Bilgisayar Bilimleri alanında Lisans Derecesine (Carleton Üniversitesi) sahip ve Node.js, TypeScript, JavaScript ve React konularında uzmanlaşmış ön uç geliştirmeyle ilgileniyor. Sezgisel ve estetik açıdan hoş kullanıcı arayüzleri oluşturma tutkunu, Curtis modern çerçevelerle çalışmayı ve iyi yapı...

Daha Fazla Oku

Iron Destek Ekibi

Haftada 5 gün, 24 saat çevrimiçiyiz.
Sohbet
E-posta
Beni Ara