
Python'da PDF'den Metin Çıkarma
Bu makale, IronPDF kullanarak Python'da PDF dosyalarındaki tüm metinlerin nasıl çıkarılacağını gösterecek ve size bu görevi verimli bir şekilde başarmak için gerekli bilgi ve Python kod parçacıklarını sağlayacaktır.
Python'da PDF'den Metin Çıkarma
- Metin çıkarmak için bir Python modülü indirin
FromFileyöntemini kullanarak PDF dosyasını içe aktarınExtractTextyöntemi ile içe aktarılan PDF'den metin çıkarınExtractTextFromPageyöntemi ile belirli sayfalardan metin çıkarın- Çıkarılan metni konsola veya bir metin dosyasına çıktı olarak verin
IronPDF - Python Kütüphanesi
IronPDF Python için, geliştiricilerin PDF belgelerinden metin çıkarmasına izin veren güçlü bir Python PDF kütüphanesidir. IronPDF ile, PDF dosyalarındaki metin içeriğini çıkarmanın veri çıkarma kısmını otomatikleştirerek, PDF belgeleri içindeki bilginin işlenmesini ve analiz edilmesini kolaylaştırabilirsiniz.
IronPDF, Python'daki PDF dosyalarını manipüle etme, onlardan veri çıkarma ve onlarla etkileşime geçme yeteneği sağlayarak, çeşitli PDF ile ilgili görevleri otomatikleştirmeyi kolaylaştırır. PDF'leri oluşturmanız, mevcut PDF'leri değiştirmeniz, içerikten veri çıkarmanız veya diğer PDF işlemlerini gerçekleştirmeniz gerekip gerekmediği durumlarda, IronPDF size sezgisel API'si ve güçlü yetenekleri ile süreci basitleştirir.
Başlıca Özellikler
Python kütüphanesi IronPDF'in bazı özellikleri şunları içerir:
- Baştan itibaren Yeni bir PDF dosyası oluşturun
- Mevcut PDF dosyalarını düzenleyin
- PDF dosyalarından metin, meta veriler ve resimler çıkarın
- PDF dosyalarını diğer biçimlere dönüştürme
- Parolalar ve kısıtlamalarla PDF dosyalarını güvenli hale getirin
- PDF'leri bölün ve birleştirin
Gereksinimler
IronPDF kullanarak metin çıkarmaya başlamadan önce, aşağıdaki ön koşulların yerine getirildiğinden emin olun:
-
Python Kurulumu: Sisteminizde Python kurulu olduğundan emin olun. IronPDF, Python 3.x sürümleri ile uyumludur, dolayısıyla uyumlu bir Python kurulumu olduğundan emin olun.
-
IronPDF Kütüphanesi: Python paket yöneticisini kullanarak IronPDF kütüphanesini kurun
pip. Komut satırı arayüzünüzü açın ve aşağıdaki komutu çalıştırın:Not: pip komutlarını kullanabilmek için Python'un PATH ortam değişkenine eklenmesi gerekir.
-
Entegre Geliştirme Ortamı (IDE): Mutlak gereklilik olmasa da, bir IDE kullanmak, geliştirme deneyiminizi büyük ölçüde iyileştirebilir. Kod tamamlama, hata ayıklama ve daha düzenli bir iş akışı gibi özellikler sunar. Python geliştirme için popüler bir IDE, PyCharm'dır. PyCharm'ı JetBrains sitesinden https://www.jetbrains.com/pycharm/ adresinden indirebilir ve kurabilirsiniz.
-
Metin Düzenleyici: Alternatif olarak, hafif bir metin düzenleyiciyle çalışmayı tercih ediyorsanız, Visual Studio Code, Sublime Text veya Atom gibi tercihinize uygun herhangi bir metin düzenleyiciyi kullanabilirsiniz. Bu editörler, Python geliştirme için sözdizimi vurgulama ve diğer yararlı özellikler sunar. Python'un kendi IDLE Uygulamasını da kullanabilirsiniz.
PyCharm Kullanarak Python Projesi Oluşturma
PyCharm IDE'yi kurduktan sonra, aşağıdaki adımları izleyerek bir PyCharm Python projesi oluşturun:
- PyCharm'ı Başlat: PyCharm'ı sisteminizin uygulama başlatıcısından veya masaüstü kısayolundan açın.
- Yeni Proje Oluştur: "Yeni Proje Oluştur"a tıklayın veya mevcut bir Python projesini açın.
PyCharm IDE
- Proje Ayarlarını Yapılandır: Projenizin adını verin ve proje dizinini oluşturacağınız yeri seçin. Projeniz için Python yorumlayıcısını seçin. Ardından "Oluştur"a tıklayın.
PyCharm'da yeni Python projesi yaratın
- Kaynak Dosyaları Oluştur: PyCharm, bir ana Python dosyası ve ek kaynak dosyaları için bir dizin içeren proje yapısını oluşturacaktır. Kod yazmaya başlayın ve betiği çalıştırmak için çalıştır düğmesine tıklayın veya Shift+F10 tuşlarına basın.
IronPDF Kullanarak Python'da PDF'den Metin Çıkarma
Şimdi IronPDF kullanarak Python programlama dilinde PDF dosyalarından düz metin çıkarmanın adımlarını inceleyelim.
Gerekli Kütüphaneleri İçe Aktarma
Başlamak için Python betiğinizde gerekli kütüphaneleri içe aktarın. Bu durumda, PDF dosyalarıyla çalışma işlevini sağlayan IronPDF kütüphanesinin içe aktarılması gerekiyor.
import ironpdf
Lisans Anahtarını Ayarlayın
IronPDF kullanarak bir PDF dosyasından tam metin çıkarmak için, IronPDF'in lisanslı olması gereklidir. Lisans veya deneme anahtarını aşağıdaki komutu kullanarak uygulayın:
# Apply your license key
License.LicenseKey = "YOUR-LICENSE-KEY-HERE"
Not: Lisans anahtarı olmadan, IronPDF, PDF uzantı dosyasından yalnızca birkaç karakter çıkarmakla sınırlıdır. Bir lisans anahtarını IronPDF satın alarak veya bir ücretsiz deneme hesap açarak edinin.
PDF Belgesini Yükleyin
Sonraki adımda, PDF dosyasını IronPDF'ten PdfDocument.FromFile() yöntemiyle yükleyin. Bu yönteme PDF dosyasının yolunu argüman olarak sağlayın. Bu, PDF dosyasını bir PdfDocument nesnesine yükleyecektir.
pdf = ironpdf.PdfDocument.FromFile("path/to/your/pdf_file.pdf")
Girdi Dosyası
Girdi PDF dosyasından metin çıkarıp ekranda yazdırmak için aşağıdaki doküman kullanılmaktadır:
Girdi dosyası
PDF Dosyalarından Metin Çıkarın
PDF belgesi yüklendikten sonra, ExtractText yöntemini kullanarak metin içeriğini çıkarabilirsiniz. Bu yöntem, çıkarılan metni bir dizge olarak döndürür.
text = pdf.ExtractText()
Çıkarılan Metni İşleme ve Kullanma
PDF'den metni çıkardıktan sonra, bunu gereksinimlerinize göre işleyebilir ve kullanabilirsiniz. Metni ayrıştırma, analiz etme, bir veritabanına depolama veya ek veri işleme için kullanabiliriz.
# Process and utilize the extracted text
print(text)
# Perform other operations with the extracted text
Çıktı
Konsoldan çıkarılan metin
PDF Dosyasında Belirli Sayfadan Metin Çıkarma
IronPDF ayrıca PDF dosyasındaki belirli sayfalardan metin çıkarmak için kullanışlı bir yöntem sunar. Bu bölüm, IronPDF tarafından sağlanan ExtractTextFromPage yöntemi ile belirli bir sayfadan nasıl metin çıkarılacağını inceleyecektir.
Aşağıdaki kod, belirli bir sayfadan nasıl metin çıkarılacağını göstermektedir:
# Extract text from a specific page in the document
page_2_text = pdf.ExtractTextFromPage(1)
Yukarıdaki örnek kodda, pdf PDF belgesini yükledikten sonra elde edilen PdfDocument nesnesini temsil eder. ExtractTextFromPage() yöntemi, argüman olarak geçen sayfa dizini ile belirtilen bir sayfadan metin çıkarmak için kullanılır. Bu durumda metin, ikinci sayfa veya sayfa numarası 2'den, sayfa dizini 1'e karşılık gelecek şekilde çıkarılır.
Sayfa 2'den metin çıkarma
Sonuç
Bu makale, IronPDF kullanarak Python ile PDF dosyalarından metin çıkarmanın nasıl yapılacağını araştırdı. Gerekli kütüphaneyi içe aktarma, PDF belgesini yükleme, metin içeriğini çıkarma ve çıkarılan metni işleme gibi gerekli adımları kapsadı.
IronPDF'in güçlü metin çıkarma yetenekleri ile, PDF'lerden metin çıkarmayı ve daha fazla işlemeyi otomatikleştirebilir, böylece PDF belgeleri içindeki metin bilgilerini kolayca işleyebilir ve analiz edebilirsiniz. Sezgisel API'si ve geniş yetenekleriyle, Python geliştirmelerinde geniş bir yelpazede PDF ile ilgili görevler için ideal bir seçimdir.
IronPDF, geliştirme amaçlı kullanım için ücretsizdir, ancak ticari kullanım için lisanslanmalıdır. Test için üretim modunda kullanmak için bir ücretsiz deneme edinin. En son sürümünü indirip kurun ve bir IronPDF Python için deneyin.

Curtis Chau, Bilgisayar Bilimleri alanında Lisans Derecesine (Carleton Üniversitesi) sahip ve Node.js, TypeScript, JavaScript ve React konularında uzmanlaşmış ön uç geliştirmeyle ilgileniyor. Sezgisel ve estetik açıdan hoş kullanıcı arayüzleri oluşturma tutkunu, Curtis modern çerçevelerle çalışmayı ve iyi yapılandırılmış, görsel olarak çekici kılavuzlar oluşturmayı seviyor.
İlgili Makaleler


