
Python'da Metne PDF Dönüştürme (Eğitim)
Bu makale, Python için en güçlü PDF kütüphanelerinden biri olan IronPDF kullanarak bir PDF belgesinde bulunan herhangi bir metni çıkarmayı nasıl kullanacağını gösterecektir.
Python'da PDF'yi Metne Dönüştürme
- PDF'yi metne dönüştürmek için bir Python kütüphanesi yükleyin
- Mevcut bir PDF belgesi yükleyin veya yenisini renderlayın
ExtractAllTextyöntemini kullanarak açılmış dosyadan metin okuyun- Belirli sayfa(lar)daki metni okumak için metodun diğer bir yükünü kullanın.
- Çıkarılan metni konsola yazdırın veya bir metin dosyasına kaydedin.
2.0 Python Kullanarak Bir PDF'den Nasıl Metin Çıkartılır?
- Python indirme sayfasından Python'un en son sürümünü indirin
- Python için herhangi bir IDE aracı açın
- .NET Core runtime'ı yükleyin
- IronPDF for Python kütüphanesini yükleyin veya PyPI indirme sayfasından indirin
- PDF'den metin çıkarın
2.1 IronPDF for Python nedir?
Python'da IronPDF kütüphanesini eklemek son derece basittir çünkü diğer dillere göre çok daha dinamik bir dildir ve geliştiricilerin hızlıca ve kolayca grafik kullanıcı arabirimleri oluşturmasına olanak tanır. PyQT, wxWidgets, kivy ve daha birçok ek paket ve kütüphane dahil olmak üzere, tam bir GUI'yi hızlı ve güvenli bir şekilde oluşturmak için kullanılabilecek birçok önceden yüklenmiş araç içerir.
IronPDF for Python son derece etkili bir kütüphanedir, özellikle web geliştirme için çok yararlıdır. Django, Flask ve Pyramid gibi birçok Python web geliştirme paradigmalarının varlığı kısmen bunun nedenidir. Bu çerçeveler, Reddit, Mozilla ve Spotify dahil olmak üzere birçok web sitesi ve çevrimiçi hizmette kullanılmıştır.
2.2 IronPDF Özellikleri
- Bir PDF dosyası, HTML, HTML5, ASP ve PHP siteleri dahil olmak üzere çeşitli kaynaklardan oluşturulabilir. HTML dosyalarına ek olarak, görüntü dosyalarını PDF'ye dönüştürmek da mümkündür.
- IronPDF, etkileşimli PDF belgeleri oluşturmanıza, etkileşimli formları doldurmanıza ve göndermenize olanak tanır, bölme ve birleştirme PDF dosyaları, PDF dosyalarından metin ve resimleri çıkarma, bir PDF dosyasındaki belirli kelimeleri arama, PDF sayfalarını görüntülere rasterize etme, PDF'yi HTML'e dönüştürme ve PDF dosyalarını yazdırma.
- IronPDF PDF dosyalarını açabilir ve bir URL'den yazdırabilir. Ayrıca kullanıcı yetkililerinin HTML oturum açma formlarının, proxy'lerin, tanımlama bilgileri, HTTP başlıkları, özel ağ giriş kredileri, form değişkenleri ve kullanıcı yetkililerinin arkasında oturum açmasına olanak tanır.
- IronPDF kullanılarak belgelerden görüntüler çıkarılabilir.
- IronPDF ile, belgeler için başlıklar ve altbilgiler, metin ve resimler, yer imleri ve filigranlar ve daha fazlasını eklemek çok kolaydır.
- IronPDF kullanarak yeni veya mevcut bir belgeyi kullanarak sayfaları birleştirmek ve ayırmak mümkündür.
- Bir Acrobat görüntüleyici kullanmadan, belgeler PDF nesnelerine dönüştürülebilir.
- Bir CSS dosyası kullanarak bir PDF belgesi oluşturulabilir.
- Medya türü CSS dosyaları kullanarak belge oluşturmak mümkündür.
2.3 IronPDF Kütüphanesini İçe Aktar
IronPDF'nin kullanılacağı kaynak dosyaların başında, IronPDF'yi içe aktarmak için aşağıdaki import ifadelerini ekleyin:
from ironpdf import *
2.4 Lisans Anahtarını Ayarla (gerekirse)
Her ne kadar IronPDF for Python ücretsiz kullanıma açıksa da, ücretsiz kullanıcılar için PDF dosyalarını karolu bir zemin ile damgalar. IronPDF'yi su işareti olmayan PDF ler oluşturmak için kullanmak istiyorsanız, kütüphaneye geçerli bir lisans anahtarı vermelisiniz. Lisans anahtarı ile kütüphanenin nasıl ayarlanacağı, aşağıdaki kod parçasında gösterilmiştir:
# Set the license key for IronPDF
License.LicenseKey = "IRONPDF-LICENSE-KEY-ABCDEFGH"
PDF dosyaları oluşturmadan veya içeriklerini değiştirmeden önce, lisans anahtarının ayarlandığından emin olun. LicenseKey yöntemi, herhangi bir diğer kod satırından önce çağrılmalıdır. Ücretsiz deneme lisans anahtarı almak için deneme lisans sayfasını ziyaret edin, lisanslama sayfasına gidin.
2.5 Log Dosyalarını Ayarla
"Default" adlı bir metin dosyası, Custom.log tarafından üretilen günlük mesajlarını Python betiğinin dizininde saklayabilir. Aşağıdaki kod parçası, LogFilePath özelliğini ayarlamak ve günlük dosyası adını ve konumunu özelleştirmek için kullanılabilir:
# Enable debugging and set the log file path and mode
Logger.EnableDebugging = True
Logger.LogFilePath = "Custom.log"
Logger.LoggingMode = Logger.LoggingModes.All
3.0 IronPDF ile PDF Metni Çıkarma
Python için IronPDF kütüphanesi, PDF sayfalarını PDF nesnelerine dönüştürebilir ve taranan PDF dosyaları da dahil olmak üzere PDF dosyalarından metin çıkarmayı sağlar. Mevcut bir PDF'yi IronPDF kullanarak nasıl okuyabileceğinizi gösteren bir örnek burada.
İlk yöntem, bir PDF'de mevcut olan tüm metni çıkarmayı içerir; Bir kod örneği aşağıda verilmiştir.
from ironpdf import *
# Load existing PDF document
pdf = PdfDocument.FromFile("content.pdf")
# Extract all the text from the entire PDF document
all_text = pdf.ExtractAllText()
# Display the extracted text
print(all_text)
Yukarıdaki kodda gösterildiği gibi, FromFile yöntemi, mevcut PDF dosyasını yükleyen ve bunu PDF-doküman nesnelerine dönüştüren bir PDF okuyucu nesnesidir. Bu nesne, PDF sayfalarında mevcut olan metin ve resimler okunurken kullanılabilir. Nesne, tüm PDF dosyasındaki metin parçalarını çeken ve işlenebilir bir dizede tutan ExtractAllText adlı bir yöntem sağlar. Ve daha sonra metni görüntülemek için print fonksiyonu kullanılır.
Metni Görüntüleme
PDF dosyasından metin çıkarmak için sayfa sayfa kullanılabilecek ikinci yöntem için kod örneği aşağıda sağlanmıştır.
from ironpdf import *
# Load existing PDF document
pdf = PdfDocument.FromFile("content.pdf")
# Extract text from a specific page in the document
page_text = pdf.ExtractTextFromPage(1)
# Display the extracted text from the specified page
print(page_text)
FromFile yöntemi, mevcut bir dosyadan PDF dosyasını yüklemek ve yukarıda gösterildiği gibi bir PDF dosyası nesnesine dönüştürmek için kullanılır. PDF sayfa nesnesinde bulunan ve ExtractTextFromPage olarak adlandırılan bir yöntem, bir PDF dosyasındaki bir sayfadaki tüm metni alır. Belirli bir sayfadan metin çıkarmak için sayfa numarası bir parametre olarak sağlanmalıdır. Daha sonra, metni çıkardıktan sonra, işlenebilir bilgiyi tutmak için page_text kullanılabilir.
Daha fazla örneğe göz atın ve bir PDF'den metin çıkarın.
4.0 Sonuç
IronPDF kütüphanesi, karşılaştırma olarak, potansiyel riskleri azaltacak güçlü güvenlik önlemleri sunar. Herhangi bir tarayıcıya özel değildir ve tüm yaygın olarak kullanılan tarayıcılarla çalışır. IronPDF, programcıların sadece birkaç satır kod ile PDF dosyalarını kolayca üretip okumalarına olanak tanır. IronPDF kütüphanesi, farklı geliştiricilerin ihtiyaçlarını karşılamak adına, ücretsiz bir geliştirme lisansı ve satın alınabilecek ek geliştirme lisansları dahil olmak üzere bir dizi lisanslama seçeneği sunar.
IronPDF, süresiz lisansı, 30 gün para iadesi garantisi, bir yıl yazılım desteği ve yükseltme seçeneklerini içerir. İlk satın alımdan sonra ek bir masraf yoktur. Bu lisanslar geliştirme, test ve üretim ortamlarında kullanılabilir. Ürün lisanslama hakkında daha fazla bilgi edinin.

Curtis Chau, Bilgisayar Bilimleri alanında Lisans Derecesine (Carleton Üniversitesi) sahip ve Node.js, TypeScript, JavaScript ve React konularında uzmanlaşmış ön uç geliştirmeyle ilgileniyor. Sezgisel ve estetik açıdan hoş kullanıcı arayüzleri oluşturma tutkunu, Curtis modern çerçevelerle çalışmayı ve iyi yapılandırılmış, görsel olarak çekici kılavuzlar oluşturmayı seviyor.
İlgili Makaleler


