Ελληνικός analyzer στο Apache Lucene

Η EBS Ε.Π.Ε. προσέφερε στο Apache Lucene project ένα λεκτικό αναλυτή για την ελληνική γλώσσα.

Για όσους δε γνωρίζουν το Lucene, πρόκειται για ένα full text search engine γραμμένο σε Java και με σημαντική θεωρητική θεμελίωση. Με τη βοήθειά του μπορεί κανείς να κάνει αναζητήσεις σε τεράστιο όγκο πληροφορίας σε κλάσματα δευτερολέπτου. Χρησιμοποιείται από εταιρείες όπως η Akamai, η IBM, κλπ., ενώ βρίσκεται ενσωματωμένο είτε σε προϊόντα (π.χ. Eclipse IDE), είτε σε server-side εφαρμογές.


Η ελληνική συνεισφορά στο Lucene προσφέρει τα ακόλουθα πλεονεκτήματα, που είναι δυσεύρετα και σε search engines από διαφορετικά περιβάλλοντα:

– η αναζήτηση για λέξεις όπως “ΜΗΧΑΝΙΚΟΣ”, “Μηχανικός” και “μηχανικός” επιστρέφει τα ίδια αποτελέσματα, καθώς το search query μετατρέπει όλες τις δυνατές μορφές σε μια μοναδική απεικόνιση, λαμβάνοντας υπόψη τις ιδιαιτερότητες της ελληνικής γλώσσας (τόνοι, διαλυτικά, κλπ.)

– η αναζήτηση μπορεί να πραγματοποιηθεί στα πλέον ευρέως χρησιμοποιούμενα character sets, όπως Unicode, ISO-8859-7 και Windows-1253, ενώ και άλλα (βλ. RFC 1947) μπορούν να προστεθούν εύκολα

– η διαδικασία του indexing διαθέτει βελτιωμένες επιδόσεις, αποφεύγοντας κοινές λέξεις (π.χ. και, ο, για, του) οι οποίες σύμφωνα με τις θεωρίες του χώρου του Information Retrieval δε συνεισφέρουν στην ταυτοποίηση ενός κειμένου, άρα και στην αναζήτηση σε αυτό

Για να χρησιμοποιήσει κάποιος τον εληνικό analyzer θα πρέπει να κατεβάσει την τρέχουσα έκδοση του Lucene από το subversion repository του project ή να αναμένει την επόμενη έκδοση.

Τυχόν παρατηρήσεις, σχόλια και προτάσεις για βελτιώσεις, θα είναι ευπρόσδεκτες.

Social Media Auto Publish Powered By : XYZScripts.com