Google zindeksuje treść zeskanowanych książek i dokumentów
By admin • Oct 31st, 2008 • Category: Polecamy, ŚwiatObraz jest wart tysiąca słów – ale nie dla wyszukiwarek internetowych. Z tego powodu Google zapowiedziało, że podda zeskanowane przez siebie dokumenty i książki obróbce OCR, tak by można je było indeksować. W efekcie do wyników wyszukiwań trafi także treść skanów.
- Gdy Google wprowadziło swoją usługę Book Search, starało się w pewnym stopniu udostępnić zeskanowane książki swojej wyszukiwarce. De facto jednak wyszukiwanie odbywało się tylko po tytułach i metadanych. Teraz wyszukiwania będą mogły dotyczyły także treści.
- Po odnalezieniu pożądanych fraz, Google Search zaoferuje przy odnalezionym linku możliwość wyświetlenia go jako dokumentu w formacie PDF (pokazującego, jak wygląda dokument w oryginale) oraz podglądu jako dokumentu HTML, z którego można łatwo już kopiować fragmenty treści. Wszystko dzieje się praktycznie w czasie rzeczywistym.
- Oczywiście ta technologia Google’a nie jest niczym przełomowym, warto jednak zauważyć, że nigdy wcześniej nie zastosowano OCR na taką skalę, a efekty optycznego rozpoznawania znaków nie były tak dobre. Najwyraźniej kupowane przez giganta z Mountain View kontenery pełne mikroprocesorów znajdują dobre zastosowanie.
- O możliwościach nowego systemu najlepiej przekonać się osobiście, oglądając np. ten dokument: www.google.com/search?q=theory+of+interstellar+trade.
- Źródło: webhosting.pl googleblog.blogspot.com
admin is
Napisz maila do autora | Wszystkie wpisy admin