Adobe Reader עם OCR - איך זה עובד?
שמתי לב היום לראשונה שאני יכול לבחור טקסט ממסמך PDF מסוים שמקורו בסריקת דף מודפס. הנה הדף: http://bitsavers.org/pdf/digitalResearc ... e_1982.pdf
האם לAdobe Reader יש OCR מובנה או האם יש צורך ושיטה להכין מסמכים כאלה מראש בעזרת תוכנת OCR שיודעת לספק את הקישור בים הגרפיקה לטקסט כבר בתוך הPDF עצמו או האם יש דרך שלישית?
האם לAdobe Reader יש OCR מובנה או האם יש צורך ושיטה להכין מסמכים כאלה מראש בעזרת תוכנת OCR שיודעת לספק את הקישור בים הגרפיקה לטקסט כבר בתוך הPDF עצמו או האם יש דרך שלישית?
משה
אתה מבלבל קצת, מסמכי PDF לא מכינים ב Adobe Reader
קוראים אותם איתו ולכן הוא נקרא Reader
כדי להכין מסמכי PDF יש המון מוצרים, הגדול והידוע שבהם הוא כמובן Adobe Acrobat שעולה 300 דולר בגרסה הרגילה (שים לב, acrobat , לא acrobat reader)
אני 90% בטוח שאקרובט יודע לעשות OCR בעצמו.
דרך שלישית תהיה להשתמש במוצר OCR (אחר) נפרד ולשמור את הקובץ ל PDF באמצעות תוכנה אחרת (יש הרבה).
אני מניח שתוכנת OCR שמכבדת את עצמה כבר תוכל לשמור ישירות ל PDF
קוראים אותם איתו ולכן הוא נקרא Reader
כדי להכין מסמכי PDF יש המון מוצרים, הגדול והידוע שבהם הוא כמובן Adobe Acrobat שעולה 300 דולר בגרסה הרגילה (שים לב, acrobat , לא acrobat reader)
אני 90% בטוח שאקרובט יודע לעשות OCR בעצמו.
דרך שלישית תהיה להשתמש במוצר OCR (אחר) נפרד ולשמור את הקובץ ל PDF באמצעות תוכנה אחרת (יש הרבה).
אני מניח שתוכנת OCR שמכבדת את עצמה כבר תוכל לשמור ישירות ל PDF
לא התבלבלתי. עקרונית (זה לא המציאות, אך יכלה להיות מבחינה טכנית), היה ניתן להכניס רכיב OCR לreader, שיגלה מה הטקסט on the fly.
בינתיים גיליתי דרך הproperties של המסמך שהוא הוכן בעזרת http://www.adobe.com/support/downloads/ ... ftpID=1907 שהוא אכן פלאגין ל Acrobat.
זה היה מסוג הדברים שהפתיעו אותי (לטובה) כי לא ראיתי את זה אף פעם. אני רגיל לראות תוצאות של OCR בתצוגה נפרדת מהמקור הגרפי.
בינתיים גיליתי דרך הproperties של המסמך שהוא הוכן בעזרת http://www.adobe.com/support/downloads/ ... ftpID=1907 שהוא אכן פלאגין ל Acrobat.
זה היה מסוג הדברים שהפתיעו אותי (לטובה) כי לא ראיתי את זה אף פעם. אני רגיל לראות תוצאות של OCR בתצוגה נפרדת מהמקור הגרפי.
משה
זה אכן אפשרי להוסיף רכיב OCR לreader אבל לא מבריק במיוחד
המון עיבוד שיתבצע בצד הקורא וחוסר יכולת של מכין המסמך לוודא שהתוכן המועתק נטול שגיאות. זה לא "רוח הדברים" של adobe בכל מה שקשור לPDFים
בכל אופן צודק, אני לא הבנתי אותך נכון ולא עניתי על השאלה
בכל אופן צודק, אני לא הבנתי אותך נכון ולא עניתי על השאלה
זה בעיקר לא מבריק מבחינה שיווקית. הרי כל המודל שלהם זה לחלק את הreader בחינם כדי למכור את הAcrobat.
כל פונקציונאליות שיתנו חינם בreader ויכלו למכור בכסף בwriter זה הפסד.
מבחינתי כמשתמש reader דווקא זה היה יכול להיות נפלא. הרי לא כל אחד דואג להכין מסמך שעבר OCR, זה רק מיעוט.
כל פונקציונאליות שיתנו חינם בreader ויכלו למכור בכסף בwriter זה הפסד.
מבחינתי כמשתמש reader דווקא זה היה יכול להיות נפלא. הרי לא כל אחד דואג להכין מסמך שעבר OCR, זה רק מיעוט.
משה
???drixie כתב:זה לא OCR בכלל, אלא הוספת עוד LAYER של הטקסט, במקביל לתצוגה הגרפית שלו. לכן זה עובד, למשל, במסמך WORD שתדפיס כPDF, ולא עובד כשתיקח דף מודפס, ותסרוק אותו לפורמט PDF....
המסמך המקורי זה נייר מודפס. ברור שהיה שם OCR בדרך.
חוץ מזה, כבר ראיתי בproperties גם מה היצר אותו ונתתי את הלינק.
משה

