מה זה hebrew-ocr-forms?
hebrew-ocr-forms מזהה את סוג הטופס הממשלתי הסרוק, מנקה את התמונה מרעש ומעיקום, ומריץ זיהוי תווים בעברית עם Tesseract כדי לחלץ שדות כמו גוש, חלקה, בעלים, שכר או סכום קצבה. הוא מתאים לנסח טאבו, טפסי מס הכנסה, אישורי ביטוח לאומי ורישיון רכב, ולא לכתב יד.
משרד רואי חשבון, עורכי דין או סוכנות שמקבלים כל שבוע ערימת טפסים סרוקים, כמו נסח טאבו או טופס 106, מבזבזים זמן יקר על הקלדה ידנית של אותם שדות שוב ושוב. hebrew-ocr-forms בנוי בדיוק בשביל זה: הוא מזהה את סוג הטופס לפי מילות מפתח כמו נסח טאבו או אישור ניכוי מס במקור, ואז מריץ שרשרת עיבוד שמכינה את התמונה לזיהוי תווים מדויק בעברית.
התהליך מתחיל בזיהוי סוג הטופס מתוך טבלה שכוללת נסח טאבו, טופס 106, אישור ניכוי מס, טופס 857, אישור זכאויות מביטוח לאומי, טופס 100 ורישיון רכב. אחר כך preprocess_image.py הופך את הסריקה לשחור לבן, מיישר עיוות סריקה נפוץ בטפסים ישראליים, ומנקה רעש עם פעולות מורפולוגיות. השלב הבא מריץ extract_form_fields.py עם הגדרות Tesseract שמותאמות לעברית, מנוע רשת נוירונים ומצב שמניח בלוק טקסט אחיד, כדי לחלץ את השדות הרלוונטיים לכל סוג טופס.
לדוגמה, משרד עורכי דין שמקבל נסח טאבו סרוק לפני עסקת מקרקעין יכול לקבל את הגוש, החלקה, שם הבעלים והערות אזהרה כטבלה מסודרת במקום להקליד ידנית מתוך תמונה. הסקיל מצהיר בפירוש שהוא לא מיועד לכתב יד, שדורש מודלים ייעודיים, ולא לטפסים שאינם ישראליים, כי כל ההגדרות בנויות סביב מבנה הטפסים הרשמיים בארץ.
למי זה מתאים
- משרד רואי חשבון או עורכי דין שמקבל טפסים סרוקים מלקוחות וצריך להקליד אותם למערכת
- עסק שמעביר עובדים חדשים ומקבל טפסי 106 סרוקים שצריך להזין למערכת שכר
- מי שעובר עסקת מקרקעין וצריך לחלץ נתונים מנסח טאבו במהירות לפני חתימה
- משרד שמנהל תיקי לקוחות מול ביטוח לאומי ומקבל אישורי זכאות סרוקים
- מי שרוצה להמיר כמות גדולה של נסחי טאבו לגיליון אלקטרוני אחד
מה הוא עושה
זיהוי סוג הטופס
מזהה לפי כותרת ומילות מפתח אם מדובר בנסח טאבו, טופס 106, אישור ניכוי מס, טופס 857, אישור זכאויות, טופס 100 או רישיון רכב.
ניקוי והכנת התמונה
preprocess_image.py הופך לשחור לבן, מיישר עיוות סריקה, ומנקה רעש עם פעולות מורפולוגיות לפני זיהוי התווים.
זיהוי תווים בעברית
extract_form_fields.py מריץ Tesseract עם הגדרות מותאמות לעברית, מנוע רשת נוירונים ומצב בלוק טקסט אחיד, לדיוק גבוה יותר בטפסים רשמיים.
המרת נסח טאבו לגיליון
tabu_to_spreadsheet.py הופך נסח טאבו סרוק לשורה מסודרת בגיליון, עם גוש, חלקה, בעלים והערות אזהרה.
טיפול בעברית מימין לשמאל
references/israeli-form-types.md ו-references/nesach-tabu-structure.md מסבירים את מבנה כל טופס וכיווניות הטקסט הנכונה לחילוץ.
גבולות ברורים
הסקיל לא מיועד לזיהוי כתב יד, שדורש מודלים ייעודיים, ולא לעיבוד טפסים שאינם ישראליים.
דוגמאות שימוש
מה כותבים ל-Claude אחרי ההתקנה, ומה מקבלים.
חילוץ נתונים מנסח טאבו לפני עסקה
יש לי נסח טאבו סרוק לפני חתימה על עסקת מקרקעין. תשתמש ב-hebrew-ocr-forms ותוציא לי גוש, חלקה, בעלים והערות אזהרהמה מקבלים: טבלה מסודרת עם גוש, חלקה, שם הבעלים והערות האזהרה שמופיעות בנסח, מוכנה להעתקה או לבדיקה מול מסמכי העסקה.
הזנת טופס 106 של עובד חדש
קיבלתי טופס 106 סרוק מעובד חדש. תשתמש ב-hebrew-ocr-forms ותחלץ לי את השכר, המעביד והניכוייםמה מקבלים: חילוץ שדות השכר השנתי, פרטי המעביד הקודם והניכויים שדווחו, מוכן להזנה למערכת השכר או לתיק העובד.
המרת כמה נסחי טאבו לגיליון אחד
יש לי עשרה נסחי טאבו סרוקים של נכסים שונים. תשתמש ב-hebrew-ocr-forms עם tabu_to_spreadsheet.py ותרכז אותם בגיליון אחדמה מקבלים: גיליון אחד עם שורה לכל נכס, כולל גוש, חלקה, בעלים והערות, שמאפשר השוואה מהירה בין הנכסים במקום לפתוח כל נסח בנפרד.
חילוץ אישור זכאות מביטוח לאומי
לקוח שלח לי אישור זכאויות סרוק מביטוח לאומי. תשתמש ב-hebrew-ocr-forms ותגיד לי איזו קצבה ואיזה סכום מופיעים בומה מקבלים: חילוץ סוג הקצבה והסכום שמופיעים באישור, עם ציון אם חלק מהתמונה לא היה ברור מספיק לזיהוי מדויק.
מה צריך לפני שמתחילים
- Tesseract OCR עם חבילת שפה עברית מותקנת במחשב, למשל דרך brew install tesseract tesseract-lang במק
- Python עם הספריות pytesseract, Pillow ו-opencv-python
- Claude Code או כל סוכן שתומך בהרצת פקודות Bash לצד סקילים
- git להתקנה בפקודה, או Node.js 20 ומעלה אם משתמשים ב-CLI של skills-il
- בלי מפתח API ובלי עלות, הסקיל ברישיון MIT. הדיוק תלוי באיכות הסריקה המקורית
אין עדיין Claude Code? במדריך הזה יש התקנה צעד אחרי צעד.
איך מתקינים את hebrew-ocr-forms.
יש 3 דרכים, ומספיקה אחת מהן. הראשונה הכי פשוטה, בלי קוד בכלל.
הכי פשוט: באפליקציה של Claude, בלי שום קוד
מתאים ל-Claude במחשב ובדפדפן. לוקח דקה, ועושים את זה פעם אחת.
- מורידים את הסקילהורדת hebrew-ocr-forms.zip (35 KB)לא פותחים את הקובץ, מעלים אותו כמו שהוא.
- מדליקים פעם אחת את היכולתב-Claude נכנסים ל-Settings, ואז Capabilities, ומדליקים את
Code execution and file creation. - מעלים את הקובץנכנסים ל-Customize, ואז Skills, לוחצים על הפלוס, בוחרים
Create skillואזUpload a skill, ובוחרים את הקובץ שהורדתם. - זהו, עובדיםמבקשים מ-Claude את המשימה במילים רגילות, והוא משתמש בסקיל לבד כשהוא רלוונטי.
ב-Claude Code: מדביקים הודעה אחת
פותחים שיחה חדשה ב-Claude Code, מעתיקים את ההודעה ומדביקים. כש-Claude מבקש אישור להריץ, לוחצים Allow.
תתקין לי בבקשה את הסקיל hebrew-ocr-forms ממאגר skills-il/localization. תריץ בדיוק את הפקודה הזו בטרמינל, ואם Tesseract לא מותקן אצלי תעצור ותסביר לי איך להתקין אותו לפני שממשיכים: D="$(mktemp -d)" && git clone --depth 1 -q https://github.com/skills-il/localization "$D/repo" && mkdir -p ~/.claude/skills && cp -R "$D/repo/hebrew-ocr-forms" ~/.claude/skills/ && rm -rf "$D" && echo "הותקן ✓"
בטרמינל, ידנית
למי שמעדיף להריץ בעצמו. מעתיקים לטרמינל ומריצים.
D="$(mktemp -d)" && git clone --depth 1 -q https://github.com/skills-il/localization "$D/repo" && mkdir -p ~/.claude/skills && cp -R "$D/repo/hebrew-ocr-forms" ~/.claude/skills/ && rm -rf "$D" && echo "הותקן ✓"
npx skills-il add skills-il/localization@v1.4.0-hebrew-ocr-forms --skill hebrew-ocr-forms -a claude-code -y -gמתקינים Tesseract עם חבילת עברית לפני השימוש הראשון, ומריצים pip install pytesseract pillow opencv-python. אחר כך מפעילים מחדש את Claude Code כדי שהסקיל ייטען.
- מריצים tesseract --list-langs ובודקים ש-heb מופיע ברשימת השפות המותקנות
- מריצים ls ~/.claude/skills/hebrew-ocr-forms ומוודאים שמופיע SKILL.md
- שואלים את Claude: יש לך סקיל שמזהה טפסים ממשלתיים סרוקים בעברית?
מריצים שוב את אותה פקודת git, והיא מחליפה את התיקייה הקיימת בגרסה העדכנית. עם ה-CLI של skills-il מריצים npx skills-il update.
rm -rf ~/.claude/skills/hebrew-ocr-forms
איך משתמשים ביום יום
- שומרים את התמונה הסרוקה בקובץ ברור, JPG או PNG, ומציינים ל-Claude את הנתיב שלה
- מציינים איזה סוג טופס זה אם ידוע, נסח טאבו, טופס 106 או אישור זכאות, כדי לקצר את שלב הזיהוי
- אם הטקסט לא ברור, מבקשים מ-Claude להריץ קודם את preprocess_image.py כדי לשפר את איכות התמונה
- בודקים את השדות שחולצו מול המקור לפני שמזינים אותם למערכת אחרת, במיוחד מספרים חשובים כמו גוש וחלקה
טיפים שימושיים
- סריקה באיכות נמוכה או עקומה פוגעת מאוד בדיוק, ולכן כדאי לסרוק ב-300 DPI ומעלה כשאפשר
- טפסים ישראליים רבים מגיעים עקומים מעט מהסריקה, ולכן שלב היישור ב-preprocess_image.py חשוב במיוחד
- לכמות גדולה של נסחי טאבו, tabu_to_spreadsheet.py חוסך הרבה זמן לעומת פתיחה ידנית של כל קובץ
- לפני הזנת נתונים רגישים כמו מספר תעודת זהות למערכת אחרת, כדאי לבדוק אותם שוב מול המקור
תקלות נפוצות
Tesseract לא מזהה עברית בכלל
התוצאה מלאה בשגיאות זיהוי
הטופס בכתב יד ולא מודפס
שאלות ותשובות
עובד גם על טפסים באנגלית?
צריך תשלום כדי להשתמש בו?
עובד על כתב יד?
מה ההבדל בינו לבין israeli-gov-form-automator?
קרדיט ומקור. hebrew-ocr-forms נכתב על ידי skills-il ונמצא ב-skills-il/localization ברישיון MIT. skills-il הוא פרויקט קוד פתוח ישראלי של סקילים ל-AI, ואפשר למצוא את כל הסקילים שלהם גם ב-agentskills.co.il. את העמוד כתב קורן בן עזרא אחרי בדיקה של המאגר ושל פקודות ההתקנה (30.09.2026). מאגרים מתעדכנים, ולכן אם משהו השתנה, המאגר הוא המקור הקובע.