עיבוד מסמכים באמצעות כלי לניתוח פריסות של Gemini
כלי ניתוח הפריסה של Document AI הוא שירות מתקדם לניתוח טקסט ולהבנת מסמכים, שממיר תוכן לא מובנה מקבצים מורכבים למידע מובנה, מדויק וקריא למחשב. הוא משלב בין מודלים מיוחדים של Google לזיהוי תווים אופטי (OCR) לבין יכולות ה-AI הגנרטיבי של Gemini. הוא מבין את המבנה המלא של המסמך ומזהה אלמנטים כמו טבלאות, איורים, רשימות וכותרות, תוך שמירה על הקשרים ביניהם, למשל אילו פסקאות שייכות לאיזו כותרת.
הוא נועד לפתור בעיה קריטית בחיפוש וב-Retrieval-Augmented Generation (יצירה משולבת-אחזור, RAG): טכנולוגיית OCR רגילה משטחת מסמכים, וכך הורסת את ההקשר והמבנה שמוסיפים משמעות חשובה, כמו כותרות, טבלאות ורשימות.
תרחישים עיקריים לדוגמה
- זיהוי תווים אופטי (OCR) במסמכים: הוא יכול לנתח טקסט ורכיבי פריסה כמו כותרת, כותרת עליונה, כותרת תחתונה, מבנה טבלה ואיורים ממסמכי PDF.
- חיפוש באיכות גבוהה ו-RAG: השימוש העיקרי בו הוא הכנת מסמכים לחיפוש ולצינורות RAG. היכולת הזו משפרת באופן משמעותי את איכות השליפה ואת הדיוק של התשובות שנוצרות.
- הטמעה של נתונים מובְנים: הוא יכול לנתח מסמכים מורכבים (כמו דוחות או מסמכי 10-K) ולבצע אינדוקס של תוכן מובנה (כמו טבלאות מנותחות או תיאורי תמונות) במסדי נתונים, כמו שמוצג ב-BigQuery.
איך זה עובד?
מנתח הפריסה של Gemini מעבד מסמכים בצינור רב-שלבי שנועד לשמר את המשמעות הסמנטית:
- ניתוח ומבנה: המסמך מוזן למערכת. כל הרכיבים מזוהים ומאורגנים בפורמט של עץ. שדה הפרוטו
DocumentLayoutהזה שומר על ההיררכיה הטבועה במסמך. - הערות והסברים: תצוגה מקדימה יכולות ה-AI הגנרטיבי של Gemini משמשות להסבר מילולי של רכיבים ויזואליים מורכבים. הערות מפורטות בטקסט מתווספות לתרשימים, לטבלאות ולנתונים.
- חלוקה לחלקים והגדלה: המסמך המנותח וההערות שלו משמשים ליצירת חלקים בעלי קוהרנטיות סמנטית. החלקים האלה מועשרים במידע הקשרי, כמו כותרות האב שלהם, כדי להבטיח שהמשמעות של החלק תישמר גם אם הוא יאוחזר בנפרד.
גרסאות המעבד
אלה המודלים שזמינים לניתוח פריסה. כדי לשנות את גרסאות המודלים, אפשר לעיין במאמר בנושא ניהול גרסאות המעבד.
כדי להגיש בקשה להגדלת מכסה (QIR) למכסת ברירת המחדל של המעבד, פועלים לפי השלבים במאמר ניהול המכסה.
| גרסת המודל | תיאור | ערוץ הפצה | תאריך הפצה |
|---|---|---|---|
pretrained-layout-parser-v1.0-2024-06-03 |
גרסה זמינה לכלל המשתמשים לניתוח פריסת מסמכים. זוהי גרסת ברירת המחדל של המעבד שעבר אימון מראש. | יציב | 3 ביוני 2024 |
pretrained-layout-parser-v1.5-2025-08-25 |
גרסת טרום-השקה (Preview) שמבוססת על מודל שפה גדול (LLM) של Gemini 2.5 Flash, לניתוח טוב יותר של פריסות בקובצי PDF. מומלץ למי שרוצה להתנסות בגרסאות חדשות. | גרסה מועמדת להפצה | 25 באוגוסט 2025 |
pretrained-layout-parser-v1.5-pro-2025-08-25 |
גרסת טרום-השקה שמבוססת על מודל שפה גדול (LLM) של Gemini 2.5 Pro לניתוח טוב יותר של פריסות בקובצי PDF. זמן האחזור בגרסה 1.5-pro גבוה יותר מאשר בגרסה 1.5. | גרסה מועמדת להפצה | 25 באוגוסט 2025 |