סינתזת דיבור באמצעות סטרימינג דו-כיווני
במאמר הזה מוסבר איך לבצע סינתזה של אודיו באמצעות סטרימינג דו-כיווני.
הזרמה דו-כיוונית מאפשרת לשלוח קלט טקסט ולקבל נתוני אודיו בו-זמנית. המשמעות היא שאפשר להתחיל בסינתזה של הדיבור לפני שכל טקסט הקלט נשלח, וכך לצמצם את זמן האחזור ולאפשר אינטראקציות בזמן אמת. עוזרים קוליים ומשחקים אינטראקטיביים משתמשים בהזרמה דו-כיוונית כדי ליצור אפליקציות דינמיות ומגיבות יותר.
מידע נוסף על מושגי היסוד ב-Cloud Text-to-Speech זמין במאמר מושגי יסוד ב-Cloud Text-to-Speech.
לפני שמתחילים
לפני ששולחים בקשה אל Cloud Text-to-Speech API, צריך לבצע את הפעולות הבאות.
- נכנסים לחשבון Google Cloud . אם אתם משתמשים חדשים ב- Google Cloud, צרו חשבון כדי שתוכלו להעריך את הביצועים של המוצרים שלנו בתרחישים מהעולם האמיתי. לקוחות חדשים מקבלים בחינם גם קרדיט בשווי 300$ להרצה, לבדיקה ולפריסה של עומסי העבודה.
-
התקינו את ה-CLI של Google Cloud.
-
אם אתם משתמשים בספק זהויות חיצוני (IdP), קודם אתם צריכים להיכנס ל-CLI של gcloud באמצעות המאגר המאוחד לניהול זהויות.
-
כדי לאתחל את ה-CLI של gcloud, הריצו את הפקודה הבאה:
gcloud init -
יוצרים או בוחרים Google Cloud פרויקט.
תפקידים שנדרשים כדי לבחור או ליצור פרויקט
- Select a project: כדי לבחור פרויקט לא צריך תפקיד IAM ספציפי – אפשר לבחור כל פרויקט שקיבלתם בו תפקיד.
-
יצירת פרויקט: כדי ליצור פרויקט, צריך את התפקיד Project Creator (יצירת פרויקטים) (
roles/resourcemanager.projectCreator), שכולל את ההרשאהresourcemanager.projects.create. איך מקצים תפקידים
-
יוצרים Google Cloud פרויקט:
gcloud projects create PROJECT_ID
מחליפים את
PROJECT_IDבשם של פרויקט Google Cloud שיוצרים. -
בוחרים את הפרויקט שיצרתם: Google Cloud
gcloud config set project PROJECT_ID
מחליפים את
PROJECT_IDבשם הפרויקט ב- Google Cloud .
מפעילים את Cloud Text-to-Speech API:
תפקידים שנדרשים להפעלת ממשקי API
כדי להפעיל ממשקי API, נדרשת ההרשאה
serviceusage.services.enable. אם יצרתם את הפרויקט, סביר להניח שכבר יש לכם את ההרשאה הזו דרך התפקיד 'בעלים' (roles/owner). אחרת, תוכלו לקבל את ההרשאה הזו דרך התפקיד 'אדמין של Service Usage' (roles/serviceusage.serviceUsageAdmin). איך מקצים תפקידיםgcloud services enable texttospeech.googleapis.com
-
התקינו את ה-CLI של Google Cloud.
-
אם אתם משתמשים בספק זהויות חיצוני (IdP), קודם אתם צריכים להיכנס ל-CLI של gcloud באמצעות המאגר המאוחד לניהול זהויות.
-
כדי לאתחל את ה-CLI של gcloud, הריצו את הפקודה הבאה:
gcloud init -
יוצרים או בוחרים Google Cloud פרויקט.
תפקידים שנדרשים כדי לבחור או ליצור פרויקט
- Select a project: כדי לבחור פרויקט לא צריך תפקיד IAM ספציפי – אפשר לבחור כל פרויקט שקיבלתם בו תפקיד.
-
יצירת פרויקט: כדי ליצור פרויקט, צריך את התפקיד Project Creator (יצירת פרויקטים) (
roles/resourcemanager.projectCreator), שכולל את ההרשאהresourcemanager.projects.create. איך מקצים תפקידים
-
יוצרים Google Cloud פרויקט:
gcloud projects create PROJECT_ID
מחליפים את
PROJECT_IDבשם של פרויקט Google Cloud שיוצרים. -
בוחרים את הפרויקט שיצרתם: Google Cloud
gcloud config set project PROJECT_ID
מחליפים את
PROJECT_IDבשם הפרויקט ב- Google Cloud .
מפעילים את Cloud Text-to-Speech API:
תפקידים שנדרשים להפעלת ממשקי API
כדי להפעיל ממשקי API, נדרשת ההרשאה
serviceusage.services.enable. אם יצרתם את הפרויקט, סביר להניח שכבר יש לכם את ההרשאה הזו דרך התפקיד 'בעלים' (roles/owner). אחרת, תוכלו לקבל את ההרשאה הזו דרך התפקיד 'אדמין של Service Usage' (roles/serviceusage.serviceUsageAdmin). איך מקצים תפקידיםgcloud services enable texttospeech.googleapis.com
סינתזת דיבור באמצעות סטרימינג דו-כיווני
התקנת ספריית הלקוח
Python
לפני שמתקינים את הספרייה, צריך לוודא שהכנתם את הסביבה לפיתוח בשפת Python.
pip install --upgrade google-cloud-texttospeech
שליחת זרם של טקסט וקבלת זרם של אודיו
ה-API מקבל זרם של בקשות מהסוג StreamingSynthesizeRequest, שמכילות את StreamingSynthesisInput או את StreamingSynthesizeConfig.
לפני ששולחים זרם StreamingSynthesizeRequest עם StreamingSynthesisInput, שמאפשר הזנת טקסט, צריך לשלוח בדיוק StreamingSynthesizeRequest אחד עם StreamingSynthesizeConfig.
הסטרימינג של Cloud Text-to-Speech תואם רק ל-Chirp 3: HD voices.
Python
לפני שמריצים את הדוגמה, חשוב לוודא שהכנתם את הסביבה לפיתוח בשפת Python.
הסרת המשאבים
כדי להימנע מחיובים מיותרים ב-Google Cloud Platform, אפשר להשתמש באפשרותGoogle Cloud console למחיקת הפרויקט אם הוא לא נחוץ.
המאמרים הבאים
- מידע נוסף על Cloud Text-to-Speech זמין במאמר מושגי יסוד.
- אפשר לעיין ברשימה של הקולות הזמינים לדיבור מסונתז.