דילוג לתוכן
מילה במילה

מקורות ורישיונות

כל המילים באתר מגיעות ממקורות פתוחים. כאן מפורט מאיפה כל דבר, באיזה רישיון, ומה שינינו.

המקורות

ויקימילון העברי

  • רישיון: CC BY-SA 4.0 (וגם GFDL)
  • גרסה: קובץ הגיבוי (dump) מ־1 בספטמבר 2026
  • מה לקחנו: ערכים, כתיב מלא, ניקוד, הגייה עם הטעמה, חלק דיבר, מילים נרדפות וסימוני משלב (כמו "כינוי גנאי").
  • מה שינינו: חילצנו את השדות האלה מקוד הוויקי, איחדנו אותם עם שאר המקורות, סיננו מילים פוגעניות ושמות פרטיים וחישבנו מפתחות חריזה מההגייה.
  • קרדיט: תורמי ויקימילון, המילון החופשי.

ויקימילון האנגלי (הערכים בעברית), דרך kaikki.org

  • רישיון: CC BY-SA 4.0 (וגם GFDL)
  • גרסה: חילוץ מ־20 בספטמבר 2026 (מגיבוי מ־2 בספטמבר 2026)
  • מה לקחנו: ערכים, צורות נטייה (טבלאות נטיית פעלים ושמות) עם ניקוד, תעתיק עם הטעמה וסימונים כמו vulgar ו־derogatory.
  • מה שינינו: לקחנו את הצורות בכתיב מלא עם הניקוד שלהן, השמטנו צורות עם ה׳ הידיעה ומילים שסומנו ככתיב חסר, וחישבנו הגייה מהניקוד.
  • קרדיט: תורמי ויקימילון; החילוץ: Tatu Ylonen, Wiktextract (LREC 2022).

wordfreq 3.1.1

  • רישיון: CC BY-SA 4.0 (הנתונים), Apache 2.0 (הקוד)
  • גרסה: גרסה 3.1.1
  • מה לקחנו: שכיחות המילים בעברית (לסדר התוצאות ולבחירת צורות נטייה שנמצאות בשימוש) ובאנגלית (לבחירת מילים נפוצות לכלי ההגייה).
  • מה שינינו: עיגלנו את השכיחות לערך Zipf ברמת דיוק של עשירית, והשתמשנו בה לסדר ולסינון בלבד.
  • קרדיט: Robyn Speer, wordfreq (2022). הנתונים לעברית מבוססים על ויקיפדיה, OpenSubtitles 2018 (דרך OPUS, מקור: opensubtitles.org), Google Books Ngrams, OSCAR וטוויטר.

CMU Pronouncing Dictionary

  • רישיון: רישיון בסגנון BSD של אוניברסיטת קרנגי מלון
  • גרסה: הגרסה ב־GitHub של cmusphinx, ספטמבר 2026
  • מה לקחנו: הגייה של כ־34 אלף מילים נפוצות באנגלית, בסימני ARPAbet.
  • מה שינינו: בחרנו מילים נפוצות לפי wordfreq וחילקנו לקבצים לפי האות הראשונה. ההמרה לאותיות עבריות נעשית בדפדפן.
  • קרדיט: Copyright (C) 1993-2015 Carnegie Mellon University. All rights reserved. ההודעה המלאה מופיעה בקובץ הרישיון.

הרישיון של הנתונים שלנו

רשימות המילים שבנינו מהמקורות האלה הן יצירה נגזרת, ולכן גם הן מוגשות ברישיון CC BY-SA 4.0. מותר להוריד אותן ולהשתמש בהן, גם מסחרית, בתנאי שמציינים את המקורות שלמעלה ואת מילה במילה, ומשתפים יצירות נגזרות באותו רישיון. בכל קובץ יש שורת רישיון בראשו, ובקבצי ההגייה באנגלית מצורפת גם הודעת זכויות היוצרים של CMU.

  • /data/words/: מילים לפי אורך, מסודרות לפי שכיחות
  • /data/rhyme/: מפתחות חריזה (הגייה) לכל מילה
  • /data/rare/: צורות נטייה נדירות
  • /data/syn/: מילים נרדפות לפי אות ראשונה
  • /data/voc/: ניקוד לתעתיק
  • /data/en/: הגייה באנגלית

הקוד של האתר עצמו אינו חלק מהנתונים ואינו מוגש ברישיון הזה.

כללים ותקנים שמומשו בקוד

את הכללים האלה כתבנו בעצמנו כקוד, על פי המקור. לא העתקנו מהם טקסט או נתונים.

מה השארנו בחוץ ולמה

  • Hspell, המילון החופשי של בודק האיות העברי, מופץ ברישיון AGPL גרסה 3, שחל גם על רשימות המילים שנוצרות ממנו ומחייב לפרסם את קוד המקור של שירות רשת שמשתמש בהן. בחרנו לא להשתמש בו.
  • מילונים מסחריים (כמו מילון אבן־שושן או רב־מילים) מוגנים בזכויות יוצרים, ולא השתמשנו בהם.
  • טקסטים מלאים של כתוביות, ספרים או אתרים. השתמשנו רק בשכיחויות המצרפיות של wordfreq.

סינון

מילים שסומנו בוויקימילון כגסות, כפוגעניות או ככינויי גנאי לא מוצעות בכלים, וכך גם רשימה קצרה שלנו של קללות וכינויי גנאי נפוצים. שמות פרטיים (של אנשים ומקומות) לא נכללים ברשימות המילים, אבל כן משמשים לתעתיק שמות. מצאתם מילה שלא הייתה צריכה להופיע? נשמח לדעת, דרך עמוד הנגישות.

עודכן לאחרונה: 23 בספטמבר 2026