תגלית נחמדה - data deduplication in Copy, the cloud storage
קצת רקע
data deduplication זה מנגנון שמאפשר לשירותי ענן לחסוך עלויות של איחסון וגם של תעבורת רשת.
דוגמה: משתמש ראשון מעלה את הפרק האחרון של Game of Thrones לענן, זה לוקח לו הרבה זמן, אבל בסוף הכל בסדר והשרת מסמן שהקובץ נמצא בחשבון שלו. אם יש לו מחשב נוסף על אותו חשבון, אז באותו הרגע המחשב השני מתחיל להוריד את הקובץ. המשתמש השני (אין לו שום קשר לראשון - חוץ מזה ששניהם משתמשים באותו שירות ענן) מוריד את הקובץ בטורנט ומעלה אותו לשירות ענן. הקליינט של המשתמש השני לא באמת מתחיל להעלות את הקובץ, הוא מריץ עליו פונקציית hash ושולח את התוצאה לשרת, אם השרת מזהה שהקובץ כבר קיים, אז הקליינט לא מעלה שום דבר ומיד מסמן שהקובץ נמצא בחשבון של המשתמש. אם למשתמש השני יש מחשב נוסף על אותו חשבון, באותו הרגע בדיוק הקובץ יתחיל לרדת במחשב הנוסף.
אם חושבים קצת על המנגון אפשר להבין שכל מה שצריך בשביל להוריד קבצים שכבר נמצאים בענן, זה תוצאת הhash של הקבצים. העניין הוא שהקליינט ממש לא תומך בזה. יותר מזה, המנגנון מוסתר ממש טוב, כדי שיוזרים לא יעשו את זה.
אם זה היה קל ופשוט, יכולנו לפתוח פורום הורדות שהיה מכיל תוצאות hash של כל מיני קבצים. משתמש אחד היה מוריד סרט בטורנט, הוא היה מחשב את התוצאה של הפונקציה בעזרת המידע הממשי שהוא הוריד, ואז הוא היה כותב פוסט עם המספר בשביל שכולם יורידו את הקובץ עם שירות הענן.
מסתבר שכל זה כבר נעשה מול דרופבוקס, וזאת הסיבה שדרופבוקס כיבו את הglobal deduplication. הם השאירו גרסה פרטית של המנגון, למנוע כפילויות בין קבצים של משתמש בודד.
חשוב לציין שמניעה של global deduplication מיוזרים לא אומרת שהשירות לא עושה את זה בצורה מוסתרת בשביל לחסוך מקום.
ועכשיו, לתגלית הנחמדה. מסתבר שבשירות הענן Copy הglobal data deduplication חי וקיים.
תנסו את זה, תעלו לחשבון שלכם סרט מהוצאה רשמית (משהו נפוץ, כמו פרק אחרון של משהו שכולם רואים) ותראו שהוא לא באמת מעלה שום דבר לענן. רק לוקח לו קצת זמן לסרוק את הקובץ בשביל החישוב של הhash.
גם בלי לעשות את הקומבינה שמוזכרת למעלה (פורום של hashים), הפונקציונליות הזאת נחמדה מאוד. אפשר להעביר קבצים מאוד גדולים לחברים (כל עוד מישהו העלה אותם כבר), בלי להעלות שום דבר. שהרי ידוע שמהירות ההעלאה שלנו בארץ על הפנים.
למי שעדיין אין Copy, מוזמנים ללחוץ על הלינק שלי
https://copy.com?r=3U83nI
data deduplication זה מנגנון שמאפשר לשירותי ענן לחסוך עלויות של איחסון וגם של תעבורת רשת.
דוגמה: משתמש ראשון מעלה את הפרק האחרון של Game of Thrones לענן, זה לוקח לו הרבה זמן, אבל בסוף הכל בסדר והשרת מסמן שהקובץ נמצא בחשבון שלו. אם יש לו מחשב נוסף על אותו חשבון, אז באותו הרגע המחשב השני מתחיל להוריד את הקובץ. המשתמש השני (אין לו שום קשר לראשון - חוץ מזה ששניהם משתמשים באותו שירות ענן) מוריד את הקובץ בטורנט ומעלה אותו לשירות ענן. הקליינט של המשתמש השני לא באמת מתחיל להעלות את הקובץ, הוא מריץ עליו פונקציית hash ושולח את התוצאה לשרת, אם השרת מזהה שהקובץ כבר קיים, אז הקליינט לא מעלה שום דבר ומיד מסמן שהקובץ נמצא בחשבון של המשתמש. אם למשתמש השני יש מחשב נוסף על אותו חשבון, באותו הרגע בדיוק הקובץ יתחיל לרדת במחשב הנוסף.
אם חושבים קצת על המנגון אפשר להבין שכל מה שצריך בשביל להוריד קבצים שכבר נמצאים בענן, זה תוצאת הhash של הקבצים. העניין הוא שהקליינט ממש לא תומך בזה. יותר מזה, המנגנון מוסתר ממש טוב, כדי שיוזרים לא יעשו את זה.
אם זה היה קל ופשוט, יכולנו לפתוח פורום הורדות שהיה מכיל תוצאות hash של כל מיני קבצים. משתמש אחד היה מוריד סרט בטורנט, הוא היה מחשב את התוצאה של הפונקציה בעזרת המידע הממשי שהוא הוריד, ואז הוא היה כותב פוסט עם המספר בשביל שכולם יורידו את הקובץ עם שירות הענן.
מסתבר שכל זה כבר נעשה מול דרופבוקס, וזאת הסיבה שדרופבוקס כיבו את הglobal deduplication. הם השאירו גרסה פרטית של המנגון, למנוע כפילויות בין קבצים של משתמש בודד.
חשוב לציין שמניעה של global deduplication מיוזרים לא אומרת שהשירות לא עושה את זה בצורה מוסתרת בשביל לחסוך מקום.
ועכשיו, לתגלית הנחמדה. מסתבר שבשירות הענן Copy הglobal data deduplication חי וקיים.
תנסו את זה, תעלו לחשבון שלכם סרט מהוצאה רשמית (משהו נפוץ, כמו פרק אחרון של משהו שכולם רואים) ותראו שהוא לא באמת מעלה שום דבר לענן. רק לוקח לו קצת זמן לסרוק את הקובץ בשביל החישוב של הhash.
גם בלי לעשות את הקומבינה שמוזכרת למעלה (פורום של hashים), הפונקציונליות הזאת נחמדה מאוד. אפשר להעביר קבצים מאוד גדולים לחברים (כל עוד מישהו העלה אותם כבר), בלי להעלות שום דבר. שהרי ידוע שמהירות ההעלאה שלנו בארץ על הפנים.
למי שעדיין אין Copy, מוזמנים ללחוץ על הלינק שלי
https://copy.com?r=3U83nI
נערך לאחרונה על ידי mokalan ב 25/05/2013 1:12, נערך פעם 1 בסך הכל.
- vivi
- חבר מביא חבר

- תגובות: 3546
- הצטרף: ינואר 2009
- מיקום: מודיעין
- נתן תודות: 1108 פעמים
- קיבל תודות: 504 פעמים
יפה מאוד ומעניין מאוד. בעצם אתה אומר שכשמישהו מעלה קובץ נפוץ אז התוכנה של COPY סורקת את הכוננים שלה ובמידה והקובץ קיים אז זה יחסוך את כל זמן העלאה?
Pixel 4 XL | PS4 | NU8000 | Denon X3000 | Chromecast | Spotify | Partner Fiber | Netflix | FC Barcelona | Google Apps |
- deleteduser1
-
- חבר ותיק

- תגובות: 1253
- הצטרף: נובמבר 2004
- שם מלא: רוצה שתמחקו אותי
- נתן תודות: 172 פעמים
- קיבל תודות: 181 פעמים
זה בהחלט נחמד. אני מצאתי את עצמי מעלה את כל ספרית הMP3 שלי לשירות. איזה 11 ג'יגה. ולא הבנתי איך יכול להיות שפתאום הקצב הוא כזה מהיר.
אתה חייב להשתמש בקליינט שמותקן על המחשב, רק ככה יש לו גישה לכל הקובץ. כשאתה משתמש באתר, אין לך ברירה אלא להעלות את כל הקובץ, בשביל לחשב את הhash.Mad-Dog כתב:חייב חשבון?
כי נכנסתי לאתר COPY, וגם שם יש אפשרות ל UPLOAD
ניסיתי לזרוק כל מיני דברים פופולארים, ואני רואה שהוא מתחיל UPLOAD סטנדרטי במהירות רגילה,...

