نشرة الذكاء الاصطناعي الأسبوعية – تقرير AI
الإصدار 70
مرحبًا بكم!
أطرح بين أيديكم اليوم تحليلاً أكاديمياً وموضوعياً للبنية التقنية لمنظومة الذكاء الاصطناعي "جيميني." تاريخياً، لم ينبثق هذا النموذج فجأة، بل هو امتداد لتراكم بحثي طويل في مختبرات "جوجل" حول الشبكات العصبية العميقة والنماذج اللغوية الكبيرة. واليوم، نعمل على النسخة المتقدمة "جيميني 3.1 برو" (Gemini 3.1 Pro) المصممة للويب، والتي تمثل تحولاً إبستمولوجياً في معالجة البيانات، حيث تتجاوز مجرد توليد النصوص إلى فهم السياقات المعقدة ضمن بيئة تفاعلية ممتدة، مما يجعلها أداة بحثية وتحليلية بالغة الدقة.
وفي سياق التفاعل المباشر بين الإنسان والآلة، تقدم المنظومة نمط "جيميني لايف" (Gemini Live) المتاح للتطبيقات المحمولة. يمثل هذا النمط تطوراً ملحوظاً في واجهات الاستخدام، إذ يسمح بحوار صوتي طبيعي في الوقت الفعلي، مع إمكانية مقاطعة الآلة وتوجيه سير النقاش بحرية. علاوة على ذلك، يمتلك النظام إدراكاً سياقياً عبر مشاركة شاشة الهاتف أو الكاميرا، مما يتيح له تحليل المحيط البصري أو التطبيقات المفتوحة، وتقديم إجابات أو ترجمات فورية مبنية على ما يتم رصده آنياً.
أما على صعيد التوليد البصري، فتعتمد المنظومة على معمارية "نانو بنانا 2" (Nano Banana 2)، والمعروفة رسمياً باسم "جيميني 3 فلاش للصور" (Gemini 3 Flash Image). يُعنى هذا النموذج بترجمة النصوص إلى صور مرئية، وتعديلها، ودمجها بأساليب فنية. ومن منظور هيكلي، يخضع استخدام هذه الأداة لنظام حصص محددة تتراوح بين 20 إلى 1000 استخدام يومي بناءً على فئة الاشتراك، لتنظيم استهلاك الموارد الحوسبية، مع توفر خيار الترقية لمعالجة فائقة التطور للفئات العليا.
وفيما يخص معالجة وتوليد المشاهد المتحركة، يُعد نموذج "فيو" (Veo) المحرك الأساسي لهذه الوظيفة. يتميز هذا النموذج بقدرته على إنتاج مقاطع فيديو عالية الدقة مصحوبة بصوتيات مولدة داخلياً لتتزامن مع الحدث. وتتنوع آلياته لتشمل تحويل النصوص إلى فيديو، وبناء لقطات انسيابية بين إطارين زمنيّين محددين، واستخدام صور مرجعية لتوجيه المحتوى، مع خضوع هذه العملية لقيود مبرمجة لضمان استبعاد المواد غير الآمنة والالتزام بمعايير النشر.
وتكتمل هذه البنية متعددة الوسائط بنموذج "ليريا 3" (Lyria 3) المخصص للتوليد الصوتي والموسيقي. يتسم هذا النموذج بقدرته على تحويل مدخلات نصية أو بصرية إلى مقاطع احترافية مدتها 30 ثانية، مع منح المستخدم تحكماً دقيقاً في الإيقاع، والنوع الفني، وصياغة الكلمات، وحتى الأداء الصوتي البشري بلغات متعددة. ولضمان الشفافية التقنية، تُدمج جميع المخرجات الصوتية بعلامات مائية رقمية (SynthID) لتمييزها كأعمال مولدة آلياً. إن دراسة هذه الأدوات الهيكلية مجتمعة تقدم لنا مقاربة نقدية هامة لفهم إمكانيات الذكاء الاصطناعي الحالي في معالجة مختلف أشكال البيانات.
.
-------------------------------------------------------------------------------------------
· نحاول بناء نشرة إخبارية مميزة، ونتطلع لدعمكم ليكبر جمهورنا الكريم! وندعوكم لنشر رابط الموقع لأصدقائكم ومعارفكم.
· هل أحببتم ما قرأتم؟ ما هي الموضوعات التي تتطلعون لمعرفة المزيد عنها في مجال الذكاء الاصطناعي، تواصلوا معنا عبر [email protected]
هذه النشرة تصدر عن موقع www.taqreerai.com الذي تشتركون فيه. لإلغاء الاشتراك، فضلاً التواصل معنا.
يحيى الفريح وأحمد صفا
0 comments