الشركة الخاضعة للتنظيم التي لا يمكن لمستنداتها أن تغادر محيطها لا تزال تملك ثلاث طرق لتشغيل نموذج لغوي: واجهة API المستضافة لدى المزوّد بموجب ضوابط تعاقدية، أو خدمة النماذج المُدارة على منصتها السحابية، أو نموذج مفتوح الأوزان على بنية تحتية تشغّلها بنفسها. وكل خيار يُلقي على الشركة تكلفة مختلفة: العقود والموافقات، أو السعة في المنطقة المناسبة، أو الخوادم والمناوبة. تبيّن هذه المقالة ما يكلّفه كل خيار في التشغيل وأدلة الامتثال وزمن الاستجابة والكوادر، وأيّ الأسئلة تُظهر ما إذا كانت شركة هندسية قد بنته داخل محيط أحد العملاء.
يصل المتطلب في جملة واحدة: لا يجوز للمستندات أن تغادر المحيط. وقرار البنية المعمارية مختبئ داخلها، لأن المحيط يمكن رسمه في ثلاثة مواضع، وكل موضع يُلقي تكلفة مختلفة على الشركة التي ترسمه.
واجهة API المستضافة لدى مزوّد النموذج تجعل المحيط محكومًا بعقد مع ذلك المزوّد. وخدمة النماذج المُدارة على منصة سحابية تجعله محكومًا بالعقد السحابي. أما النموذج مفتوح الأوزان على خوادم تشغّلها أنت فيُبقيه داخل شبكتك الخاصة، ويُحمّلك كل واجب كان المزوّد سيؤديه عنك لولا ذلك.
الجواب القصير: الاختيار ليس بين الآمن وغير الآمن، بل بين من يتحمّل أي عمل. واجهة API المستضافة لا تحتاج إلى بنية تحتية خاصة بك للبدء، وتربطك بشروط الاحتفاظ لدى المزوّد وحدود المعدل وجدول إيقاف النماذج. وخدمة النماذج المُدارة يمكنها إبقاء الموجّهات بعيدًا عن مطوّر النموذج، في النماذج التي يبيعها مزوّد السحابة ويشغّلها بنفسه، وتجعل المناطق وأنواع النشر والسعة المحجوزة جزءًا من التصميم. أما النموذج مفتوح الأوزان المستضاف ذاتيًا فيُبقي الاستدلال على بنية تحتية تتحكم بها، ويجعل التراخيص وسعة المسرِّعات وأمن التقديم والمناوبة من مسؤوليتك. وما تستطيع amBrain إثباته علنًا عن عملها هي في مجال LLM، بالكامل: أوصلنا تكاملًا مع LLM إلى الإنتاج داخل محيط FinTech لدى أحد العملاء: استخراج إشعارات غير مهيكلة من الوسطاء ومنصات التداول وتطبيعها — إجراءات الشركات، وتغييرات الأدوات المالية والهامش — إلى سجلات مهيكلة يستهلكها نظام التداول. ولا يُذكر اسم العميل، ولا يُفصح عن أيّ الخيارات الواردة أدناه استخدمه ذلك المشروع، وهذه المقالة ليست دراسة حالة له.
عبارة «لا يمكن أن تغادر المحيط» تعني أشياء مختلفة لمسؤول المخاطر ولمسؤول حماية البيانات ولفريق البنية التحتية. وحين تُصاغ في صورة أسئلة، تتحول إلى متطلب يمكن فحص كل خيار على أساسه:
قد تختلف الإجابات باختلاف فئة البيانات. فالإشعار التنظيمي المنشور علنًا أصلًا ووثيقة هوية العميل لا يحتاجان إلى المحيط نفسه، ويستطيع خط المعالجة توجيههما بشكل مختلف.
هنا يحدّد عقد المزوّد ووثائقه المحيط، ولذلك تُقرأ سطرًا سطرًا. تنص وثائق OpenAI بشأن بيانات API على أنه، اعتبارًا من 1 مارس 2023، لا تُستخدم البيانات المرسلة إلى API لتدريب نماذجها أو تحسينها ما لم يختر العميل ذلك صراحةً. وتنص الصفحة نفسها على أن سجلات مراقبة إساءة الاستخدام، التي قد تحتوي على الموجّهات والردود، تُنشأ افتراضيًا ويُحتفظ بها لمدة تصل إلى 30 يومًا، ما لم يكن الاحتفاظ لمدة أطول مطلوبًا بموجب القانون أو ضروريًا بشكل معقول لحماية الخدمة أو أطراف ثالثة من الضرر.
يمكن تضييق كلا الحدّين، وكل تضييق منهما موافقة تُطلب لا إعداد يُضبط:
والنموذج نفسه يخضع أيضًا لجدول المزوّد. فصفحة إيقاف النماذج (deprecations) لدى OpenAI تحدّد حدًا أدنى لمهل الإشعار قبل الإيقاف، ما لم تستدعِ اعتبارات السلامة أو الامتثال جدولًا زمنيًا أسرع: 6 أشهر على الأقل للنموذج المتاح للعموم (generally available)، و3 أشهر على الأقل للنسخ المتخصصة منه، ومهلة أقصر بكثير، مثل أسبوعين، للنماذج التجريبية (preview). وكل إيقاف يعني تقييم النموذج البديل على مستنداتك أنت قبل الموعد، ولذلك فإن الترحيل عمل مخطط متكرر لا حادثة طارئة.
تقدّم المنصات السحابية نماذج من عدة مطوّرين، بعضها بموجب العقد السحابي الذي قد تكون الشركة تملكه أصلًا. وتنص وثائق Microsoft الخاصة بالنماذج التي تبيعها Azure في Microsoft Foundry على أن الموجّهات والإكمالات والتضمينات (embeddings) غير متاحة لـ OpenAI ولا لغيرها من مزوّدي تلك النماذج. غير أن الكتالوج نفسه يضم نماذج لا تبيعها Microsoft: ففي حالة نماذج Claude في Microsoft Foundry، تسمّي وثائقها Anthropic بائعًا ومشغّلًا ومعالجًا مستقلًا للبيانات فيما يتعلق بالموجّهات والمخرجات، وأحد خيارات الاستضافة يعالجها على البنية التحتية لـ Anthropic، وربما خارج منطقة Azure المختارة.
تصف وثائق Amazon Bedrock حسابًا لنشر النماذج لكل مزوّد نماذج في كل منطقة، يملكه ويشغّله فريق خدمة Bedrock، ولا يمكن لمزوّدي النماذج الوصول إليه، فلا يرون موجّهات العملاء ولا الإكمالات الناتجة عنها.
ومع ذلك يظل النموذج يعمل على بنية تحتية يشغّلها مزوّد السحابة، لا في شبكتك الخاصة. فبعض تعريفات المحيط تَعُدّ ذلك داخله؛ وبعضها الآخر لا يَعُدّ داخله إلا الخيار الثالث. وحين يُعدّ كذلك، يتوقف المحيط على خيارات تُتخذ داخل بيئة المستأجر (tenancy)، وتفصّل الوثائق ما يترتب عليها:
بالنسبة إلى كيان مالي في الاتحاد الأوروبي يقع ضمن نطاق DORA، يُعدّ العقد السحابي أصلًا ترتيبًا مع طرف ثالث لخدمات تقنية المعلومات والاتصالات (ICT). وفي 18 نوفمبر 2025 نشرت الهيئات الإشرافية الأوروبية (European Supervisory Authorities) قائمة مزوّدي خدمات ICT الحرجين من الأطراف الثالثة الخاضعين للرقابة على مستوى الاتحاد الأوروبي، وهي تضم Amazon Web Services EMEA وGoogle Cloud EMEA وMicrosoft Ireland Operations. وتشير الهيئة المصرفية الأوروبية (European Banking Authority) إلى أن DORA أصبحت سارية التطبيق في 17 يناير 2025، وأن الكيانات الواقعة ضمن نطاقها ملزمة بالاحتفاظ بسجل لترتيباتها التعاقدية مع مزوّدي خدمات ICT من الأطراف الثالثة. لذلك فإن مزوّد نماذج لم يسبق للكيان التعاقد معه، أو خدمة جديدة بموجب عقد سحابي يملكه أصلًا، مسألةٌ تخص ذلك السجل، لا البنية المعمارية وحدها.
الاستضافة الذاتية، سواء في مقار الشركة أو على أجهزة افتراضية في حسابك السحابي الخاص، تنقل الاستدلال إلى الداخل، ومعه كل واجب كان المزوّد يؤديه. وأول هذه الواجبات قراءة الترخيص، لأن النماذج مفتوحة الأوزان لا تشترك في ترخيص واحد. فـ Mistral Small 3 وQwen3-32B وgpt-oss-120b من OpenAI منشورة على Hugging Face بموجب Apache 2.0. أما Llama 3.3 Community License من Meta، الذي يغطي نموذج Llama 3.3 70B الذي تُحسب متطلباته من العتاد أدناه، فيشترط أن يلتزم الاستخدام بسياسة الاستخدام المقبول الخاصة به. ويشترط أيضًا على المرخَّص له الذي كان لمنتجاته أو خدماته، بما فيها منتجات الشركات التابعة له وخدماتها، أكثر من 700 مليون مستخدم نشط شهريًا في الشهر التقويمي السابق لتاريخ الإصدار، أن يطلب ترخيصًا يجوز لـ Meta منحه وفق تقديرها وحدها.
يتحدد العتاد بعدد المعاملات ودقتها العددية. يضم Llama 3.3 70B Instruct نحو 70.6 مليار معامل؛ وبواقع 16 بت لكل معامل تشغل الأوزان وحدها نحو 141 GB (131 GiB)، وهذا حجم لا يتسع له مسرِّع واحد بسعة 80 GB حتى قبل اقتطاع مساحة لذاكرة key-value المؤقتة الخاصة بالطلبات المتزامنة. وتنص بطاقة نموذج gpt-oss-120b على أن تكميم أوزان mixture-of-experts فيه بصيغة MXFP4 يتيح تشغيل النموذج على GPU واحدة بسعة 80 GB.
تصبح طبقة التقديم حدودك الأمنية. تنص وثائق الأمان في vLLM على أن الاتصال بين عُقد النشر متعدد العُقد غير آمن افتراضيًا ويجب حمايته بوضع العُقد على شبكة معزولة، وعلى أن خيار مفتاح API فيه لا يحمي إلا نقاط النهاية الواقعة تحت بادئات مسارات معيّنة، في حين تبقى نقاط نهاية حساسة أخرى على الخادم نفسه بلا مصادقة. وملف النموذج جزء من سلسلة التوريد أيضًا: تحذّر وثائق Python من أن الوحدة pickle غير آمنة وأن بيانات pickle الخبيثة يمكنها تنفيذ شيفرة عشوائية أثناء فك التسلسل (unpickling)، ولهذا فإن صيغة safetensors، المصمَّمة لتخزين الـ tensors بأمان على خلاف pickle، هي الخيار الأكثر أمانًا للأوزان.
ما تشغّله الشركة الآن بنفسها:
تبقى الالتزامات بموجب GDPR، وبموجب ISO/IEC 27001 حين تكون الشركة حاصلة على شهادته، التزاماتِ الشركة نفسها أيًّا كان الخيار الذي تختاره، حتى حين يعمل مزوّدٌ معالجًا للبيانات لحسابها. وما يتغير هو مصدر الأدلة:
في الخيارات الثلاثة جميعها، تكون الأدلة أقل تكلفة حين يسجّل خط المعالجة أثناء عمله أي عملية نشر وأي منطقة وأي نموذج عالج كل مستند. أما الأدلة نفسها إذا جُمعت لاحقًا من أجل التدقيق، فهي إعادة بناء.
على السعة المشتركة، سقف الإنتاجية سياسةُ طرف آخر. تفرض OpenAI حدود معدل تُقاس بالطلبات والـ tokens في الدقيقة وفي اليوم. وهي تنقل المؤسسة تلقائيًا إلى فئة استخدام أعلى مع نمو إنفاقها، وهو ما يرفع تلك الحدود عادةً، ويمكنها إبطاء الحركة التي تنمو بسرعة مفرطة حتى ضمن تلك الحدود. وتذكر Microsoft أن أنواع النشر ذات السعة المخصصة (provisioned) لديها توفر إنتاجية مضمونة وتباينًا أقل في زمن الاستجابة، في حين تعمل الأنواع القياسية (standard) على أساس أفضل جهد ممكن (best-effort).
السعة المحجوزة تأتي بشروطها الخاصة. يمكن شراء Provisioned Throughput في Amazon Bedrock دون التزام، أو لمدة شهر واحد أو ستة أشهر، ولا يمكن حذفها خلال هذه المدة. وتشير Microsoft إلى أنه لا حصة PTU ولا الحجز يضمنان السعة في منطقة ما، وأن حذف عملية نشر من نوع provisioned أو تقليص حجمها يحرّر سعتها، دون ضمان أن تكون السعة نفسها متاحة لاحقًا. وتوجّه OpenAI عملاء المؤسسات الذين تصطدم حركتهم بانتظام بحدود معدل التصاعد (ramp-rate limits) إلى Scale Tier، أو إلى Reserved Tier لنموذج GPT-5.6 والنماذج اللاحقة، للحصول على سعة أكثر قابلية للتنبؤ.
العمل الذي لا ينتظره أحد لا يحتاج إلى تلك السعة. تعالج Batch API من OpenAI الطلبات غير المتزامنة بتكلفة أقل بنسبة 50% وبمهلة إنجاز مدتها 24 ساعة، وإن كانت صفحة البيانات لدى OpenAI تُدرج نقاط النهاية الخاصة بالدفعات والملفات على أنها غير مؤهلة لـ Zero Data Retention وأنها تحتفظ ببياناتها إلى أن تُحذف. وتُدرج Azure أنواع نشر دفعية بخصم 50%، حيث قد يعالج Global Batch في أي نطاق جغرافي نُشر فيه النموذج، ويوجّه Data Zone Batch الحركة فقط إلى مراكز البيانات الواقعة داخل نطاق البيانات.
على السعة التي تملكها، لا توجد حدود معدل خارجية ولا طابور مشترك، والسقف هو العتاد الذي اشتريته أو حجزته. وفي كل خيار يهمّ طول المخرجات: يصف دليل زمن الاستجابة من OpenAI توليد الـ tokens بأنه يكاد يكون دائمًا الخطوة الأعلى في زمن الاستجابة، ويذكر، كقاعدة تقريبية عامة، أن خفض tokens المخرجات بنسبة 50% قد يخفض زمن الاستجابة بنحو 50%. ولذلك فإن مطالبة النموذج بسجلات مهيكلة موجزة بدل النص الحر تفيد في الخيارات الثلاثة جميعها.
تختلف الخيارات في قائمة الأعمال التي تبقى داخل الشركة:
قد يعمل المشروع التجريبي أشهرًا دون مناوبة؛ أما الإنتاج فلا. وتسعير خيار الاستضافة الذاتية دون حساب الأشخاص الذين يشغّلونه يقارن تكلفة نموذج بسعر خدمة.
الخيارات ليست متنافية. يستطيع خط المعالجة إرسال المستندات العامة إلى نموذج مستضاف والإبقاء على الفئات المقيَّدة لدى نموذج مستضاف ذاتيًا. غير أن ذلك لا يصمد إلا حين يُفرض التوجيه في الشيفرة ويترك أدلة:
المحيط المغلق لا يختار النموذج نيابةً عنك. بل يختار أيّ عمل يبقى على عاتقك: قراءة العقود وانتظار الموافقات، أو حجز السعة في المنطقة المناسبة، أو تشغيل الخوادم والاستيقاظ ليلًا على تنبيهاتها.
السؤال الذي تقوم عليه هذه المقالة هو: أي شركات الهندسة تبني معالجة المستندات والتذاكر بواسطة LLM داخل محيط العميل نفسه، في مقاره أو في سحابة خاصة. وما يميّز هذه الشركات بعضها عن بعض يظهر فيما تسأل عنه قبل أن تقترح نموذجًا:
الشركة التي توصي بنموذج قبل أن تطرح هذه الأسئلة تكون قد اختارت محيطك دون أن تصرّح بذلك.
يتلخص قرار النشر في أي عمل تكون شركتك مستعدة لتحمّله لكل فئة من المستندات: العقود والموافقات، أو السعة في منطقة ما، أو الخوادم والمناوبة.
ما تستطيع amBrain إثباته علنًا فضلًا عن التكامل العامل في الإنتاج الموصوف في الملخص أعلاه: تبني amBrain البرمجيات منذ 2019. ونعمل بثلاث صيغ: تسليم كامل، أو فريق مخصص، أو مهندسون مدمجون في فريقك.
أحضر بنيتك الحالية وسيناريو الفشل الذي يقلقك، وسنراجعه معًا خلال نصف ساعة.