Branify: منصة خدمة عملاء معززة بالذكاء الاصطناعي
منصة خدمة عملاء بالذكاء الاصطناعي تعالج 70% من التذاكر الواردة دون تدخل بشري، ثم توجّه الباقي إلى الوكيل المناسب مع كل السياق مرفقاً.
- Next.js
- Python
- OpenAI
- Pinecone
- +1
دراسة حالة · عميل مؤسسي (سرّي) في قطاع خاضع للتنظيم
كيف استبدلنا فاتورة OpenAI البالغة 4.2 ألف دولار شهرياً بسير عمل LLM يعمل بالكامل على الجهاز باستخدام Ollama وllama.cpp وطبقة تنسيق بـ FastAPI — مع إبقاء 100% من بيانات العملاء على حاسوب المستخدم المحمول وتقديم استجابات في أقل من ثانية.

كان عميل مؤسسي في قطاع خاضع للتنظيم يستخدم LLM مستضافاً عبر أدواته الداخلية، لكن فريق المراجعة الأمنية لديه كان يشير كل ربع سنة إلى العائق نفسه: نصوص تحدد هوية العملاء كانت تُرسل إلى نقطة نهاية سحابية أمريكية. أوقف الفريق القانوني التوسع الأوسع، وتجاوزت فاتورة OpenAI 4,200 دولار شهرياً مع جزء صغير فقط من قاعدة المستخدمين المخططة، وطُرح على فريق المنتج السؤال المستحيل: «هل يمكننا الاحتفاظ بكل قدرات الذكاء الاصطناعي هذه دون أن تغادر أي بيانات حاسوب المستخدم المحمول؟»
لم يكونوا بحاجة إلى مشروع بحثي. كانوا بحاجة إلى سير عمل قابل للتسليم يستطيع موظف داخلي تثبيته في فترة بعد ظهر واحدة، ويعمل بالكامل على أجهزة MacBook بمعالجات M وأجهزة Windows ThinkPad الموجودة لديهم، ويؤدي بما يكفي من الكفاءة بحيث لا يستاء أحد من ترقية الخصوصية.
صممنا وسلّمنا حزمة LLM تعمل بالكامل على الجهاز: Ollama كبيئة تشغيل للنموذج، وllama.cpp تحت الغطاء للاستدلال المكمَّم على GPU/CPU، وطبقة تنسيق صغيرة بـ FastAPI لاستخدام الأدوات والاسترجاع، وواجهة سطح مكتب بـ Next.js مغلّفة عبر غلاف Tauri خفيف. كل بايت من السياق يبقى على الجهاز. لا استدلال عن بُعد ولا استدعاء قياس عن بُعد ولا وسيط.
اختبرنا سبعة نماذج مفتوحة الأوزان (Llama 3.1 8B وQwen 2.5 7B/14B وPhi-3 وMistral ونسختان مضبوطتان لمجالات محددة) على التعليمات الفعلية للعميل، وسلّمنا موجّه نماذج لكل مهمة: نموذج صغير وسريع للتصنيف والدردشة، ونموذج استدلال أكبر عند الطلب. ويعمل RAG على فهرس ChromaDB محلي مبني من مستندات المستخدم نفسه، مع حساب كل التضمينات على الجهاز.
والنتيجة سير عمل أسرع بشكل ملموس من النسخة السحابية في التعليمة المتوسطة (دون رحلة شبكية)، ويجتاز المراجعة الأمنية للعميل من التقديم الأول، ويتوسع إلى كل حاسوب محمول في الشركة بتكلفة استدلال صفرية لكل مقعد.
جمعنا مجموعة ممثلة من نحو 400 تعليمة حقيقية من سجلات OpenAI الحالية (بعد تنقيتها)، ثم قارنّا النماذج المفتوحة الأوزان المرشحة على مزيج الأجهزة الفعلي لدى العميل، وهو أجهزة MacBook من طراز M1 وM2 وM3 إضافة إلى جهاز ThinkPad يعمل بنظام Windows كمرجع، وقسنا عدد الرموز في الثانية، وزمن الاستجابة للرمز الأول عند المئين 95، والجودة مقابل خط GPT-4 المرجعي باستخدام معيار تقييم يملكه العميل.
اخترنا Ollama كبيئة تشغيل (دورة حياة نظيفة، وإدارة إصدارات النماذج، وتكميم يراعي GPU)، ثم بنينا طبقة تنسيق خفيفة بـ FastAPI توجّه كل مهمة إلى النموذج المناسب، وتتولى الاسترجاع من فهرس ChromaDB محلي، وتوفّر واجهة HTTP API مستقرة يستدعيها تطبيق سطح المكتب. ويعمل النظام بأكمله كثلاث عمليات محلية يديرها تطبيق سطح المكتب.
جرت الهندسة في سباقات (sprints) مدتها أسبوعان مع نظام تقييم حقيقي؛ إذ قُيّم كل تغيير على مجموعة مطالبات محجوبة، فظهرت تراجعات الجودة فورًا. وأضفنا تدفق إدخال بنقرة واحدة لمستندات المستخدم الخاصة، وقناة لتحديث النموذج تحترم سياسة الشبكة لدى المستخدم، ولوحة خصوصية تعرض بدقة ما يمكن للنموذج الوصول إليه.
جمّعنا الحزمة في مثبّت موقّع (موثّق على macOS، وموقّع على Windows)، وكتبنا نموذج تهديدات قصيرًا يستطيع فريق الأمن قراءته في 20 دقيقة، وأطلقنا نسخة تجريبية لـ 25 مستخدمًا قبل الإطلاق على مستوى الشركة. اجتازت المراجعة الأمنية من أول تقديم، وكانت الميزة الحاسمة قائمة سماح للشبكة قابلة للتحقق تثبت أن أي حركة LLM لا تغادر الجهاز أبدًا.



“ظننا أن الذكاء الاصطناعي الخاص يعني منتجاً أسوأ. إن ما بناه UnlockLive أسرع من النسخة السحابية في معظم ما يقوم به فريقنا، واستغرقت مراجعتنا الأمنية 20 دقيقة بدلاً من ثلاثة أشهر.”
في معظم مهام المؤسسات، مثل التصنيف والتلخيص وRAG على مستندات المستخدم نفسه والاستخراج المنظم، نعم: نموذج مفتوح الأوزان جيد الاختيار في نطاق 7B إلى 14B يضاهي GPT-3.5 أو يتفوق عليه، ويقترب من GPT-4 بفارق 10 إلى 15% في الجودة. السر في التقييم الصادق: نقيّم النماذج المرشحة دائماً على تعليمات العميل الحقيقية لا على معايير عامة.
نعتمد افتراضياً Llama 3.1 8B للمحادثة العامة وQwen 2.5 14B للمهام التي تتطلب استدلالاً كثيفاً، مع Phi-3 mini للتصنيف فائق السرعة. ويعتمد الاختيار النهائي على أجهزة المستخدم (تتعامل أجهزة Mac من طراز M2/M3 مع 14B بسهولة، بينما تعمل الحواسيب المحمولة الأقدم من Intel بصورة أفضل مع 7B المكمَّم) وعلى مزيج أحمال العمل.
ترخيص Ollama نفسه متساهل، وله دورة حياة مستقرة للنماذج، وتكميم يراعي وحدة GPU، وواجهة HTTP API نظيفة. نقرنه بطبقة تنسيق رقيقة مبنية على FastAPI نملكها، ومثبّت موقّع وموثّق (signed/notarized)، وقائمة سماح شبكية قابلة للتحقق، وقد اجتازت هذه التركيبة عدة مراجعات أمنية للمؤسسات من التقديم الأول.
نسلّم مع النشر أداة تقييم خاصة بكل مستأجر. يُقيَّم كل ترقية للنموذج مقابل مجموعة موجّهات محجوبة يملكها العميل، ولا تُعتمد إلا إذا حققت معيار الجودة. وتُطرح تحديثات النماذج عبر قناة canary يتحكم بها المستخدم.
نقطة التعادل المعتادة تكون بين 6 و9 أشهر. البناء تكلفة هندسية لمرة واحدة (من 8 إلى 14 أسبوعًا لسير عمل مركّز)، ثم تنخفض تكلفة الاستدلال لكل مستخدم إلى الصفر. تتفوق واجهات API المستضافة في الاستخدام المتقطع منخفض الحجم؛ ويتفوق التشغيل على الجهاز في أدوات المؤسسات اليومية النشطة.
تحدّث إلى الفريق نفسه الذي بنى نشر LLM خاص على الجهاز لمؤسسة حساسة للخصوصية (Ollama + llama.cpp). سنحدد نطاق مشروعك، ونقدّم لك عرضًا بسعر ثابت، ونُريك أقرب مثال من أعمالنا.
احجز مكالمة استراتيجية