Enterprise-KI On-Premises: Der neue Open Code Software-Stack von Scality ermöglicht es Unternehmen, validierte Open Weight KI-Modelle auf ihrer eigenen Infrastruktur auszuführen, mit planbaren Kosten sowie voller Kontrolle über Modelle und Datensouve
München, Deutschland, 08. Oktober 2026: Scality, ein weltweit führender Anbieter von Dateninfrastruktur-Software für KI-Storage im großen Maßstab, gibt heute die Verfügbarkeit der Scality AI Inference Factory bekannt. Dabei handelt es sich um einen Open Code Software-Stack für die Bereitstellung und den Betrieb von KI-Inferenz auf der eigenen Infrastruktur. Die Lösung bietet Unternehmen, Behörden und Neo-Cloud Anbietern eine unterstützte Alternative zu Cloud-basierten KI-Diensten, ohne dass sie dabei den gesamten Software-Stack eigenständig zusammenstellen, integrieren und warten müssen.
Während KI zunehmend von der Experimentierphase in den produktiven Einsatz übergeht, stehen Unternehmen vor der Herausforderung, Kosten besser planbar zu machen, mehr Kontrolle über den gesamten Lebenszyklus ihrer Modelle zu gewinnen und ihre Datensouveränität zu stärken. Für viele Organisationen wird die Lösung in einer hybriden Architektur liegen, in der besonders kritische KI-Prozesse On-Premises ausgeführt werden. Lokale Inferenz ermöglicht es, diese Anforderungen miteinander zu verbinden und zugleich sicherzustellen, dass sensible Daten innerhalb der vom Unternehmen selbst kontrollierten Infrastruktur verbleiben.
Die Scality AI Inference Factory vereint validierte Open-Weight Modelle, eine disaggregierte Inference-Serving Schicht, eine Control Plane für Authentifizierung, Abrechnung, Routing und Scheduling sowie die Scality AI Data Infrastructure (ADI). Diese ermöglicht die richtliniengesteuerte, autonome Verwaltung umfangreicher Datensätze über den gesamten KI-Lebenszyklus hinweg. Scality validiert, liefert und wartet den vollständig integrierten Stack.
„Mit dem Einzug von KI in geschäftskritische Produktionsumgebungen benötigen Unternehmen mehr Kontrolle darüber, wo Inferenz ausgeführt wird, wie ihre Modelle verwaltet werden und was mit ihren Daten geschieht“, so Jérôme Lecat, CEO, Scality. „Seit 15 Jahren entwickelt Scality Dateninfrastrukturen, auf die sich Tausende von Kunden weltweit rund um die Uhr verlassen. Mit der AI Inference Factory übertragen wir diese Erfahrung auf On-Premises KI und geben Unternehmen die Zuverlässigkeit und Souveränität, die sie benötigen, um kritische KI-Workloads nach ihren individuellen Anforderungen zu betreiben.“
Herausforderungen der Cloud-KI treiben Interesse an On-Premises Inferenz
Unternehmen, die KI für den produktiven Einsatz skalieren, sehen sich zunehmend mit den Herausforderungen Cloud-basierter Inferenz-Modelle konfrontiert. Bei einer Abrechnung pro Token steigen die Kosten mit der Nutzung von KI-Workflows. Dadurch entstehen Ausgaben, die schwer vorhersehbar und nach oben nicht begrenzt sind. Zudem können Anbieter Modellversionen und Quantisierung nach eigenem Ermessen ändern, was sich auf darauf aufbauende Workflows auswirken kann.
Für Unternehmen, die mit sensiblen oder regulierten Daten arbeiten, stellt sich darüber hinaus die Frage der Datensouveränität: Wo werden Prompts, Dokumente und proprietärer Code verarbeitet? Welcher Rechtsordnung unterliegen die Daten? Und wer hat die Möglichkeit, den Zugriff darauf zu kontrollieren oder einzuschränken?
Die Scality AI Inference Factory richtet sich an Organisationen, die kritische KI-Workloads auf einer von ihnen kontrollierten Infrastruktur ausführen und gleichzeitig flexibel bei Modellen, Hardware und Software bleiben möchten. Der Stack unterstützt spezialisierte Chatbots, KI-gestützte Softwareentwicklung, agentische Anwendungen sowie weitere,Inferenz-intensive Workloads.
Die Scality AI Inference Factory kombiniert:
-validierte Open-Weight Modelle, die als Bestandteil des unterstützten Stacks gepflegt werden
-disaggregiertes Inference Serving, bei dem Prefill und Decode getrennt werden, sodass beide Prozesse unabhängig voneinander skaliert werden können
-eine Control Plane, die Anfragen authentifiziert und abrechnet, sie mit dem relevanten Kontext an geeignete GPUs routet und Workloads entsprechend definierter SLA-Ziele plant
-Scality ADI, das hochperformanten Objektspeicher für Modelle, Unternehmensdaten sowie den Inferenz-Zustand bereitstellt
Scality validiert und wartet den vollständigen Stack als integrierte, unterstützte Lösung. So können Unternehmen mit der dynamischen Entwicklung von Modellen, Serving-Technologien und Sicherheitsanforderungen Schritt halten, ohne dabei die einzelnen Komponenten selbst integrieren und warten zu müssen.
„Mit zunehmender Verbreitung von KI und KI-Agenten prüfen Unternehmen, welche IT-Umgebungen sich am besten für die Ausführung von Inferenz eignen. On-Premises Bereitstellungen rücken dabei aus verschiedenen Gründen in den Fokus, darunter Kostenoptimierung, Datensicherheit und Datenschutz sowie regulatorische Anforderungen. Untersuchungen von IDC zeigen, dass die Ausführung von Inferenz On-Premises für eine wachsende Zahl von Enterprise- und Public-Sector Workloads eine praktikable Option darstellt. Voraussetzung ist eine Infrastruktur, die den Modellzustand effizient und in großem Maßstab speichern und bereitstellen kann. Scality gehört zu den Anbietern, die diese Anforderungen sowohl auf der Inferenz- als auch auf der Storage-Ebene adressieren.“
— Nataliya Yezhkova, Vice President, Storage and Data Management, Enterprise Infrastructure, IDC
Scality ADI erweitert KI-Inferenz über die Grenzen des GPU-Speichers hinaus
Scality ADI fungiert als gemeinsam genutzte Speicherschicht der AI Inference Factory und erweitert den Key-Value (KV)-Cache über den begrenzten High-Bandwidth Memory (HBM) der GPUs hinaus. Dadurch kann die Inferenz-Infrastruktur Modellkontext speichern und bei Bedarf wieder abrufen, anstatt ihn auf den GPUs erneut berechnen zu müssen. Das verbessert die GPU-Auslastung und trägt dazu bei, die Kosten für die Inferenz zu senken.
Das ist insbesondere für Reasoning-Modelle und agentische Workloads relevant, bei denen der KV-Cache den verfügbaren GPU-Speicher schnell überschreiten kann. Scality ADI stellt einen gemeinsam genutzten Cache im Multi-Petabyte Maßstab bereit, auf den GPUs mit einer Latenz in derselben Größenordnung wie beim GPU-Speicher zugreifen können. Dadurch können sie vorhandenen Kontext abrufen und sich auf die Inferenz konzentrieren.
Tests von Scality haben gezeigt, dass ADI den GPU-Verbrauch reduzieren kann, ohne dabei das Leistungsniveau zu beeinträchtigen:
-1,9 Sekunden Ladezeit für Gemma-3 27B nahezu zehnmal schneller als lokales NVMe. Das Modell wird dabei parallel über den gesamten Cluster per RDMA gestreamt
-166 ms Warm Time-to-First Token bei der Wiederherstellung eines 14K-Token-Kontexts aus ADI, lediglich 83 ms hinter HBM
-14-mal schnellerer Abruf des KV-Caches gegenüber einer Neuberechnung bei einem 14K-Token-Kontext und bis zu 72-mal schneller bei einem 439K-Token-Kontext
-Ein nahezu 80-mal größerer KV-Cache als der Speicher einer einzelnen GPU ermöglicht es, bis zu 1.000 parallel laufende Sitzungen ohne erneute Berechnung nahtlos fortzusetzen
-keine messbaren Auswirkungen auf die Token-Generierung, da der Kontext vor der Ausgabe des ersten Tokens wiederhergestellt wird
-97 % der Netzwerkbandbreite bei der Datenübertragung zwischen GPUs und Storage
Die Architektur trennt Prefill und Decode, wobei ADI als gemeinsam genutzter Cache zwischen den GPU-Pools fungiert. Dadurch können verfügbare Decode-GPUs auf vorhandenen Kontext zugreifen, ohne dass dieser an einen bestimmten GPU-Server gebunden ist.
Die Trennung von Prefill und Decode bietet nachweisbare Vorteile: DistServe (OSDI 2024) erzielte bis zu 7,4-mal mehr bediente Anfragen innerhalb derselben Latenzziele. Mit einem darüberliegenden, gemeinsamen KV-Cache Pool meldete Moonshot AI mit Mooncake 75 Prozent mehr Anfragen bei Kimi-Produktionsverkehr.
Wie Giorgio Regni, CTO, Scality, erklärt: „Der KV-Cache auf Scality ADI ist schnell genug, um Teil des Serving-Pfads zu sein. Die Wiederherstellung eines Kontexts aus ADI liegt in derselben Größenordnung wie der Zugriff auf GPU-Speicher und ist 14-mal schneller als eine Neuberechnung, während die GPUs durchgehend ausgelastet bleiben. Storage ist damit kein Grund mehr, den KV-Cache innerhalb des GPU-Servers zu halten.“
Regni weiter: „Das eröffnet den Weg für disaggregiertes Serving. Ein GPU-Pool übernimmt das Prefill, verarbeitet den Prompt und schreibt den KV-Cache in ADI. Ein zweiter Pool übernimmt das Decode, liest den Cache zurück und generiert Tokens. Mit Scality ADI als gemeinsam genutztem Cache kann jede Decode-GPU jeden Kontext übernehmen, grundsätzlich ohne Größenlimit. Prefill unterbricht Decode nicht mehr, und beide Pools können unter Volllast laufen.“
Eine technische Detailanalyse der Architektur sowie Testergebnisse der AI Inference Factory sind im begleitenden Blogbeitrag von Scality verfügbar.
Offene Architektur schafft Flexibilität bei Modellen, Frameworks und Hardware
Die Scality AI Inference Factory ist darauf ausgelegt, Unternehmen über den gesamten KI-Infrastruktur Stack hinweg größtmögliche Wahlfreiheit zu bieten. Sie ist mit Open-Source Harnesses sowie agentischen Frameworks wie OpenCode, Hermes, Goose, LangGraph und Pydantic AI kompatibel und unterstützt validierte Open-Weight Modelle von Mistral, Gemma, gpt-oss, Qwen, Kimi, GLM und DeepSeek. Die Software kann auf Standard-Servern von Dell, HPE, Lenovo und Supermicro bereitgestellt werden.
Jede von Scality ausgelieferte Softwarekomponente wird als Open Code bereitgestellt. Kunden können dadurch nachvollziehen, wie Inferenz-Zustände gespeichert und übertragen werden, und Beiträge zur Prüfung durch Scality einreichen. Für Unternehmen mit sensiblen, regulierten oder souveränen KI-Workloads schafft dies Transparenz über die Software, die ihre Modelle und Daten verarbeitet, anstatt sie auf einen geschlossenen, externen Dienst angewiesen zu machen.
Scality ADI lässt sich in standardisierte KI-Stacks integrieren und im Multi-Petabyte Maßstab auf NVMe bereitstellen. Über RDMA besteht zudem Zugriff auf HDD, wodurch praktisch unbegrenzte Kapazitäten für den KV-Cache möglich werden. Ein einziger Namespace verteilt Daten automatisch über TLC, HDD sowie optional Tape. So können Unternehmen Performance und Wirtschaftlichkeit des Speichers an die unterschiedlichen Phasen des KI-Datenlebenszyklus anpassen.
Verfügbarkeit
Die Scality AI Inference Factory ist ab sofort als Softwarelizenz oder als vollständig gemanagter Service verfügbar. Scality demonstriert die Lösung und ihre Referenzarchitektur am 8. Oktober in Paris beim Scality Day.
Scality adressiert zentrale Herausforderungen moderner Datenspeicherung: Wachstum, Sicherheit, Performance und Kosten. Entwickelt für durchgängige Cyber-Resilienz bietet der S3-Objektspeicher von Scality mit CORE5 einen ganzheitlichen Schutz auf allen Ebenen des Systems, von der API bis zur Architektur. Die patentierte MultiScale Architektur ermöglicht eine nahezu unbegrenzte, unabhängige Skalierung in sämtlichen kritischen Dimensionen, um den dynamischen Anforderungen moderner Workloads gerecht zu werden. Führende Unternehmen weltweit vertrauen auf Scality, um leistungsstarke KI-Initiativen zu beschleunigen, Cloud-Deployments zu optimieren und ihre Daten zuverlässig zu schützen. Als „Leader“ von Gartner ausgezeichnet, steht die Software von Scality für höchste Zuverlässigkeit, Sicherheit und Nachhaltigkeit. Folgen Sie uns auf LinkedIn und erfahren Sie mehr unter www.scality.com sowie in unserem Blog.
Kontakt
A3 Communications
Connie MacRaild
5th Floor, Great Portland Street 167-169
00000 W1W 5PF London
07850416375

https://www.a3communicationspr.com

