Einführung in Red Hat AI Inference on IBM Cloud
Sind Sie bereit, KI in Ihren Anwendungen einzusetzen? In diesem Tutorial erfahren Sie, wie Sie mit Foundation-Modellen Inferenzberechnungen durchführen und KI-gestützte Antworten generieren. In nur 15 Minuten können Sie bereits mit einem großen Sprachmodell chatten und dialogorientierte KI in Ihre Arbeitsabläufe integrieren.
Red Hat® AI Inference on IBM Cloud® ist eine unternehmensgerechte, private und sichere generative KI-Lösung, die auf der KI von Red Hat OpenShift basiert. Dieses Tutorial konzentriert sich darauf, Ihnen den Einstieg in die Inferenz zur Interaktion mit Foundation-Modellen zu erleichtern – der schnellste Weg, um mit KI zu arbeiten.
Ergebnisse
In diesem Tutorial führen Sie die folgenden Aufgaben durch:
- Richten Sie Ihr IBM Cloud-Konto und Ihr Projekt ein.
- Authentifizieren Sie sich bei der Inferenz-API.
- Erstellen Sie Ihre erste Chat-Antwort mithilfe eines Grundmodells.
- Erfahren Sie mehr über die nächsten Schritte zur Anpassung von Modellen mit Ihren eigenen Daten.
Vorbereitende Schritte
Stellen Sie sicher, dass Sie Folgendes haben:
-
Ein Pay-As-You-Go- oder Abonnement- IBM Cloud-Konto. Testkonten werden nicht unterstützt. Weitere Informationen oder Anleitungen zum Upgrade Ihres Kontos finden Sie unter Kontotypen.
-
Die Rolle Writer oder höher im Dienst Red Hat AI Inference. Weitere Informationen finden Sie unter Verwalten des IAM-Zugriffs.
Rufen Sie Ihre Projekt-ID und Ihren API-Endpunkt ab
Ihre Projekt-ID ist für alle API-Anfragen erforderlich.
-
Öffnen Sie Ihr Projekt.
-
Kopieren Sie Ihre Projekt-ID und bewahren Sie sie für die nächsten Schritte auf.
API-Endpunkt
Alle API-Anfragen verwenden das folgende Basisformat URL:
https://us-east.rhai.ibm.com/v1/projects/<project_id>/inference
Ersetzen Sie <project_id> durch Ihre Projekt-ID.
Bei der API authentifizieren
Bevor Sie mit Foundation-Modellen interagieren können, müssen Sie Ihre API-Anfragen authentifizieren. Sie können entweder ein Bearer-Token oder einen API-Schlüssel vom Typ IBM Cloud verwenden. Dieses Tutorial zeigt, wie Sie eine Service-ID zusammen mit einem API-Schlüssel für den programmatischen Zugriff verwenden. Weitere Informationen zur Verwendung eines Bearer-Tokens finden Sie unter Authentifizierung mithilfe eines Bearer-Tokens.
Erstellen Sie eine Service-ID und weisen Sie Zugriffsrechte zu
Eine Service-ID ist eine nützliche Möglichkeit, den Zugriff auf Red Hat AI Inference-Projekte zu steuern und zu vergeben. Erstellen Sie die Service-ID und weisen Sie ihr anschließend Zugriff auf Ihr Projekt zu.
-
Gehen Sie in der IBM Cloud-Konsole zu Verwalten > Zugriff (IAM) > Service-IDs und klicken Sie auf Erstellen.
-
Geben Sie einen Namen und eine Beschreibung für Ihre Service-ID ein und klicken Sie anschließend auf Erstellen.
-
Klicken Sie auf der Seite Service-ID auf Zugriff zuweisen.
-
Wählen Sie als Dienst Red Hat AI Inference aus.
-
Wählen Sie unter Ressourcen die Option Bestimmte Ressourcen aus und wählen Sie Ihr Projekt aus. Auf diese Weise beschränken Sie den Zugriff auf ein bestimmtes Projekt.
-
Wählen Sie unter Rollen und Aktionen die entsprechende Rolle für den Dienstzugriff aus:
- Wählen Sie Writer, wenn Sie Chat-Vervollständigungen erstellen möchten.
- Wählen Sie Reader, wenn Sie nur die Chat-Vervollständigungen lesen oder Modellinformationen anzeigen möchten.
Für den API-Zugriff sind keine Plattformzugriffsrollen erforderlich.
-
(Optional) Fügen Sie Bedingungen wie zeitbasierten Zugriff hinzu, um den Zugriff auf die Service-ID weiter einzuschränken.
-
Überprüfen Sie die Zugriffsübersicht und klicken Sie auf Zuweisen.
API-Schlüssel erstellen
Nachdem Ihre Service-ID nun Zugriff auf Ihr Red Hat AI Inference-Projekt hat, erstellen Sie einen API-Schlüssel für die Service-ID, den Sie für Ihre API-Aufrufe verwenden können.
-
Klicken Sie auf der Seite Service-ID auf API-Schlüssel.
-
Klicken Sie auf Erstellen und geben Sie einen Namen für Ihren API-Schlüssel ein.
-
Wählen Sie für die Behandlung offengelegter Schlüssel die Option Offengelegten Schlüssel deaktivieren, um den Schlüssel automatisch zu deaktivieren, sobald festgestellt wird, dass er offengelegt wurde.
-
Legen Sie ein Ablaufdatum für den Schlüssel fest. Aus Sicherheitsgründen wird eine regelmäßige Schlüsselrotation empfohlen.
-
Klicken Sie auf Erstellen.
-
Kopieren Sie den API-Schlüssel und bewahren Sie ihn an einem sicheren Ort auf. Der Schlüssel kann nicht erneut angezeigt werden.
Sie können diesen API-Schlüssel nun zur Authentifizierung Ihrer Anfragen verwenden. Im nächsten Schritt verwenden Sie diesen Schlüssel im Header Authorization: Bearer Ihrer API-Aufrufe.
Verfügbare Modelle entdecken
Verschiedene Basismodelle haben unterschiedliche Stärken, daher ist es wichtig, die in Ihrem Projekt verfügbaren Modelle zu prüfen.
Führen Sie den folgenden API-Aufruf aus, um alle verfügbaren Modelle aufzulisten. Ersetzen Sie <project_id> durch Ihre Projekt-ID und <api_key> durch Ihren API-Schlüssel für den Dienst:
curl -L 'https://us-east.rhai.ibm.com/v1/projects/<project_id>/inference/models' \
-H 'Accept: application/json' \
-H "Authorization: Bearer <api_key>"
from openai import OpenAI
client = OpenAI(
api_key="<api_key>",
base_url="https://us-east.rhai.ibm.com/v1/projects/<project_id>/inference",
)
models = client.models.list()
print(models)
Die Antwort zeigt Ihnen alle Modelle, die Sie verwenden können, sowie Informationen zu deren Funktionen. Sie können mit verschiedenen Modellen experimentieren, um dasjenige zu finden, das am besten zu Ihrem Anwendungsfall passt.
Erstellen Sie Ihre erste Chat-Antwort
Senden Sie nun eine Nachricht an das Modell und erhalten Sie eine von der KI generierte Antwort.
Führen Sie den folgenden API-Aufruf durch und ersetzen Sie dabei <project_id> durch Ihre Projekt-ID und <api_key> durch Ihren API-Schlüssel für den Dienst:
curl https://us-east.rhai.ibm.com/v1/projects/<project_id>/inference/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer <api_key>" \
-d '{
"model": "granite-4-0-h-small",
"messages": [
{
"role": "developer",
"content": "You are a helpful assistant"
},
{
"role": "user",
"content": "Hello! Tell me about yourself"
}
]
}'
from openai import OpenAI
client = OpenAI(
api_key="<api_key>",
base_url="https://us-east.rhai.ibm.com/v1/projects/<project_id>/inference",
)
completion = client.chat.completions.create(
model="granite-4-0-h-small",
messages=[
{"role": "developer", "content": "You are a helpful assistant."},
{"role": "user", "content": "Hello! Tell me about yourself"}
]
)
print(completion.choices[0].message)
Sie sollten eine Antwort vom Modell erhalten, in der es sich vorstellt.
Die Anfrage verstehen
Lassen Sie uns einmal analysieren, was Sie gerade getan haben:
- Modell
- Sie haben angegeben
granite-4-0-h-small, eines der verfügbaren Basismodelle. Verschiedene Modelle weisen unterschiedliche Funktionen und Leistungsmerkmale auf. - Nachrichten
- Sie haben zwei Nachrichten bereitgestellt. Eine davon war eine Entwickleranweisung, die die Systemaufforderung festlegte und dem Modell das Verhalten vorgab. Die Benutzernachricht enthielt Ihre konkrete Frage, die das Modell beantworten sollte.
- API-Endpunkt
- Die Anfrage wurde an den Inferenz-Endpunkt Ihres Projekts gesendet, der die Weiterleitung an das entsprechende Modell übernimmt.
Sie können das Verhalten des Modells anpassen, indem Sie die Systemaufforderung ändern, weitere Meldungen hinzufügen oder für verschiedene Anwendungsfälle unterschiedliche Modelle verwenden.
Nächste Schritte
Nachdem Sie nun erfolgreich mit der Inferenz begonnen haben, können Sie als Nächstes Folgendes tun:
Weiter mit der Schlussfolgerung
-
Erfahren Sie mehr über Inferenz, um erweiterte Funktionen wie Streaming-Antworten, die Anpassung von Modellparametern und die Verwaltung des Konversationsverlaufs zu entdecken.
-
In der Dokumentation zur OpenAI-Chat-Completion-API finden Sie eine vollständige API-Referenz.
-
Integrieren Sie die Inferenz mithilfe des Python-SDKs oder anderer Programmiersprachen in Ihre Anwendungen.
Passen Sie Modelle an Ihre Daten an
Veraltet
Sind Sie bereit, über allgemeine Modelle hinauszugehen? Sie können Basis-Modelle durch Modellanpassung an das spezifische Wissen und die Kompetenzen Ihres Unternehmens anpassen:
-
Erstellen Sie eine Taxonomie, die Ihr betriebswirtschaftliches Wissen und Ihre Fähigkeiten umfasst.
-
Generieren Sie synthetische Daten aus Ihrer Taxonomie.
-
Trainieren Sie ein individuelles Modell, das genau auf Ihre spezifischen Anforderungen zugeschnitten ist.
Auf diese Weise können Sie Modelle so feinabstimmen, dass sie Ihren geschäftlichen Kontext, Ihre Terminologie und Ihre Anforderungen verstehen – was über die Möglichkeiten von Allzweckmodellen hinausgeht.