Einführung in Red Hat AI Inference on IBM Cloud

Sind Sie bereit, KI in Ihren Anwendungen einzusetzen? In diesem Tutorial erfahren Sie, wie Sie mit Foundation-Modellen Inferenzberechnungen durchführen und KI-gestützte Antworten generieren. In nur 15 Minuten können Sie bereits mit einem großen Sprachmodell chatten und dialogorientierte KI in Ihre Arbeitsabläufe integrieren.

Red Hat® AI Inference on IBM Cloud® ist eine unternehmensgerechte, private und sichere generative KI-Lösung, die auf der KI von Red Hat OpenShift basiert. Dieses Tutorial konzentriert sich darauf, Ihnen den Einstieg in die Inferenz zur Interaktion mit Foundation-Modellen zu erleichtern – der schnellste Weg, um mit KI zu arbeiten.

Ergebnisse

In diesem Tutorial führen Sie die folgenden Aufgaben durch:

  • Richten Sie Ihr IBM Cloud-Konto und Ihr Projekt ein.
  • Authentifizieren Sie sich bei der Inferenz-API.
  • Erstellen Sie Ihre erste Chat-Antwort mithilfe eines Grundmodells.
  • Erfahren Sie mehr über die nächsten Schritte zur Anpassung von Modellen mit Ihren eigenen Daten.

Vorbereitende Schritte

Stellen Sie sicher, dass Sie Folgendes haben:

Rufen Sie Ihre Projekt-ID und Ihren API-Endpunkt ab

Ihre Projekt-ID ist für alle API-Anfragen erforderlich.

  1. Zu den Red Hat AI Inference-Projekten.

  2. Öffnen Sie Ihr Projekt.

  3. Kopieren Sie Ihre Projekt-ID und bewahren Sie sie für die nächsten Schritte auf.

API-Endpunkt

Alle API-Anfragen verwenden das folgende Basisformat URL:

https://us-east.rhai.ibm.com/v1/projects/<project_id>/inference

Ersetzen Sie <project_id> durch Ihre Projekt-ID.

Bei der API authentifizieren

Bevor Sie mit Foundation-Modellen interagieren können, müssen Sie Ihre API-Anfragen authentifizieren. Sie können entweder ein Bearer-Token oder einen API-Schlüssel vom Typ IBM Cloud verwenden. Dieses Tutorial zeigt, wie Sie eine Service-ID zusammen mit einem API-Schlüssel für den programmatischen Zugriff verwenden. Weitere Informationen zur Verwendung eines Bearer-Tokens finden Sie unter Authentifizierung mithilfe eines Bearer-Tokens.

Erstellen Sie eine Service-ID und weisen Sie Zugriffsrechte zu

Eine Service-ID ist eine nützliche Möglichkeit, den Zugriff auf Red Hat AI Inference-Projekte zu steuern und zu vergeben. Erstellen Sie die Service-ID und weisen Sie ihr anschließend Zugriff auf Ihr Projekt zu.

  1. Gehen Sie in der IBM Cloud-Konsole zu Verwalten > Zugriff (IAM) > Service-IDs und klicken Sie auf Erstellen.

  2. Geben Sie einen Namen und eine Beschreibung für Ihre Service-ID ein und klicken Sie anschließend auf Erstellen.

  3. Klicken Sie auf der Seite Service-ID auf Zugriff zuweisen.

  4. Wählen Sie als Dienst Red Hat AI Inference aus.

  5. Wählen Sie unter Ressourcen die Option Bestimmte Ressourcen aus und wählen Sie Ihr Projekt aus. Auf diese Weise beschränken Sie den Zugriff auf ein bestimmtes Projekt.

  6. Wählen Sie unter Rollen und Aktionen die entsprechende Rolle für den Dienstzugriff aus:

    • Wählen Sie Writer, wenn Sie Chat-Vervollständigungen erstellen möchten.
    • Wählen Sie Reader, wenn Sie nur die Chat-Vervollständigungen lesen oder Modellinformationen anzeigen möchten.

    Für den API-Zugriff sind keine Plattformzugriffsrollen erforderlich.

  7. (Optional) Fügen Sie Bedingungen wie zeitbasierten Zugriff hinzu, um den Zugriff auf die Service-ID weiter einzuschränken.

  8. Überprüfen Sie die Zugriffsübersicht und klicken Sie auf Zuweisen.

API-Schlüssel erstellen

Nachdem Ihre Service-ID nun Zugriff auf Ihr Red Hat AI Inference-Projekt hat, erstellen Sie einen API-Schlüssel für die Service-ID, den Sie für Ihre API-Aufrufe verwenden können.

  1. Klicken Sie auf der Seite Service-ID auf API-Schlüssel.

  2. Klicken Sie auf Erstellen und geben Sie einen Namen für Ihren API-Schlüssel ein.

  3. Wählen Sie für die Behandlung offengelegter Schlüssel die Option Offengelegten Schlüssel deaktivieren, um den Schlüssel automatisch zu deaktivieren, sobald festgestellt wird, dass er offengelegt wurde.

  4. Legen Sie ein Ablaufdatum für den Schlüssel fest. Aus Sicherheitsgründen wird eine regelmäßige Schlüsselrotation empfohlen.

  5. Klicken Sie auf Erstellen.

  6. Kopieren Sie den API-Schlüssel und bewahren Sie ihn an einem sicheren Ort auf. Der Schlüssel kann nicht erneut angezeigt werden.

Sie können diesen API-Schlüssel nun zur Authentifizierung Ihrer Anfragen verwenden. Im nächsten Schritt verwenden Sie diesen Schlüssel im Header Authorization: Bearer Ihrer API-Aufrufe.

Verfügbare Modelle entdecken

Verschiedene Basismodelle haben unterschiedliche Stärken, daher ist es wichtig, die in Ihrem Projekt verfügbaren Modelle zu prüfen.

Führen Sie den folgenden API-Aufruf aus, um alle verfügbaren Modelle aufzulisten. Ersetzen Sie <project_id> durch Ihre Projekt-ID und <api_key> durch Ihren API-Schlüssel für den Dienst:

curl -L 'https://us-east.rhai.ibm.com/v1/projects/<project_id>/inference/models' \
  -H 'Accept: application/json' \
  -H "Authorization: Bearer <api_key>"
from openai import OpenAI
client = OpenAI(
  api_key="<api_key>",
  base_url="https://us-east.rhai.ibm.com/v1/projects/<project_id>/inference",
)
models = client.models.list()
print(models)

Die Antwort zeigt Ihnen alle Modelle, die Sie verwenden können, sowie Informationen zu deren Funktionen. Sie können mit verschiedenen Modellen experimentieren, um dasjenige zu finden, das am besten zu Ihrem Anwendungsfall passt.

Erstellen Sie Ihre erste Chat-Antwort

Senden Sie nun eine Nachricht an das Modell und erhalten Sie eine von der KI generierte Antwort.

Führen Sie den folgenden API-Aufruf durch und ersetzen Sie dabei <project_id> durch Ihre Projekt-ID und <api_key> durch Ihren API-Schlüssel für den Dienst:

curl https://us-east.rhai.ibm.com/v1/projects/<project_id>/inference/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer <api_key>" \
  -d '{
    "model": "granite-4-0-h-small",
    "messages": [
      {
        "role": "developer",
        "content": "You are a helpful assistant"
      },
      {
        "role": "user",
        "content": "Hello! Tell me about yourself"
      }
    ]
  }'
from openai import OpenAI
client = OpenAI(
  api_key="<api_key>",
  base_url="https://us-east.rhai.ibm.com/v1/projects/<project_id>/inference",
)
completion = client.chat.completions.create(
  model="granite-4-0-h-small",
  messages=[
    {"role": "developer", "content": "You are a helpful assistant."},
    {"role": "user", "content": "Hello! Tell me about yourself"}
  ]
)
print(completion.choices[0].message)

Sie sollten eine Antwort vom Modell erhalten, in der es sich vorstellt.

Die Anfrage verstehen

Lassen Sie uns einmal analysieren, was Sie gerade getan haben:

Modell
Sie haben angegeben granite-4-0-h-small, eines der verfügbaren Basismodelle. Verschiedene Modelle weisen unterschiedliche Funktionen und Leistungsmerkmale auf.
Nachrichten
Sie haben zwei Nachrichten bereitgestellt. Eine davon war eine Entwickleranweisung, die die Systemaufforderung festlegte und dem Modell das Verhalten vorgab. Die Benutzernachricht enthielt Ihre konkrete Frage, die das Modell beantworten sollte.
API-Endpunkt
Die Anfrage wurde an den Inferenz-Endpunkt Ihres Projekts gesendet, der die Weiterleitung an das entsprechende Modell übernimmt.

Sie können das Verhalten des Modells anpassen, indem Sie die Systemaufforderung ändern, weitere Meldungen hinzufügen oder für verschiedene Anwendungsfälle unterschiedliche Modelle verwenden.

Nächste Schritte

Nachdem Sie nun erfolgreich mit der Inferenz begonnen haben, können Sie als Nächstes Folgendes tun:

Weiter mit der Schlussfolgerung

  • Erfahren Sie mehr über Inferenz, um erweiterte Funktionen wie Streaming-Antworten, die Anpassung von Modellparametern und die Verwaltung des Konversationsverlaufs zu entdecken.

  • In der Dokumentation zur OpenAI-Chat-Completion-API finden Sie eine vollständige API-Referenz.

  • Integrieren Sie die Inferenz mithilfe des Python-SDKs oder anderer Programmiersprachen in Ihre Anwendungen.

Passen Sie Modelle an Ihre Daten an

Veraltet

Sind Sie bereit, über allgemeine Modelle hinauszugehen? Sie können Basis-Modelle durch Modellanpassung an das spezifische Wissen und die Kompetenzen Ihres Unternehmens anpassen:

  1. Erstellen Sie eine Taxonomie, die Ihr betriebswirtschaftliches Wissen und Ihre Fähigkeiten umfasst.

  2. Generieren Sie synthetische Daten aus Ihrer Taxonomie.

  3. Trainieren Sie ein individuelles Modell, das genau auf Ihre spezifischen Anforderungen zugeschnitten ist.

Auf diese Weise können Sie Modelle so feinabstimmen, dass sie Ihren geschäftlichen Kontext, Ihre Terminologie und Ihre Anforderungen verstehen – was über die Möglichkeiten von Allzweckmodellen hinausgeht.