Usando watsonx Code Assistant Individual com um modelo local do IBM Granite

watsonx Code Assistant Individual

Para usuários individuais, o watsonx Code Assistant pode acessar um modelo local por meio do Ollama, que é um mecanismo de inferência local amplamente usado para modelos de linguagem grandes. O Ollama envolve o projeto de serviço de modelo subjacente llama.cpp.

Para obter maior desempenho e um conjunto completo de recursos para sua organização, provisione uma avaliação do watsonx Code Assistant no IBM Cloud. Para obter mais informações, consulte Configurando seu serviço watsonx Code Assistant no IBM Cloud.

Instale a extensão watsonx Code Assistant

Você pode configurar o Ollama para uso no Microsoft Visual Studio Code.

Essa configuração não está disponível para o plug-in Eclipse IDE. Está disponível somente com a extensão Visual Studio Code.

  1. Abra a página watsonx Code Assistant no Visual Studio Marketplace.

  2. Clique em Install (Instalar ) na página do Marketplace.

  3. No Visual Studio Code, clique em Install (Instalar ) na extensão.

  4. Nas configurações da extensão, defina Wca: Backend Provider como ollama.

    Observação para funcionários do IBM: A alteração do provedor de back-end sempre será revertida para wcaCore se você for um funcionário de IBM ou Red Hat usando a extensão interna WCA@IBM. Para permitir a alteração do provedor de back-end:

    • Nas configurações da extensão WCA@IBM, desmarque Habilitar modo WCA@IBM para watsonx Code Assistant
    • Como alternativa, desative a extensão WCA@IBM

Instalar Ollama

  • Faça download e execute o instalador do ollama.

  • Em macOS,, você também pode usar o Homebrew para instalar o Ollama:

    brew install ollama
    

Iniciar o servidor de inferência Ollama

Em uma janela de console, execute:

ollama serve

Deixe essa janela aberta enquanto estiver usando o Ollama.

Se você receber a mensagem ' Error: listen tcp 127.0.0.1:11434: bind: address already in use, o servidor Ollama já foi iniciado.

Instalar o modelo de código do IBM Granite

Comece instalando o modelo " granite-code:8b disponível na biblioteca Ollama.

  1. Abra uma nova janela do console.

  2. Na linha de comando, digite ' ollama run granite-code:8b para fazer download e implantar o modelo. Você vê saída semelhante ao exemplo a seguir:

    pulling manifest
    pulling 8718ec280572... 100% ▕███████████████████████ 4.6 GB
    pulling e50df8490144... 100% ▕███████████████████████ ▏  123 B
    pulling 58d1e17ffe51... 100% ▕███████████████████████▏  11 KB
    pulling 9893bb2c2917... 100% ▕███████████████████████▏  108 B
    pulling 0e851433eda0... 100% ▕███████████████████████▏  485 B
    verifying sha256 digest
    writing manifest
    removing any unused layers
    success
    >>>
    
  3. Digite ' /bye após o ' >>> para sair do shell de comando do Ollama.

  4. Experimente o modelo digitando:

    ollama run granite-code:8b "How do I create a python class?"
    
  5. Deve-se ver uma resposta semelhante a:

    To create a Python class, you can define a new class using the "class" keyword followed by the name of the class and a colon. Inside the class definition, you can specify the methods and attributes that the class will have. Here is an example: ...
    

Configurar o host Ollama

Por padrão, o servidor Ollama é executado no endereço IP 127.0.0.1, na porta 11434 e no protocolo http. Se você alterar o endereço IP ou a porta em que o Ollama está disponível:

  1. No Visual Studio Code, abra as configurações de extensão para watsonx Code Assistant.

  2. Em Wca > Local: API Host, adicione o IP e a porta do host.

Configurar o modelo Granite para usar

Por padrão, watsonx Code Assistant usa o modelo ' granite-code:8b para bate-papo e autocompletar código. Se seu ambiente tiver capacidade suficiente, instale o modelo " granite-code:8b-base.

Para usar um modelo diferente:

  1. Instale o modelo " granite-code:8b-base. Consulte Instalar o modelo de código do IBM Granite.

  2. No Visual Studio Code, abra as configurações de extensão para watsonx Code Assistant.

  3. Em Wca > Local: Code Gen Model, digite ' granite-code:8b-base.

Protegendo sua configuração

Por padrão, o servidor Ollama é executado no endereço IP 127.0.0.1, porta 11434, usando http como protocolo, em seu dispositivo local. Para usar https em vez disso ou passar por um servidor proxy, consulte a documentação do Ollama.

Mudar de um modelo local para IBM Cloud

Você pode decidir mudar de um modelo local para usar uma instância de serviço em IBM Cloud. Você pode então configurar Visual Studio Code para mudar de um modelo local para IBM Cloud.

Para obter mais informações, consulte Configurando seu serviço watsonx Code Assistant no IBM Cloud.

Para atualizar seu editor de Visual Studio Code para usar IBM Cloud em vez de Ollama:

  1. Saia do site Visual Studio Code.

  2. Saia do aplicativo Ollama.

  3. Inicie o Visual Studio Code e abra watsonx Code Assistant. Você deverá ver a mensagem ' Ollama is not running in your IDE.

  4. Clique em Switch to watsonx Code Assistant on IBM Cloud.

Para um método alternativo, você pode alterar as configurações de extensão:

  1. No Visual Studio Code, abra as configurações de extensão para watsonx Code Assistant.

  2. Em Wca: Backend Provider, mude de ' ollama para ' wcaCore.

  3. Reinicie as extensões para aplicar a alteração.