detalhes do modelo IBM watsonx Code Assistant
watsonx Code Assistant
IBM watsonx Code Assistant foi projetado para acelerar o ciclo de vida do desenvolvimento de software e foi desenvolvido com base nos modelos de código do IBM Granite.
Programação geral
As fontes de dados públicos usadas para treinar os modelos incluem:
- GitHub
- StarCoder
- CommitPack
- Assistente de código de glaive
Java
Modelo empresarial aprimorado Java para correção, explicação, geração e correção de testes unitários. Esse modelo aproveita os novos dados corporativos do Java adaptados a esses casos de uso e um código bloqueado por centenas de desenvolvedores do IBM WebSphere.
As fontes de dados públicos usadas para treinar os modelos incluem:
- methods2test
- Código-fonte e documentação do Jakarta EE
- Código-fonte e documentação MicroProfile
Especificações do Jakarta EE
Copyright © 2016-2023, Eclipse Foundation e Copyright © 2016-2024, Eclipse Foundation AISBL. Este software ou documento inclui material copiado ou derivado das Especificações JarkataEE disponíveis em https://jakarta.ee/specifications/. Este software pode gerar material que implementa, é copiado ou derivado dos documentos mencionados neste documento. O usuário é responsável por determinar se os requisitos da Eclipse Foundation Specification License ( https://www.eclipse.org/legal/efsl/ ) se aplicam aos materiais gerados.
MicroProfile Especificações e documentação da API
Copyright © 2016-2023, Eclipse Foundation e Copyright © 2016-2024 Eclipse Foundation AISBL. Este software ou documento inclui material copiado ou derivado de documentos de especificação da Eclipse Foundation MicroProfile e da documentação da API da Eclipse Foundation MicroProfile disponível em https://microprofile.io/specifications/. Este software pode gerar material que implementa, é copiado ou derivado dos documentos mencionados neste documento. O usuário é responsável por determinar se os requisitos da Eclipse Foundation Specification License ( https://www.eclipse.org/legal/efsl/ ) se aplicam aos materiais gerados.
Outros (como linguagem natural e matemática)
As fontes de dados públicos usadas para treinar os modelos incluem:
- MathInstruct
- OpenWebMath
- S2ORC: o corpus de pesquisa aberta da Semantic Scholar
- RedPajama 1T
- Stack Exchange
- Wikimedia