Impulsione a sua carreira em um dos maiores centros de P&D do país. Há 23 anos, desenvolvemos soluções sob medida em software e hardware para diversos segmentos em parceria com grandes players globais da área de tecnologia. Atuamos também com testes de laboratório, consultoria de inovação, capacitação, treinamento e certificação de produtos para telecomunicações.
É a sua chance de adquirir novas experiências e aplicar seu conhecimento em projetos relevantes que impactam positivamente a vida das pessoas.
Somos mais de 1.800 profissionais e reconhecidos como um dos Lugares Incríveis para se Trabalhar pelo prêmio FIA/UOL.
Estamos em grandes polos tecnológicos do país, com unidades em Brasília, Campinas, Manaus e Porto Alegre.
Temos infraestrutura completa de laboratórios, especialmente o de microeletrônica, que é referência em todo o país.
Somos o único membro da América Latina da associação europeia EARTO.
Temos expertise em tecnologias como inteligência artificial, visão computacional, computação gráfica, realidade virtual e aumentada, assistentes virtuais e interface por voz, big data e analytics, openRAN, sistemas embarcados, IoT e blockchain.
/n
Graduação completa em Ciência da Computação, Engenharia de Software, Sistemas de Informação, Engenharia da Computação ou áreas correlatas;
Experiência sênior e hands-on em Linux, preferencialmente RHEL/Rocky/ Ubuntu Server
Domínio de administração e troubleshooting Linux em ambientes de alta performance e/ou larga escala.
Experiência avançada na administração de Slurm
Forte conhecimento de Shell Scripting, Python, Ansible e Git.
Experiência prática com pelo menos uma solução de storage paralelo (Lustre, BeeGFS, GPFS/Spectrum Scale ou equivalente).
Conhecimentos sólidos de redes, Linux e autenticação centralizada (LDAP/FreeIPA/Kerberos ou equivalente).
Capacidade de atuar de forma independente em troubleshooting complexo, análise de performance e resolução de problemas de infraestrutura.
/n
Implantar, administrar e otimizar ambientes de virtualização free e de mercado, como QEMU, Proxmox, Hyper-V, VMWare.
Administração de sistemas operacionais Linux, desde configuração, hardening, troubleshooting, performance tuning, serviços, kernel, drivers, filesystem, networking e automação.
Maximizar a eficiência de clusters de computação de alto desempenho através da configuração de partições e políticas de prioridade utilizando o Slurm ou soluções de mercado como PBS Professional e LSF
Vivência no ecossistema LiCO para gerenciamento de clusters, monitoramento de infraestrutura e gerenciamento de templates de IA.
Conhecimento em alternativas ao LiCO, familiaridade com ferramentas concorrentes de portais e orquestração de HPC/IA, como Open OnDemand, Run:ai, ou frameworks baseados em Kubernetes para HPC
Automatizar provisionamento e operação de infraestrutura utilizando Ansible, Shell Script e Python, aplicando práticas de infrastructure as code.
Administrar nós com GPUs NVIDIA/AMD, incluindo drivers CUDA, DCGM, MIG, NVLink, NCCL.
Realizar monitoramento constante de infraestrutura e aplicações, identificando gargalos de CPU, GPU, memória, storage e rede.
Atuar junto a pesquisadores e engenheiros no diagnóstico e otimização de workloads MPI/OpenMP, IA e Deep Learning.
Contribuir para segurança, documentação, capacity planning, governança e evolução da arquitetura HPC.
Criar um alerta de emprego para esta pesquisa
Pessoa Engenheira de HPC & AI Infrastructure -Sênior • Brasília, Distrito Federal, Brasil