Si la génération #audio par des méthodes d'#IA vous interesse voici une liste de ressources (je continuerai à updater ce tweet en fonction des nouveautés dans l'audio génération) : – https://
arxiv.org/pdf/2301.02111
v1.pdf
… – https://
github.com/microsoft/unilm
– https://
github.com/bshall/hubert
–
MULTIMODAL AI
-
Curated technical resources for AI audio generation
By
–
-
Technical resources for AI voice synthesis and audio generation models
By
–
Tiens du coup si tu veux vraiment t’intéresser à la tech derrière : https://
github.com/bshall/hubert https://
github.com/MoonInTheRiver
/DiffSinger
… https://
github.com/voicepaw/so-vi
ts-svc-fork
… https://
github.com/suno-ai/bark + des weights pretrained sur HuggingFace ( pour me répéter je l’ai jamais caché c’est ce qu’on a utilisé sur -
Training an AI voice model to sing
By
–
Pour ceux qui croit qu’il suffit de cliquer sur un « bouton » pour avoir ce résultat allez voir la vidéo YouTube https://
youtu.be/ECIas_koYcI J’ai codé et testé des jours, en plus de dépenser des sous, pour entraîner un modèle de voix de Macron qui me permet de le faire chanter. -

OpenAI prepares Text-to-3D with SHAP-E
By
–
Yes. OpenAI releasing Text-to-3D soon: SHAP-E They dropped a research paper and Github code for a model called SHAP-E for creating 3D models through text prompts. We are probably 1-2 months away from seeing Text-to-3D printers, as in text-to-object.
-
Shap·E: OpenAI’s 3D generative model
By
–
Shap·E is a conditional generative model for 3D assets, and you can read the full paper here: https://arxiv.org/pdf/2305.02463.pdf … GitHub: https://github.com/openai/shap-e
-

Multimodal Deep Learning: Comprehensive 272-Page eBook Guide
By
–
“Multimodal #DeepLearning” http://
arxiv.org/abs/2301.04856
[Download 272-page PDF eBook]
———
#BigData #DataScience #AI #ML #MachineLearning #NLProc #ComputerVision #NeuralNetworks -
Midjourney Transforms Creative Workflow and Concept Communication
By
–
Continuing to work with @MidJourney (visual AI) to get different concepts out, both for work and fun. This changes everything in the creative world. Still work with designers, but I can do it faster and helps communicate concepts better.
-

Google Introduces MaMMUT Compact Multimodal AI Model
By
–
Introducing MaMMUT, a compact multimodal model that trains across contrastive, text generative, and localization-aware objectives, and outperforms the state of the art or achieves competitive performance on a range of tasks. Learn more → https://
goo.gle/42lZuk5 -
Code and Trained Model with Speech-to-Speech
By
–
Du code, un modèle que j'ai entrainé et du "spech-to-speech" 🙂
-
Runway ML generates photorealistic ads indistinguishable from reality
By
–
Este vídeo creado por Runwayml nos muestra un hipotético spot de una bebida refrescante.
— Juan Merodio (@juanmerodio) 4 mai 2023
Aunque todavía le queda mucho camino, al ritmo que esto avanza, muy pronto estos vídeos serán indistinguibles de la realidad y esto nos tiene que dar mucho en lo que pensar… pic.twitter.com/1uoLcFTvEHEste vídeo creado por Runwayml nos muestra un hipotético spot de una bebida refrescante. Aunque todavía le queda mucho camino, al ritmo que esto avanza, muy pronto estos vídeos serán indistinguibles de la realidad y esto nos tiene que dar mucho en lo que pensar…