Meta

Dernières actualités, modèles et sorties d'IA de Meta. ['Astryx', 'Business Agent', 'BYT5', 'CodeLlama', 'expressive voice AI', 'FAIRChem v2 UMA', 'Gemma 4', 'Gemma4:e2b', 'HuBERT', 'llama', 'Llama', 'LLaMA', 'LLaMA2-chat-70B', 'Llama 3', 'Llama 3.1', 'Llama 3.1-405B', 'Llama-3.1-405B', 'LLaMA-3.1 405B', 'Llama 3.1-70B', 'Llama 3.1 8B', 'Llama 3.1-8B', 'Llama-3.1-8B', 'Llama 3.2', 'Llama-3.2-1B-Instruct', 'Llama 3.3', 'llama-3.3-70b', 'Llama 3 8B', 'Llama3-8B-Instruct', 'Llama 4', 'Llama 4 Maverick', 'LLaMA 65B', 'Llama 70B', 'M2M100', 'M**a AI', 'mBART', 'Meta AI', 'Meta AI model (model name not specified)', 'Meta Muse Spark', 'Muse Spark', 'Muse Spark 1.1']

Monday.com rejoint la liste des entreprises technologiques imputant les licenciements à l'IA — 20 autres exemples

Monday.com va licencier 20 % de ses effectifs (plus de 600 personnes) dans le cadre d'une restructuration, invoquant une transformation vers une stratégie de croissance axée sur l'intelligence artificielle. Selon le Financial Times, les entreprises informatiques américaines ont supprimé près de 140 000 emplois depuis le début de l'année, Amazon, Oracle, Meta et Microsoft représentant à elles seules près de 50 000 suppressions. Cependant, le marché reste sceptique face à ces explications : les actions des entreprises invoquant l'IA ont sous-performé le Nasdaq de 10 %.

monday.commonday.com MicrosoftMicrosoft OracleOracle GitLabGitLab Google/DeepMindGoogle/DeepMind IntuitIntuit MetaMeta Cisco SystemsCisco Systems CloudflareCloudflare General MotorsGeneral Motors CoinbaseCoinbase PayPalPayPal SnapSnap IBMIBM AtlassianAtlassian DellDell BlockBlock SalesforceSalesforce Amazon/AWSAmazon/AWS AnthropicAnthropic OpenAIOpenAI
TechCrunch AI27.07 · 21:02
Recherche 🇷🇺

Écrire un Transformer Décodeur-Only pour un LLM à partir de zéro en Python

L'auteur d'une série d'articles décrit en détail l'implémentation d'un bloc transformer pour un petit LLM décodeur-only utilisant le framework PyTorch. Les composants couverts incluent : l'attention multi-têtes avec masquage, le réseau feed-forward avec GELU, la couche de normalisation et les connexions résiduelles. L'article explique la différence par rapport à l'architecture originale : la pré-normalisation (Pre-LN) est utilisée à la place de la post-normalisation pour la stabilité de l'entraînement.

Google/DeepMindGoogle/DeepMind OpenAIOpenAI MetaMeta
Habr — хаб NLP27.07 · 20:04
Infos fraîches