
Vésteinn Snæbjarnarson: Transducing Language Models
Vésteinn Snæbjarnarson: Transduire les modèles de langage
@formallanguagesandneuralne5578

Vésteinn Snæbjarnarson: Transduire les modèles de langage

Mayank Jobanputra : Né Transformer, toujours Transformer ? Sur les effets du pré-entraînement

Hongjian Jiang : Synthèse et vérification de programmes Transformer

Dhruv Rohatgi : Compromis calcul-statistique à la frontière de la prédiction du prochain jeton

Samyak Jain : Conception d'un compresseur neuronal

Miloš Stanojević: Mise à jour des croyances syntaxiques comme moteur de la difficulté de traitement Garden Path

Yash Sarrof: Généralisation de longueur des Transformers avec un alphabet de test qui grandit

Yang Wang : À propos des langues à réduplication régulière

Selim Jerad : Reconnaissance non contextuelle avec les Transformers

Peter Shaw : Objectifs de longueur de description asymptotiquement optimaux pour les Transformers

Nikola Zubic: Limites de l'apprentissage profond : Modélisation de séquences à travers le prisme de la théorie de la complexité

Idan Attias : Sur la difficulté d'apprentissage des expressions régulières

Chenxiao Yang : Des moyens puissants de générer : autorégression, diffusion et au-delà

Clemente Pasti : Le « prefix parsing » est simplement du parsing

Aleksandra Bakalova: Découvrir des algorithmes interprétables en décompilant les Transformers vers RASP

Hanlin Zhu : Raisonnement par Superposition : Une Perspective Théorique sur la Chaîne de Pensée Continue

Aleksandar Terzić : Matrices de transition creuses structurées pour le suivi d'état dans les SSM

Francesco Cagnetta: Les réseaux profonds apprennent à analyser des langages hors contexte à partir de statistiques locales

Adam Jardine : Une logique faible mais flexible pour la modélisation des processus phonologiques

Awni Altabaa: Déverrouiller la généralisation hors distribution dans les Transformers via le raisonnement latent

Cai Zhou : DLM continus discrets coévolutifs, prédiction d'échelle sémantique via des DLM hiérarchiques

Brandon Prickett : Modélisation d'un biais sous-régulier dans l'apprentissage phonologique avec des RNN

Parsa Mirtaheri: Let Me Think! Une longue chaîne de pensée peut valoir exponentiellement plus que plusieurs courtes

Kulin Shah: Comprendre l'Ordre des Tokens dans les Diffusions Masquées

Grigoris Velegkas: Identification du langage, génération et détection d'hallucinations à la limite

Dana Angluin: Essayer de comprendre les Transformers

Awni Altabaa: Informations CoT: Complexité d'échantillon améliorée sous supervision de chaîne de pensée

Aditya Varre: Apprendre les n-grammes en contexte avec les Transformers : Les sous-n-grammes sont des points quasi stationnaires

Ying Fan: Transformateurs en boucle pour la généralisation de longueur

Eshaan Nichani: Apprendre les fonctions compositionnelles avec les Transformers à partir de données faciles à difficiles

Ekdeep Lubana: Apprentissage en contexte de langages formels

Andrew Gordon Wilson : Le deep learning n'est pas si mystérieux ou différent

Michael Goodale: Mécanismes neuronaux de méta-apprentissage plutôt que des a priori bayésiens

Ashok Vardhan: Attention avec Markov: Un cas curieux de transformateurs à couche unique

Thomas Chen: Généralisation de longueur non asymptotique

Nirmit Joshi : Une théorie de l'apprentissage avec chaîne de pensée autorégressive

Juno Kim : Transformers résolvent prouvablement la parité efficacement avec Chain of Thought

Deqing Fu: Perspectives algorithmiques sur la compréhension des Transformers

Ruiquan Huang: Une étude théorique sur la dynamique d'entraînement et le biais implicite

Jiaoda Li : Caractérisation de l'expressivité des modèles de langage Transformer