La géométrie du bruit / Noise Geometry

Le bruit a longtemps occupé, dans la tradition scientifique moderne, la place de l’adversaire : trace indésirable de la matière, altération menaçant l’intégrité du sens. Cette opposition a structuré l’ingénierie des télécommunications et nourri certaines lectures de la première cybernétique. Les modèles génératifs contemporains font apparaître une situation différente, mais il faut se garder d’y voir une conversion. Le bruit n’a pas changé de nature. Ce qui a changé, c’est le point où l’on cesse d’avoir besoin de savoir qu’il en est un.

Une ligne téléphonique transatlantique, au début du XXe siècle, n’est jamais un milieu transparent. Le cuivre s’agite thermiquement. L’atmosphère interfère. La résistance des composants dissipe le signal, la distance l’affaiblit. Traverser les États-Unis d’un océan à l’autre par la voix suppose de lutter contre la dégradation du rapport signal sur bruit. La solution, alors, est d’amplifier. Mais chaque amplificateur restaure le signal en même temps qu’il grossit le bruit accumulé, jusqu’à ce que le souffle engloutisse la voix. Le bruit apparaît ici comme une limite matérielle à l’idéal de transmission : il rappelle qu’un message n’existe jamais indépendamment des conditions physiques de sa circulation. Un canal a une bande passante, une puissance disponible, des sources d’interférence propres. L’information doit composer avec ces conditions, non les abolir.

Shannon, aux laboratoires Bell, déplace le problème sans le résoudre. L’information n’y désigne plus le sens d’un message mais une quantité mesurable à partir de l’incertitude associée à ses possibles. L’entropie informationnelle n’est donc pas simplement un désordre auquel s’opposerait, terme à terme, une information conçue comme ordre. Elle mesure l’incertitude d’une source, et permet d’établir les limites de ce qu’un canal bruité peut transmettre. Le bruit, de son côté, introduit une incertitude sur le message effectivement reçu. La question devient : combien d’information peut traverser ce canal, malgré cette incertitude.

Chez Wiener, le problème s’élargit. Organismes vivants et machines régulées maintiennent certaines formes d’organisation par des échanges d’information et des mécanismes de rétroaction ; la lutte contre la désorganisation devient l’un des motifs d’une pensée qui rapproche physiologie, machines et communications. Mais la première cybernétique ne se réduit pas à une volonté d’isoler les systèmes de leur environnement. La rétroaction suppose au contraire des échanges permanents avec lui. Ce qui compte, c’est de distinguer les perturbations auxquelles un système doit résister des variations auxquelles il doit répondre. Une certaine conception du bruit se dessine tout de même : il est ce qui compromet la fidélité d’une transmission ou la stabilité d’une régulation, ce que le système doit limiter, mesurer, corriger. Même devenu objet mathématique, le bruit reste défini relativement à une opération dont il menace la réussite.

Cette relativité mérite qu’on s’y arrête. Une fluctuation n’est pas du bruit par nature. Elle le devient au regard d’un signal, d’un dispositif de mesure, d’un objectif déterminé. Ce qui perturbe une transmission peut constituer une information pour un autre observateur, placé ailleurs dans le dispositif. L’opposition entre signal et bruit dépend donc des opérations qui les distinguent, non d’une différence de substance. C’est précisément cette distinction que les modèles génératifs récents vont déplacer, sans jamais l’effacer.

Michel Serres retrouve chez Lucrèce une tout autre manière d’envisager la perturbation. Dans le récit atomiste du De rerum natura, les atomes tombent à travers le vide. Si leurs trajectoires demeuraient parfaitement parallèles, aucune rencontre n’aurait lieu, aucun corps ne se formerait, aucun monde ne naîtrait. Cet ordre absolu équivaut à la mort. Il faut qu’un atome dévie imperceptiblement de sa course pour que des collisions deviennent possibles. Le clinamen désigne cette déviation minimale, dont ni le lieu ni l’instant ne sont assignables. Il ne corrige pas un mouvement défectueux. Il ouvre des événements que la régularité du mouvement initial excluait par construction. Sans lui, la chute parallèle des atomes resterait stérile pour l’éternité.

Dans sa lecture du poème, Serres relit l’atomisme à travers les notions de flux, de turbulence, de formation des tourbillons. L’écart n’y est plus une anomalie dans un ordre préexistant : il participe à la constitution même des formes. Le mouvement laminaire cède la place à la turbulence, les trajectoires se croisent, des organisations locales deviennent possibles là où rien n’était encore différencié. Le bruit — la noise, le tumulte premier de la mer agitée d’où surgit une forme — devient la condition de toute émergence plutôt que sa menace. L’ordre n’y est jamais qu’une île temporaire, sculptée dans sa propre dynamique, jamais préservée d’elle.

Il serait pourtant trompeur d’identifier sans reste le clinamen au bruit statistique. La déviation lucrétienne appartient à une physique spéculative, et engage chez Lucrèce la question de la liberté : rien ne la cause, rien ne la programme, elle est la brèche par laquelle le déterminisme atomiste laisse filer autre chose que lui-même. Le bruit des télécommunications, lui, est une perturbation mesurable relativement à un signal donné, produite par des causes physiques parfaitement identifiables — agitation thermique, interférence, atténuation. Les deux notions n’ont ni le même statut ni la même fonction. Leur rapprochement n’en fait pas apparaître moins une question qui traverse les deux domaines : une variation jugée indésirable à une échelle peut-elle devenir, à une autre, une condition de formation ? Chez Serres, cette question interdit de concevoir l’ordre comme un état premier auquel le désordre viendrait s’ajouter de l’extérieur. Les formes émergent dans des mouvements dont elles ne se séparent jamais tout à fait.

Reste à savoir ce qu’une telle intuition peut apporter à l’analyse d’un système technique contemporain. L’analogie serait pauvre si elle consistait à dire que les modèles génératifs produisent des images à partir du bruit comme les mondes lucrétiens naissent de rencontres atomiques ; ce rapprochement-là ne coûte rien et ne prouve rien. Il devient plus intéressant si on l’oblige à répondre à une question précise : quelles informations sont réellement nécessaires pour organiser une trajectoire, et lesquelles peuvent être déduites du seul milieu qu’elle traverse ?

Les modèles de diffusion classiques reposent sur un processus qui transforme progressivement une donnée en bruit, puis apprend à parcourir le chemin inverse. Dans les architectures usuelles, le réseau reçoit à chaque étape une indication explicite du niveau de bruit, un paramètre temporel t qui ne mesure pas un temps physique mais situe l’observation dans le processus de dégradation, et lui permet d’adapter son opération à l’état exact de la donnée. Une image presque intacte ne réclame pas le même traitement qu’une observation dont les structures initiales sont presque entièrement dissimulées. Cette horloge est une information extérieure à l’observation bruitée elle-même ; elle indique au réseau où il se trouve, et l’on pourrait croire cette indication indispensable, puisqu’une même observation bruitée peut en principe correspondre à plusieurs combinaisons possibles de données et de niveaux de bruit.

C’est cette nécessité supposée que Sahraee-Ardakan, Delbracio et Milanfar mettent en question. Leur étude des modèles génératifs autonomes montre qu’un réseau peut apprendre, dans un cadre déterminé, à générer des données sans jamais recevoir ce conditionnement temporel explicite. Il ne s’agit pas simplement de lui retirer une variable en espérant qu’il se débrouille. L’absence d’horloge change la manière même de comprendre le champ que le réseau apprend, et le paysage géométrique dans lequel s’effectue la génération. Dire qu’un modèle fonctionne sans connaître t ne signifie pas qu’il ignore les propriétés statistiques des niveaux de bruit : ces propriétés continuent d’agir, à travers la distribution des exemples d’entraînement, l’objectif d’apprentissage, et le champ qui en résulte. Le temps cesse d’être une entrée explicite. Les contraintes auxquelles il correspondait ne disparaissent pas pour autant. Elles changent de lieu.

C’est ce déplacement que formalise la notion d’énergie marginale. Soit une donnée bruitée u, dont la distribution dépend d’un niveau de bruit t. Lorsque ce niveau n’est plus connu, on intègre les distributions conditionnelles sur l’ensemble des niveaux possibles, pondérées par leur distribution a priori, ce qui donne une densité marginale p(u), à laquelle correspond une énergie E_marg(u) = −log p(u). Ce paysage n’a plus rien d’une coupe instantanée : il intègre d’emblée tous les niveaux de bruit dans une seule distribution, de sorte que chaque point de l’espace porte une énergie qui tient compte de l’ensemble des manières dont il aurait pu être produit. Le modèle ne reçoit plus de position temporelle lui indiquant quelle opération effectuer ; son champ de génération se déduit de la géométrie de cette distribution marginale, et la dynamique s’interprète comme un flux de gradient riemannien sur ce paysage. Le mot compte : riemannien, non pas euclidien. Une métrique locale intervient dans la relation entre le gradient de l’énergie et le mouvement de génération, et cette métrique se déforme selon l’endroit où l’on se trouve. Deux régions aux gradients comparables ne produisent donc pas nécessairement des déplacements identiques.

Il ne faudrait pas en conclure que le réseau découvre une géométrie indépendante de son apprentissage, comme s’il tombait dessus. La métrique effective résulte des relations mathématiques entre la distribution marginale, le champ appris et l’objectif d’entraînement ; elle exprime les contraintes que le modèle a dû incorporer pour pouvoir agir sans indication temporelle. L’horloge n’a pas été supprimée sans contrepartie. Son rôle a été redistribué dans le paysage énergétique lui-même, et dans la métrique qui permet de le parcourir sans s’y perdre.

Cette redistribution rencontre une difficulté décisive à l’approche de la variété des données. Quand le niveau de bruit tend vers zéro, certaines quantités associées au paysage énergétique deviennent singulières : le puits d’énergie se creuse en 1/t^p, jusqu’à l’infini théorique, tandis qu’un réseau neuronal ordinaire, borné par construction, produit des sorties dont l’amplitude reste finie. Comment un champ appris, aux valeurs nécessairement bornées, peut-il correspondre à une descente sur un paysage dont certains gradients deviennent arbitrairement grands ? C’est précisément l’échec que rencontraient les premières tentatives de modèles fondés sur l’énergie brute, et qui condamnait, semblait-il, toute approche sans horloge.

La décomposition en énergie relative que proposent les trois auteurs montre que le champ réellement appris par le réseau n’affronte jamais cette singularité telle quelle. Il incorpore implicitement une métrique conforme locale, un facteur d’échelle qui varie point par point, dont l’effet est de neutraliser exactement la singularité géométrique du paysage brut. Le puits infiniment profond se referme en un attracteur stable. Il faut distinguer, à cet endroit précis, la forme de l’énergie et la géométrie selon laquelle elle se laisse parcourir : la première diverge, la seconde absorbe la divergence avant qu’elle n’atteigne le réseau. Le champ n’a pas besoin de produire un gradient qui exploserait ; la métrique effective lui permet de rester praticable là où la description euclidienne échouerait. Ce qui paraissait impossible quand on considérait séparément le paysage et le mouvement devient possible dès qu’on examine leur relation.

Cette compatibilité, toutefois, ne va pas de soi pour toutes les manières de paramétrer le réseau. Dans la paramétrisation en bruit, la plus ancienne, la plus répandue aussi dans les premières formulations de la diffusion probabiliste, le réseau apprend à prédire directement la perturbation ajoutée à la donnée. Cette formulation devient instable dans les modèles autonomes déterministes : les auteurs identifient un écart de Jensen qui agit comme un amplificateur à gain élevé pour toute erreur d’estimation, si bien qu’à mesure que t tend vers zéro, sans qu’aucune horloge n’en informe le réseau, la moindre imprécision se démultiplie jusqu’à la divergence. C’est cela qui explique l’échec catastrophique des modèles aveugles déterministes qui s’obstinent à chercher le bruit pour lui-même, à l’endroit exact où il devient indiscernable de son absence.

La paramétrisation en vitesse échappe à ce piège d’une tout autre manière. Le réseau n’y prédit plus la perturbation mais un champ de déplacement, une direction de transport entre la distribution bruitée et la donnée. Les auteurs prouvent qu’une telle paramétrisation satisfait une condition de gain borné : l’incertitude sur le niveau de bruit ne s’y amplifie pas, elle s’absorbe dans une dérive géométrique lisse. On ne cherche plus à isoler le parasite pour l’arracher d’un coup sec, on accompagne un mouvement continu vers les zones les plus organisées de l’espace. Il ne s’agit pas de conclure que la vitesse serait par nature supérieure à la prédiction du bruit ; la démonstration porte sur une famille déterminée de modèles, sous des hypothèses précises. Mais elle montre qu’une même incertitude produit des conséquences radicalement différentes selon la quantité que le réseau doit effectivement apprendre à prédire. Une variable peut être indispensable dans une représentation et parfaitement superflue dans une autre, sans que le phénomène représenté ait lui-même changé de nature.

Il y a là, malgré tout, une reprise du tourbillon lucrétien, à condition de ne pas la forcer. Le champ de vitesse ne fige rien : il décrit comment une trajectoire née du désordre se courbe, prend de la vitesse, s’enroule, jusqu’à dessiner un visage ou un paysage. La physique des flux que Serres retrouvait chez Lucrèce, physique de fleuves et de dérives plutôt que de solides et de lois rigides, trouve dans ce champ de vitesse une écriture mathématique qui n’existait pas au moment où Serres écrivait. Le monde naît toujours du vortex, de la rencontre entre un flux et une déviation locale. Ici, pourtant, le vortex se calcule, s’entraîne, se règle sur une fonction de perte. Je ne suis pas certain qu’on ait le droit d’appeler cela le même geste.

On serait tenté de conclure que le bruit a définitivement changé de statut, qu’il n’est plus le parasite mais la matrice, porteur en lui-même de la clarté du sens qu’on croyait devoir lui imposer de l’extérieur. Rien, dans les résultats des trois auteurs, n’autorise cette conclusion générale. Ce qu’ils démontrent est plus étroit et, précisément pour cela, plus solide : une paramétrisation particulière encaisse l’incertitude qu’une autre amplifie jusqu’à la catastrophe. Dans un problème d’ingénierie déterminé, la géométrie distingue les quantités qu’on peut se permettre d’oublier de celles qu’il faut continuer à mesurer avec soin. L’énergie marginale rend inutile l’horloge t. La métrique conforme, elle, reste entièrement à apprendre, et c’est elle qui porte tout le poids de la contrainte déplacée. L’autonomie ainsi obtenue ne soustrait le système à aucune de ses conditions de formation. Elle les rend seulement moins directement observables dans son fonctionnement à l’exécution. Ce qu’on ne fournit plus au moment de la génération a dû, par nécessité, être intégré pendant l’apprentissage. La disparition d’une commande explicite correspond à une intériorisation plus profonde des contraintes, non à leur suppression.

Le clinamen, chez Lucrèce, n’est jamais calculé. Il est la condition même d’un monde où le calcul deviendra un jour possible, un écart sans cause assignable, presque une liberté logée dans la matière avant que la matière n’ait de loi. La métrique conforme des modèles autonomes, elle, est apprise par descente de gradient sur des millions d’exemples ; elle a une cause, une fonction de perte, un jeu de données précis, une architecture qui la contraint. Le rapprochement entre les deux gestes tient à ceci, et seulement à ceci : dans les deux cas, un écart minimal rend possible une organisation là où l’ordre parfait resterait stérile. Mais l’un relève d’une physique spéculative de la contingence pure, l’autre d’une ingénierie de la variance entraînée. Confondre les deux revient à faire payer à une preuve mathématique une dette métaphysique qu’elle n’a jamais contractée.

L’autonomie, si l’on veut garder ce mot, apparaît alors comme une propriété relationnelle plutôt que comme une émancipation. Elle dépend conjointement de la distribution des données, de l’objectif d’apprentissage, de la paramétrisation choisie et de la géométrie de la dynamique générative. Elle ne désigne ni une indépendance absolue à l’égard de toute information extérieure, ni une capacité générale du système à se passer de contrainte. Un modèle dit autonome n’a pas cessé d’être déterminé par ce qui l’a entraîné ; il a seulement cessé d’avoir besoin qu’on le lui rappelle à chaque pas.

L’histoire du bruit, de la téléphonie transatlantique jusqu’à ces modèles sans horloge, ne dessine donc pas une progression continue qui irait de sa condamnation à sa réhabilitation, comme si l’on passait enfin, après un siècle d’erreur, à la vérité du bruit créateur. L’ingénierie du début du siècle traitait le bruit comme un ennemi à éliminer par le blindage et l’amplification. La première cybernétique en a fait le nom même de l’entropie, l’opposé structurel de toute information transmissible. Les modèles conditionnés par le temps ont hérité de cette dualité en injectant depuis l’extérieur, comme un opérateur de contrôle, la mesure exacte du désordre à chaque étape. Les modèles autonomes montrent qu’à un niveau de description suffisamment fin, cette mesure était déjà contenue dans la structure spatiale de la donnée bruitée elle-même. Il n’y avait pas besoin de la leur fournir depuis dehors. Il fallait seulement leur apprendre à la lire depuis dedans, ce qui n’est pas la même chose que de n’avoir plus besoin de la connaître.

La différence entre signal et bruit ne disparaît à aucun moment de cette histoire. Elle cesse simplement d’être une distinction que le système doit recevoir sous la forme d’un paramètre extérieur, injecté à chaque pas par un opérateur qui sait, lui, où l’on en est. Elle se loge désormais entre deux régimes d’un même espace géométrique, séparés par une métrique que le réseau construit à mesure qu’il apprend, précisément, à s’en passer à l’exécution. Le clinamen de Lucrèce fait naître un monde d’un écart sans auteur, sans cause, sans dette envers quoi que ce soit d’antérieur. La métrique conforme des modèles autonomes fait naître une image d’un écart appris, contraint, entièrement dérivé des données qui l’ont produit, et qui ne doit sa liberté apparente qu’à l’oubli, en aval, de tout ce travail en amont.

Reste alors une question que le rapprochement avec Serres permet de garder ouverte plutôt que de trancher. Si l’autonomie d’un système consiste à intérioriser les conditions de son propre fonctionnement au point de ne plus avoir besoin de les recevoir de l’extérieur, comment distinguer cette intériorisation d’un écart qui ne serait pas déjà tout entier contenu dans ces conditions mêmes ? Le clinamen désignait une déviation sans auteur, une brèche dans un système par ailleurs entièrement déterminé. Le modèle autonome produit des trajectoires sans horloge, mais non sans histoire : chaque geste qu’il fait sans qu’on le lui dise, il l’a appris qu’on le lui dise, avant. C’est entre ces deux absences, qui n’ont rien d’équivalent malgré la ressemblance de surface, que se joue peut-être toute la limite de la comparaison.


Noise long occupied, in the modern scientific tradition, the place of the adversary: an unwanted trace of matter, a corruption threatening the integrity of sense. This opposition shaped telecommunications engineering and fed certain readings of first-order cybernetics. Contemporary generative models present a different situation, but one should resist seeing a conversion in this. Noise has not changed its nature. What has changed is the point at which one stops needing to know that it is noise at all.

A transatlantic telephone line, in the early twentieth century, is never a transparent medium. Copper agitates thermally. The atmosphere interferes. The resistance of components dissipates the signal, distance weakens it. Crossing the United States coast to coast by voice means fighting the degradation of the signal-to-noise ratio. The solution, then, is to amplify. But every amplifier restores the signal while also enlarging the accumulated noise, until the hiss swallows the voice whole. Noise appears here as a material limit on the ideal of transmission: it is a reminder that a message never exists independently of the physical conditions of its circulation. A channel has a bandwidth, an available power, its own sources of interference. Information must work with these conditions, not abolish them.

Shannon, at Bell Labs, displaces the problem without resolving it. Information no longer designates the meaning of a message but a measurable quantity, derived from the uncertainty attached to its possibilities. Informational entropy is therefore not simply a disorder set term for term against an information conceived as order. It measures the uncertainty of a source, and establishes the limits of what a noisy channel can transmit. Noise, for its part, introduces uncertainty about the message actually received. The question becomes: how much information can cross this channel, despite that uncertainty.

In Wiener, the problem widens. Living organisms and regulated machines maintain certain forms of organization through exchanges of information and mechanisms of feedback; the struggle against disorganization becomes one of the motifs of a thought that brings physiology, machines, and communications together. But first-order cybernetics does not reduce to a will to isolate systems from their environment. Feedback, on the contrary, presupposes constant exchange with it. What matters is distinguishing the disturbances a system must resist from the variations it must respond to. A certain conception of noise nonetheless takes shape: it is what compromises the fidelity of a transmission or the stability of a regulation, what the system must limit, measure, correct. Even once it becomes a mathematical object, noise remains defined relative to an operation whose success it threatens.

This relativity deserves attention. A fluctuation is not noise by nature. It becomes noise with respect to a signal, a measuring device, a given objective. What disturbs one transmission may constitute information for another observer, positioned elsewhere in the apparatus. The opposition between signal and noise thus depends on the operations that distinguish them, not on a difference of substance. It is precisely this distinction that recent generative models displace, without ever erasing it.

Michel Serres finds in Lucretius an entirely different way of thinking about disturbance. In the atomist account of De rerum natura, atoms fall through the void. If their trajectories remained perfectly parallel, no encounter would ever occur, no body would form, no world would be born. This absolute order is equivalent to death. An atom must swerve imperceptibly from its course for collisions to become possible. The clinamen names this minimal deviation, whose place and moment can be assigned to nothing. It does not correct a defective motion. It opens events that the regularity of the initial motion excluded by construction. Without it, the parallel fall of atoms would remain sterile for eternity.

In his reading of the poem, Serres reinterprets atomism through the notions of flow, turbulence, and the formation of vortices. The deviation is no longer an anomaly within a pre-existing order: it takes part in the very constitution of forms. Laminar motion gives way to turbulence, trajectories cross, local organizations become possible where nothing had yet been differentiated. Noise — the noise, the first tumult of the agitated sea from which a form emerges — becomes the condition of every emergence rather than its threat. Order there is never more than a temporary island, sculpted within its own dynamic, never preserved from it.

It would be misleading, though, to identify the clinamen with statistical noise without remainder. The Lucretian deviation belongs to a speculative physics, and in Lucretius it engages the question of freedom: nothing causes it, nothing programs it, it is the breach through which atomist determinism lets something other than itself slip free. Telecommunications noise, by contrast, is a disturbance measurable relative to a given signal, produced by perfectly identifiable physical causes — thermal agitation, interference, attenuation. The two notions share neither status nor function. Their proximity nonetheless brings out a question that crosses both domains: can a variation judged undesirable at one scale become, at another, a condition of formation? In Serres, this question forbids conceiving order as a first state to which disorder would then be added from outside. Forms emerge within movements from which they are never entirely separable.

What remains is to ask what such an intuition can offer the analysis of a contemporary technical system. The analogy would be a poor one if it amounted to saying that generative models produce images out of noise the way Lucretian worlds arise from atomic encounters; that comparison costs nothing and proves nothing. It becomes more interesting once it is made to answer a precise question: what information is actually necessary to organize a trajectory, and what can instead be deduced from the medium it crosses?

Classical diffusion models rest on a process that progressively turns a datum into noise, then learns to traverse the reverse path. In the usual architectures, the network receives at every step an explicit indication of the noise level, a temporal parameter t that measures no physical time but situates the observation within the degradation process, letting the model adapt its operation to the data’s exact state. An almost intact image does not call for the same treatment as an observation in which the initial structures are almost entirely concealed. This clock is information external to the noisy observation itself; it tells the network where it stands, and one might think this indication indispensable, since a single noisy observation could in principle correspond to several possible combinations of data and noise level.

It is precisely this presumed necessity that Sahraee-Ardakan, Delbracio, and Milanfar call into question. Their study of autonomous generative models shows that a network can learn, under a determined set of conditions, to generate data without ever receiving this explicit temporal conditioning. This is not simply a matter of removing a variable and hoping the network manages regardless. The absence of a clock changes the very way one must understand the field the network learns, and the geometric landscape within which generation occurs. To say a model functions without knowing t does not mean it is ignorant of the statistical properties of the various noise levels: those properties continue to act, through the distribution of training examples, the learning objective, and the field that results from them. Time ceases to be an explicit input. The constraints it once corresponded to do not disappear for all that. They change location.

It is this displacement that the notion of marginal energy formalizes. Let u be a noisy datum whose distribution depends on a noise level t. Once this level is no longer known, one integrates the conditional distributions over the full range of possible levels, weighted by their prior distribution, yielding a marginal density p(u), to which corresponds an energy E_marg(u) = −log p(u). This landscape is no longer an instantaneous cross-section: it integrates every noise level at once into a single distribution, so that each point in the space carries an energy that accounts for the whole range of ways it might have been produced. The model no longer receives a temporal position telling it which operation to perform; its generative field follows from the geometry of this marginal distribution, and the dynamics are understood as a Riemannian gradient flow across this landscape. The word matters: Riemannian, not Euclidean. A local metric intervenes in the relation between the gradient of the energy and the motion of generation, and this metric deforms according to where one stands. Two regions with comparable gradients therefore do not necessarily produce identical displacements.

One should not conclude from this that the network discovers a geometry independent of its training, as though stumbling upon it. The effective metric results from the mathematical relations between the marginal distribution, the learned field, and the training objective; it expresses the constraints the model had to incorporate in order to act without temporal indication. The clock was not removed without a cost. Its role was redistributed into the energy landscape itself, and into the metric that allows it to be traversed without getting lost.

This redistribution meets a decisive difficulty near the data manifold. As the noise level tends toward zero, certain quantities tied to the energy landscape become singular: the energy well deepens as 1/t^p, toward theoretical infinity, while an ordinary neural network, bounded by construction, produces outputs whose amplitude stays finite. How can a learned field, with values necessarily bounded, correspond to a descent across a landscape whose gradients become arbitrarily large? This is precisely the failure that plagued the first attempts at energy-based models, and that seemed to condemn any clockless approach outright.

The relative-energy decomposition the three authors propose shows that the field actually learned by the network never confronts this singularity as such. It implicitly incorporates a local conformal metric, a scale factor that varies point by point, whose effect is to neutralize exactly the geometric singularity of the raw landscape. The infinitely deep well closes into a stable attractor. One must distinguish, at exactly this point, the shape of the energy from the geometry by which it is traversed: the first diverges, the second absorbs the divergence before it ever reaches the network. The field need not produce an exploding gradient; the effective metric lets it remain tractable precisely where the Euclidean description would fail. What seemed impossible when landscape and motion were considered separately becomes possible the moment their relation is examined.

This compatibility, however, does not hold for every way of parameterizing the network. In noise parameterization, the oldest, and also the most widespread in the earliest formulations of probabilistic diffusion, the network learns to predict directly the perturbation added to the datum. This formulation becomes unstable in deterministic autonomous models: the authors identify a Jensen gap that acts as a high-gain amplifier for any estimation error, so that as t tends toward zero, with no clock informing the network, the smallest imprecision multiplies until it diverges. This is what explains the catastrophic failure of deterministic blind models that persist in chasing the noise itself, exactly where it becomes indistinguishable from its own absence.

Velocity parameterization escapes this trap by an entirely different route. The network no longer predicts the perturbation but a displacement field, a direction of transport between the noisy distribution and the data. The authors prove that such a parameterization satisfies a bounded-gain condition: uncertainty about the noise level does not amplify there, it is absorbed into a smooth geometric drift. One no longer tries to isolate the parasite in order to tear it out in one stroke; one accompanies a continuous motion toward the most organized regions of the space. This is not to conclude that velocity would be inherently superior to noise prediction; the proof concerns a determined family of models, under precise hypotheses. But it shows that the same uncertainty produces radically different consequences depending on the quantity the network must actually learn to predict. A variable can be indispensable in one representation and entirely superfluous in another, without the phenomenon represented having itself changed in nature.

There is, in all this, something of the Lucretian vortex returning, provided one does not force it. The velocity field freezes nothing: it describes how a trajectory born of disorder curves, gathers speed, coils, until it traces a face or a landscape. The physics of flows that Serres found in Lucretius, a physics of rivers and drifts rather than solids and rigid laws, finds in this velocity field a mathematical writing that did not exist when Serres was writing. The world is still born from the vortex, from the encounter between a flow and a local deviation. Here, though, the vortex is computed, trained, tuned against a loss function. I am not certain one has the right to call this the same gesture.

One might be tempted to conclude that noise has definitively changed status, that it is no longer the parasite but the matrix, carrying within itself the clarity of sense one once thought had to be imposed on it from outside. Nothing in the three authors’ results licenses this general conclusion. What they demonstrate is narrower, and precisely for that reason, sturdier: one particular parameterization absorbs an uncertainty that another amplifies to catastrophe. Within a determined engineering problem, geometry distinguishes the quantities one may afford to forget from those one must keep measuring carefully. Marginal energy makes the clock t unnecessary. The conformal metric, though, still has to be learned entirely, and it is this metric that bears the full weight of the displaced constraint. The autonomy thereby obtained removes the system from none of its conditions of formation. It only makes them less directly observable in its behavior at runtime. What is no longer supplied at the moment of generation had to be, of necessity, absorbed during training. The disappearance of an explicit command corresponds to a deeper internalization of constraints, not to their suppression.

The clinamen, in Lucretius, is never computed. It is the condition of a world in which computation will one day become possible, a deviation with no assignable cause, almost a freedom lodged in matter before matter has any law. The conformal metric of autonomous models, by contrast, is learned by gradient descent over millions of examples; it has a cause, a loss function, a specific dataset, an architecture that constrains it. The kinship between the two gestures holds to this, and only this: in both cases, a minimal deviation makes an organization possible where perfect order would remain sterile. But one belongs to a speculative physics of pure contingency, the other to an engineering of trained variance. To conflate the two is to charge a mathematical proof with a metaphysical debt it never incurred.

Autonomy, if one wants to keep the word, appears then as a relational property rather than an emancipation. It depends jointly on the distribution of the data, the training objective, the chosen parameterization, and the geometry of the generative dynamics. It designates neither absolute independence from every external piece of information, nor a general capacity of the system to do without constraint. A so-called autonomous model has not stopped being determined by what trained it; it has only stopped needing to be reminded of it at every step.

The history of noise, from the transatlantic telephone line to these clockless models, does not therefore trace a continuous progression running from condemnation to rehabilitation, as though one were finally arriving, after a century of error, at the truth of creative noise. Early-century engineering treated noise as an enemy to be eliminated through shielding and amplification. First-order cybernetics made it the very name of entropy, the structural opposite of all transmissible information. Time-conditioned models inherited this dualism by injecting, from outside, like a control operator, the exact measure of disorder at every step. Autonomous models show that, at a sufficiently fine level of description, this measure was already contained within the spatial structure of the noisy data itself. There was no need to supply it from outside. It only had to be learned from within — which is not the same thing as no longer needing to know it.

The difference between signal and noise disappears at no point in this history. It merely ceases to be a distinction the system must receive in the form of an external parameter, injected at every step by an operator who alone knows where things stand. It now sits between two regimes of a single geometric space, separated by a metric the network builds precisely as it learns to do without it at runtime. The Lucretian clinamen brings a world into being out of a deviation with no author, no cause, no debt to anything prior. The conformal metric of autonomous models brings an image into being out of a deviation that is learned, constrained, entirely derived from the data that produced it — one that owes its apparent freedom only to the forgetting, downstream, of all that work upstream.

What remains, then, is a question that the comparison with Serres allows one to keep open rather than settle. If a system’s autonomy consists in internalizing the conditions of its own functioning to the point of no longer needing to receive them from outside, how is this internalization to be distinguished from a deviation that was not already wholly contained within those very conditions? The clinamen named a deviation with no author, a breach in a system otherwise entirely determined. The autonomous model produces trajectories with no clock, but not without a history: every gesture it makes without being told, it learned to make, from having once been told. It is between these two absences, which have nothing equivalent about them despite their surface resemblance, that the whole limit of the comparison is perhaps decided.