Today’s frontier report
Research Pool → Jev → Edition
3qk7 · AI LOCAL LABS TECHNICAL SCOUTING

AI FRONTIER

Signals worth understanding before they become obvious.

2026-10-04
01
watchresearchcost collapse

Formaterkennende Fusion für schnelles FP4-Pretraining

Die Arbeit stellt formaterkennende Fusion vor, die jeden Quantisierungsproduzenten mit seiner Skalendomäne und seinem Konsumentenlayout für natives mxfp, globales nvfp und kooperativ-thread-array-lokales nvfp gemeinsam entwirft. Beim Pretraining von Llama-3-Familie 8B über 160 Milliarden Token erreicht die schnellste e...

  • In abgestimmten Messungen auf demselben Beschleuniger erreichen bfloat16 und Transformer Engine nvfp 18,8K bzw. 27,6K tokens/s/GPU, während die schnellste eigene Route 37,9K tokens/s/GPU erreicht.
  • Diese mxfp-Konfiguration endet 2,11 % über dem Trainingsverlust-Endpunkt des reinen bfloat16.
  • Ein Transformer-Engine-Rezept mit vier abschließenden bfloat16-Blöcken endet 0,87 % über bfloat16 bei 27,1K tokens/s/GPU.

Die Gewinne beim FP4-Pretraining hängen gemeinsam vom Skalenvertrag, Operanden und Ausführungspfad ab, nicht allein von Tensor Cores.

arXiv cs.LG
02
testdeveloperopen source unlock

Meta veröffentlicht ESP32-SDK, damit jeder Geräte für den KI-Agenten Muse selbst bauen kann

Meta hat ein SDK für ESP32 veröffentlicht, mit dem jeder Hardware bauen kann, die mit dem KI-Agenten Muse kompatibel ist.

  • Meta hat ein SDK für ESP32 veröffentlicht.
  • Das SDK soll es jedem ermöglichen, Geräte zu bauen, die mit dem KI-Agenten Muse kompatibel sind.

ESP32-Entwickler können Muse-kompatible Hardware nun auf Basis eines offiziellen SDK bauen, statt auf fertige Geräte von Anbietern zu warten.

ビジネス+IT
03
watchmodelsnew architecture

OpenAI stellt GPT-6 Sol und Luna vor

OpenAI hat GPT-6 Sol und Luna angekündigt, zwei neue Modelle seiner GPT-6-Reihe.

  • OpenAI stellte neue Modelle namens GPT-6 Sol und Luna vor.
  • Die Ankündigung erfolgte über den offiziellen Kanal von OpenAI.

AI-Entwickler sollten GPT-6 Sol und Luna beobachten, um ihre Eignung für eigene Anwendungen zu prüfen.

OpenAI
04
testcreativeopen source unlock

Open TTS Leaderboard: Skalierbare Bewertung für mehrsprachige Text-to-Speech und Voice Cloning

Hugging Face hat das Open TTS Leaderboard gestartet, das Open-Source-Modelle für mehrsprachiges TTS und Voice Cloning mit objektiven Metriken bewertet: WER/CER über Qwen3 ASR, RTFx und TTFA auf einer H200 GPU sowie Kosinus-Sprecherähnlichkeit (SIM) aus WavLM-Embeddings.

  • Stand 30. September 2026 sind mehr als 8K TTS-Modelle auf dem Hugging Face Hub verfügbar.
  • Stand 30. September 2026 sind nur 16 der 92 Modelle bei Artificial Analysis Open-Weights.
  • Objektive Metriken verkürzen die Bewertung eines Modells von einigen Wochen Stimmsammlung auf einige Stunden.
  • Die Standardansicht rankt nach makro-gemitteltem WER auf den englischen Splits von Seed TTS Eval und CV3 Eval (zero shot), angeführt von hexgrad/Kokoro-82M, Supertone/supertonic-3 und fishaudio/s2-pro.

Für Teams, die Sprachprodukte bauen, können diese reproduzierbaren objektiven Metriken viele offene TTS-Modelle in Stunden vorfiltern, doch Natürlichkeit und Hörpräferenz erfordern weiterhin menschliche Abstimmungen.

Hugging Face Blog
05
testcreativeincremental

Lightricks veröffentlicht LTX-2.5 als Open-Weights-Modell für Video, Audio und Weltsimulation

Lightricks/LTX-2.5 ist ein Modell mit offenen Gewichten, das aus Text-, Bild- und Videoeingaben synchronisiertes Video und Audio erzeugt und Self-Hosting unterstützt. Es ergänzt native Multishot-Generierung, einen Diffusions-Videodecoder, einen Gemma-4-12B-Textencoder und einen optionalen Dauer-Prädiktor.

  • Die Modellkarte nennt 1.629.984 Downloads im letzten Monat und 6,12k Likes.
  • Es wird als aufgeteiltes, Comfy-konformes Paket mit einer .safetensors-Datei pro Komponente ausgeliefert, einschließlich destillierter und vollständiger 22B-DiT-Checkpoints.
  • Der destillierte DiT nutzt einen festen 8-Schritt-Zeitplan mit CFG=1; num_frames muss num_frames % 8 == 1 erfüllen und Breite und Höhe müssen durch 32 teilbar sein.
  • Unter 10 Mio. USD Jahresumsatz ist kommerzielle und Produktionsnutzung unter der LTX-2.x Community License kostenlos; über 10 Mio. USD ist eine kostenpflichtige kommerzielle Nutzungsvereinbarung erforderlich.

Für Entwickler bietet LTX-2.5 einen selbst hostbaren Open-Weights-Weg zur synchronisierten Video- und Audiogenerierung, mit aufgeteilten Checkpoints und int8- oder NVFP4-quantisierten Varianten für unterschiedliche VRAM-Budgets.

Hugging Face Trending
06
watchresearchincremental

Bedeutet „very likely“ „unsicher“? Wie LLMs bei der sprachlichen Unsicherheitsquantifizierung von Menschen abweichen

Die Arbeit erstellt einen Korpus menschlicher Unsicherheitsmarker aus der Psychologie- und Entscheidungswissenschaftsliteratur und vergleicht LLMs damit; sie berichtet, dass LLMs verbale Unsicherheit mit numerischen Niveaus kodieren, die sich deutlich von denen von Menschen unterscheiden. Die Autoren führen einen optim...

  • Autoren sind Jinhao Duan, Zicheng Liu, Zijie Liu, Kaidi Xu und Tianlong Chen; eingereicht am 6. September 2026 und bei ICML 2026 angenommen.
  • Die Autoren erstellen einen Korpus menschlicher Unsicherheitsmarker aus der Psychologie- und Entscheidungswissenschaftsliteratur und vergleichen LLMs damit.
  • Die Arbeit berichtet, dass LLMs verbale Unsicherheit mit numerischen Niveaus kodieren, die sich deutlich von denen von Menschen unterscheiden.
  • Der vorgeschlagene Algorithmus passt eine Marker-Unsicherheits-Zuordnung an, um die empirische Korrektheit bestmöglich zu erklären, statt Unsicherheit durch wiederholtes Sampling zu schätzen.

Teams, die unsicherheitsbewusste Systeme bauen, sollten prüfen, wie LLMs Marker wie „likely“ und „possible“ numerisch interpretieren, statt eine Übereinstimmung mit menschlichen Urteilen anzunehmen.

arXiv cs.LG
07
watchresearchnew architecture

Schnelle polynomiale Transzendenten für LLMs

Die Arbeit testet das Ersetzen nativer sigmoid-, tanh- und SiLU-Funktionen durch kurze Polynomprogramme in LLMs und berichtet von Durchsatzsteigerungen pro Trainingsschritt bei GB200-Integrationsaufgaben sowie Trainingsverlustdifferenzen nahe 100 Milliarden Token.

  • In einem isolierten FP16-Sweep verbessern gepackte FMA-Programme L2-residente Arbeitssätze um 1,19–2,19x und HBM-residente Arbeitssätze um 1,00–1,70x.
  • Bei vier GB200-Integrationsaufgaben verbessern die Substitutionen dense SiLU, tanh-softcapped attention und routed-expert SwiGLU den vollständigen Trainingsschrittdurchsatz um 2,7 %, 2,9 % bzw. 8,0 %.
  • Die sigmoid-attention-Substitution verbessert den vollständigen Attention-Vorwärtslauf um 7,4 % und den vollständigen GPU-Schritt um 0,3 %.
  • Bei üblichen Horizonten nahe 100 Milliarden Token reichen die finalen geglätteten Trainingsverlustdifferenzen (Polynom minus nativ) über die vier Aufgaben von -0,107 bis +0,079.

Für KI-Entwickler zeigt dies, dass Polynomersetzungen niedrigen Grades in BF16 für SFU-Transzendenten auf GPUs der Blackwell-Klasse messbare Trainingsdurchsatzgewinne bringen können, der Verlusteinfluss jedoch pro Aufgabe validiert werden m...

arXiv cs.LG
08
watchresearchincremental

Wie weit ist Adam vom natürlichen Gradientenabstieg entfernt?

Die Arbeit behandelt Adams vollständige Update-Regel einschließlich Momentum als diagonale empirische Fisher-Approximation, die diagonaler Trunkierung, empirischer Label-Substitution und zeitlicher Verzögerung unterliegt, und misst Adams geometrische Abweichung vom echten NGD mit der skaleninvarianten γ(Δθ)-Metrik über...

  • Die Studie umfasst vier Verlustlandschaften: gut konditionierte lineare Regression, schlecht konditionierte lineare Regression, logistische Regression und ein nicht-konvexes kleines neuronales Netz.
  • Die Abweichung bleibt in gut konditionierten Einstellungen gering, steigt jedoch unter schlechter Konditionierung deutlich an und erreicht im neuronalen Netz Fehlausrichtungen von etwa 10^3.
  • Höhere geometrische Drift korreliert mit langsamerer anfänglicher Optimierung, verschlechtert aber nicht die endgültige Minimierung des Ziels; Adam erreicht durchweg niedrige Verluste.
  • Der verbesserte empirische Fisher (iEF) folgt stabileren Pfaden als der standardmäßige empirische Fisher (EF), der häufig oszilliert oder divergiert.

Für Entwickler deutet dies darauf hin, dass Adams praktische Optimierungsleistung aus einem Gleichgewicht struktureller Approximationsfehler und Momentum-Glättung stammen könnte, statt aus einer engen Verfolgung des natürlichen Gradientenpf...

arXiv cs.LG