OpenAI startet GPT-6 Astra zunächst begrenzt; Altman nennt Rollout „chaotisch“
Laut einem Bericht von The Verge erhielten zunächst bestimmte Unternehmenskunden Zugang zu GPT-6 Astra, während zahlende ChatGPT-Nutzer warteten. Einen verbindlichen Termin für die breitere Freischaltung nannte Sam Altman nicht.
Modelle & ForschungMultiverse räumt ungleichen Trainingsstand hinter QAH-Benchmarkvergleich ein
Ein Hugging-Face-Beitrag stellt Quantization-Aware Healing für ein komprimiertes, 4-Bit-quantisiertes Sprachmodell vor. Die dort beworbenen Vorteile gegenüber einem bfloat16-Modell lassen sich nach eigener Einräumung jedoch nicht allein der Quantisierungs-Methodik zuschreiben.
Weiter im Thema
Nach Beleglage und ZeitNVIDIA kündigt Übernahme von Hugging Face für 12,93 Milliarden US-Dollar an
Laut einem NVIDIA-Blogbeitrag soll Hugging Face nach der vereinbarten Übernahme eine offene Plattform bleiben und weiterhin Modelle, Clouds sowie Beschleuniger verschiedener Anbieter unterstützen.
Hugging Face stellt mit funes eine lokale Erinnerungsschicht für Coding-Agenten vor
Das Open-Source-Werkzeug indexiert lokale Sitzungsprotokolle, kann sie optional in private Hugging-Face-Datensätze synchronisieren und soll den Abruf früherer Agentenarbeit mit Quellenangaben ermöglichen.
Hugging Face veröffentlicht NeoMME-Encoder für mehrsprachige multimodale Suche
Die Modellfamilie umfasst Varianten mit 260 Millionen und 800 Millionen Parametern. Checkpoints stehen laut Hugging Face unter Apache 2.0 bereit; für die Dokumentensuche gibt es NeoMME-Retriever.
Vollständiger Schaltplan des männlichen Fruchtfliegen-ZNS veröffentlicht
Google Research und HHMI Janelia berichten über eine in „Cell“ veröffentlichte Karte mit mehr als 166.000 Neuronen und 125 Millionen synaptischen Verbindungen.
llama.cpp b10844 erweitert Vulkan-Backend um DeepSeek-V4-Hyper-Connection-Operationen
Die Veröffentlichung führt drei fusionierte Operationen für DeepSeek-V4 auf und stellt Vulkan-Binärdateien für Windows sowie Ubuntu auf x64 und Arm64 bereit.
SharedSAE-Preprint schlägt gemeinsames Merkmalswörterbuch für mehrere Sprachmodelle vor
Die Autoren berichten bei vier Basismodellen im 1B-Bereich über nahezu erhaltene Rekonstruktionsleistung, stärkere modellübergreifende Korrelationen und wiederverwendbare latente Beschreibungen. Die Ergebnisse stammen aus einem nicht begutachteten arXiv-Preprint.
ArXiv-Preprint schlägt Fourier-Hilfskopf für latente Weltmodelle vor
Die Autoren berichten, dass eine zusätzliche Trainingsaufsicht die Planung in dynamischen und datenarmen Versuchsumgebungen verbessern könne. Die Ergebnisse stammen aus einem noch nicht begutachteten Preprint.
Open Source
Alle 11 Beiträge →llama.cpp b10829 korrigiert GDN-Normalisierung auf rsqrt-Formel
Das Release stellt die q/k-Normalisierung für Gated Delta Net auf die von flash-linear-attention verwendete L2-Norm-Formel um und liefert Binärpakete für mehrere Plattformen.
llama.cpp b10839 ergänzt Vulkan-GET_ROWS-Unterstützung für ausgerichtete Typen
Die Release-Notizen nennen eine Änderung, die Assertion-Abstürze bei versetzten Views beheben soll, und melden 223 bestandene GET_ROWS-Tests auf einer GeForce RTX 5060 Ti.
Sentence Transformers 6.0 integriert Multi-Vector-Modelle für Late-Interaction-Retrieval
Laut Hugging Face sind die zuvor über PyLate verfügbaren Late-Interaction-Funktionen nun Teil von Sentence Transformers. Die Version bringt Token-basierte Einbettungen, MaxSim-Bewertung sowie Workflows für Indexierung, Reranking und visuelle Dokumentensuche zusammen.
Infrastruktur & Compute
Alle 13 Beiträge →NVIDIA kündigt PAIR-Beta und RTX-Spark-Windows-PCs für Oktober an
Auf der IFA 2026 stellt NVIDIA lokale KI-Integrationen und Optimierungen für Inferenz vor. Der offene Netzwerk-Router NVIDIA PAIR ist als Beta für Windows, macOS und Linux verfügbar; Lenovo- und Acer-Systeme mit RTX Spark sollen im Oktober folgen.
NVIDIA kündigt 28 weitere Spiele für GeForce NOW im September 2026 an
Laut einem NVIDIA-Blogbeitrag sollen im September 28 weitere Titel zu GeForce NOW kommen. Genannt werden NBA 2K27 mit DLSS 5, The Blood of Dawnwalker und Onimusha: Way of the Sword.
NVIDIA beschreibt NVLink Fusion als Plattform für kundenspezifische XPUs in KI-Rechenzentren
In einem Blogbeitrag stellt NVIDIA NVLink Fusion als Infrastruktur vor, die kundenspezifische Beschleuniger mit dem eigenen KI-Stack verbinden soll. Die Angaben zu Leistung, Effizienz und Skalierung stammen ausschließlich von NVIDIA.
Modelle & Forschung
Alle 34 Beiträge →Preprint: 4-Bit-Speicherung verschlechterte Fehler eines festen GRU-Modells deutlich
Eine neue arXiv-Vorabveröffentlichung untersucht, wie das Zurückschreiben quantisierter rekurrenter Zustände die Genauigkeit eines Modells für Fluoreszenz-Lebensdauerbildgebung beeinflusst. Die berichteten Gegenmaßnahmen arbeiteten ohne erneutes Training, sind aber noch nicht unabhängig geprüft.
Preprint untersucht getrennte Rollen von Attention und rekurrentem Zustand in hybriden Sprachmodellen
Eine neue arXiv-Arbeit berichtet auf Basis von Eingriffen in Zwischenspeicher von Qwen3.5 und Falcon-H1: Der KV-Cache trug vor allem exakten Abruf, während der rekurrente Zustand Ausgabesprache und Persona stärker bewahrte.
Modelle & ForschungStudie: Letzte Encoder-Stufe ist bei zwei ASR-Modellen eine kritische Grenze
Ein arXiv-Preprint berichtet, dass das Umgehen des letzten Encoder-Blocks bei zwei Conformer-Large-Spracherkennern fast stets zu abweichenden Ausgaben führte. Die Autoren sehen darin eine mechanistische Voraussetzung für Halluzinationen – nicht deren vollständige Erklärung.
Produkte & Anwendungen
Alle 21 Beiträge →Google berichtet über AMIE-Studie zu klinischen Video-Sprechstunden – ausschließlich in Simulationen
In 300 standardisierten Konsultationen mit geschulten Patientendarstellern bewerteten Prüfärzte Googles medizinisches KI-System AMIE (Video) bei mehreren Kompetenzen ähnlich wie Hausärzte. Aussagen über einen Nutzen mit realen Patienten sind daraus jedoch noch nicht möglich.
ALTK-Evolve berichtet modellabhängige Vorteile von Agenten-Gedächtnis im AppWorld-Test
Ein Beitrag im Hugging-Face-Blog beschreibt eine Methode, die Verhaltensleitlinien aus früheren Agenten-Trajektorien gewinnt und zur Laufzeit einspielt. Die berichteten Resultate auf AppWorld variieren deutlich je nach Modell; unabhängige Bestätigung liegt nicht vor.
Hugging Face beschreibt hybride Sucharchitektur für Papers with Code
Die Plattform kombiniert PostgreSQL-Volltextsuche, pgvector-basierte semantische Suche und eine Fallback-Logik. Dokument-Einbettungen werden überwiegend außerhalb des Anfragepfads erzeugt.