Open Source
Offene Modelle, Gewichte, Bibliotheken und Releases. 11 Beiträge, jeder mit seiner Quellenlage.
Hugging Face veröffentlicht NeoMME-Encoder für mehrsprachige multimodale Suche
Die Modellfamilie umfasst Varianten mit 260 Millionen und 800 Millionen Parametern. Checkpoints stehen laut Hugging Face unter Apache 2.0 bereit; für die Dokumentensuche gibt es NeoMME-Retriever.
llama.cpp b10844 erweitert Vulkan-Backend um DeepSeek-V4-Hyper-Connection-Operationen
Die Veröffentlichung führt drei fusionierte Operationen für DeepSeek-V4 auf und stellt Vulkan-Binärdateien für Windows sowie Ubuntu auf x64 und Arm64 bereit.
llama.cpp b10829 korrigiert GDN-Normalisierung auf rsqrt-Formel
Das Release stellt die q/k-Normalisierung für Gated Delta Net auf die von flash-linear-attention verwendete L2-Norm-Formel um und liefert Binärpakete für mehrere Plattformen.
llama.cpp b10839 ergänzt Vulkan-GET_ROWS-Unterstützung für ausgerichtete Typen
Die Release-Notizen nennen eine Änderung, die Assertion-Abstürze bei versetzten Views beheben soll, und melden 223 bestandene GET_ROWS-Tests auf einer GeForce RTX 5060 Ti.
Sentence Transformers 6.0 integriert Multi-Vector-Modelle für Late-Interaction-Retrieval
Laut Hugging Face sind die zuvor über PyLate verfügbaren Late-Interaction-Funktionen nun Teil von Sentence Transformers. Die Version bringt Token-basierte Einbettungen, MaxSim-Bewertung sowie Workflows für Indexierung, Reranking und visuelle Dokumentensuche zusammen.
vLLM führt GitHub-Release-Eintrag „v0.28.1rc0“
Für den Release Candidate existiert ein GitHub-Release-Datensatz vom 27. August. Die vorliegenden Daten enthalten jedoch keine versionsspezifischen Änderungsnotizen.
Hugging Face stellt Leitfaden für graphbasierte AI-Workflows in Gradio vor
Der offizielle Beitrag beschreibt gr.Workflow als Oberfläche für typisierte, ausführbare Knoten-Graphen, deren Ausgaben sich als REST-Endpunkte bereitstellen und in Hugging Face Spaces deployen lassen.
Hugging Face veröffentlicht Transformers v5.13.0 mit neuen Modellintegrationen und API-Änderungen
Die Version ergänzt Unterstützung für mehrere Sprach-, Sprachverarbeitungs- und multimodale Modelle. Sie enthält zudem Änderungen, die Nutzer interner Modeling-APIs sowie frühere Gemma-3/4-Ergebnisse betreffen können.
Liquid AI veröffentlicht LFM2.5-DSpark-Entwurfsmodelle für spekulatives Decoding
Die auf Hugging Face angekündigten Checkpoints sollen mit llama.cpp und SGLang nutzbar sein. Liquid AI berichtet je nach Modell und Testumgebung über geringere Latenzen und höheren Durchsatz; unabhängige Benchmarks liegen im vorliegenden Material nicht vor.
Hugging Face Transformers 5.16.0 bringt neue Modelle und DTensor-basiertes Tensor Parallelism
Version 5.16.0 erweitert die Modellunterstützung, ersetzt das bisherige Tensor-Parallel-Backend und fügt eine einfache Pipeline-Parallel-Inferenz sowie NVFP4-Quantisierung hinzu. Kurz darauf folgte 5.16.1 mit GLM-5.3-Flash und Kompatibilitätskorrekturen.
llama.cpp b10763 aktiviert „preserve_reasoning“ standardmäßig
Die neue Version schaltet das Chat-Template-Argument in common und server ein, sofern es nicht ausdrücklich gesetzt wird. Zugleich protokolliert der Server den wirksamen Zustand und ein bisheriger Konfigurationsweg wird als veraltet markiert.