Connect with us

Entwicklung & Code

OpenCV 5.0 bringt LLMs in die Computer-Vision-Bibliothek


Mit OpenCV 5.0 ist eine neue Hauptversion der weit verbreiteten Computer-Vision-Bibliothek erschienen. Kern des Releases ist eine komplett neu entwickelte Deep-Learning-Engine (DNN). Sie unterstützt deutlich mehr ONNX-Modelle als bisher, führt moderne Transformer-Architekturen effizienter aus und verarbeitet erstmals auch Sprachmodelle (LLMs) und Vision-Language-Modelle (VLMs) direkt in OpenCV. Außerdem modernisieren die Entwickler den Kern der Bibliothek, bauen die Hardwarebeschleunigung aus und erweitern die 3D-Funktionen.

Weiterlesen nach der Anzeige

OpenCV (Open Source Computer Vision Library) zählt zu den wichtigsten Open-Source-Bibliotheken für die Bildverarbeitung und Computer Vision. Sie kommt unter anderem in der Robotik, der Industrieautomation, der Medizintechnik, in AR/VR-Anwendungen und in Embedded-Systemen zum Einsatz. Die Bibliothek bietet zahlreiche Algorithmen für Bilderkennung, Objekterkennung, Kalibrierung, Tracking und 3D-Rekonstruktion.

Die wichtigste Neuerung ist die überarbeitete DNN-Engine. Nach Angaben des Projekts steigt die Unterstützung für ONNX-Operatoren von rund 22 Prozent in der 4.x-Reihe auf über 80 Prozent. ONNX (Open Neural Network Exchange) hat sich als verbreitetes Austauschformat für KI-Modelle etabliert. Bisher scheiterte der Import moderner Modelle in OpenCV oft an fehlenden Operatoren oder an Einschränkungen bei dynamischen Eingabegrößen.

Die neue Engine setzt auf eine graphbasierte Ausführung: Sie verarbeitet Modelle nicht mehr als einfache Folge von Schichten, sondern analysiert sie als Berechnungsgraph. Das erlaubt Optimierungen wie Shape Inference, Constant Folding und Operator Fusion. Neu sind außerdem die Unterstützung dynamischer Shapes, von Kontrollfluss-Konstrukten wie If– und Loop-Blöcken sowie von Quantisierungsgraphen.

Für aktuelle KI-Modelle besonders relevant ist die Attention Fusion: Die Engine erkennt typische Transformer-Muster und fasst mehrere Operationen zu einer einzigen, optimierten Berechnung zusammen. Das soll moderne Transformer-Modelle beschleunigen und den Speicherbedarf senken. Details zur neuen Engine beschreibt das Projekt im Überblick zu OpenCV 5 auf der Projektseite.

Hinzu kommt die Integration von Sprach- und multimodalen Modellen. Dafür bringt OpenCV 5 einen eigenen Tokenizer und einen KV-Cache für die autoregressive Textgenerierung mit. Unterstützt werden unter anderem die Modellfamilien Qwen 2.5, Gemma 3 und PaliGemma (partiell). So deckt OpenCV nicht mehr nur klassische Bildverarbeitung ab, sondern auch Vision-Language-Szenarien – etwa, wenn ein Modell ein Bild analysiert und anschließend in natürlicher Sprache beschreibt.

Weiterlesen nach der Anzeige

Um die Umstellung bestehender Anwendungen zu erleichtern, bleibt die bisherige DNN-Engine erhalten. OpenCV 5 stellt damit drei Ausführungsvarianten bereit: die neue Engine, die klassische Engine und optional ONNX Runtime. Anwendungen können je nach Bedarf zwischen den Varianten wechseln, ohne ihre DNN-API anzupassen. Welche Engine zum Einsatz kommt, lässt sich beim Laden eines Modells über einen Parameter aus dem Enum cv::dnn::EngineType steuern; standardmäßig wählt ENGINE_AUTO automatisch die passende Variante.

Auch beim Feature-Matching setzt OpenCV stärker auf Deep Learning. Das neue Modul Features löst das bisherige Features2D ab und ergänzt klassische Verfahren wie SIFT oder ORB um neuronale Alternativen, darunter ALIKED, DISK und LightGlueMatcher. Solche Verfahren kommen etwa beim Zusammensetzen von Panoramen, bei Visual SLAM oder bei 3D-Rekonstruktionen zum Einsatz.

LightGlue nutzt Attention-Mechanismen, um Bildmerkmale robuster zuzuordnen als klassische Verfahren. Die klassischen Detektoren bleiben dabei erhalten, sodass sich der neue Deep-Learning-Pfad und die etablierten Methoden je nach Anwendungsfall kombinieren lassen.

Modernisiert haben die Entwickler auch den Kern der Bibliothek. OpenCV unterstützt nun die Datentypen FP16 und BF16, die in aktuellen KI-Beschleunigern weit verbreitet sind, dazu Bool und weitere Integer-Varianten. Die Matrixklasse cv::Mat kann erstmals echte 0D- und 1D-Strukturen abbilden und beherrscht jetzt Broadcasting sowie weitere N-dimensionale Operationen. Das soll viele Umwege und Konvertierungen ersparen.

Bei den Schnittstellen trennt sich das Projekt schrittweise von Altlasten: Die historische C-API gilt nun offiziell als veraltet. Für Python unterstützt OpenCV 5 NumPy 2.x und integriert benannte Parameter stärker, sodass sich Funktionen lesbarer aufrufen lassen – etwa cv.someAlgorithm(threshold=0.5) statt einer rein positionsbasierten Übergabe.

Ein weiteres zentrales Thema ist die Hardwarebeschleunigung. Die Entwickler haben die Hardware Abstraction Layer (HAL) grundlegend überarbeitet, um optimierte Implementierungen verschiedener Hardwarehersteller leichter einzubinden. Das Projekt nennt unter anderem Intel IPP, Arm KleidiCV, Qualcomm FastCV und die Unterstützung der Vektor-Erweiterungen moderner RISC-V-Prozessoren.

Anwendungen sollen so ohne Anpassungen auf unterschiedlichen Prozessorarchitekturen von Beschleunigung profitieren. Möglich macht das unter anderem eine einheitliche Vektor-Codebasis, die verschiedene Befehlssatzerweiterungen wie SSE, AVX, NEON, SVE und RVV über eine gemeinsame Schnittstelle anspricht.

Deutlich ausgebaut wurden die 3D-Funktionen. Das bisherige Modul calib3d teilt sich künftig in die drei Module 3d, calib und stereo auf. Neu hinzu kommen Funktionen für die Kalibrierung mehrerer Kameras, der Import und Export von Punktwolken und Meshes sowie Verfahren zur 3D-Rekonstruktion auf Basis von TSDF-Volumen. Auch moderne Schätzverfahren wie MAGSAC halten Einzug in OpenCV. Diese Erweiterungen richten sich vor allem an Entwickler in der Robotik, von autonomen Systemen und in der industriellen 3D-Vermessung.

Weitere Neuerungen gibt es bei der Bildbearbeitung, die Dokumentation setzt künftig auf eine Kombination aus Sphinx und Doxygen. Den Quellcode stellt das Projekt im GitHub-Repository bereit; die Installation per pip ist ebenfalls vorgesehen.


(fo)



Source link

Entwicklung & Code

Wiederverwendbare Rakete: China fängt erstmals Stufe auf


Erstmals holte das Land die erste Stufe einer Trägerrakete kontrolliert zurück. Die Stufe der neuen Rakete „Langer Marsch 10B“ wurde auf einer Plattform auf See aufgefangen, wie die staatliche Nachrichtenagentur Xinhua berichtete.

Weiterlesen nach der Anzeige

Es war der erste Flug der neuen Rakete. Xinhua sprach von einem „bedeutenden Durchbruch“. Ein von der Agentur veröffentlichtes Video zeigt, wie die Raketenstufe mit laufendem Triebwerk auf die Plattform zufliegt und nahezu senkrecht in ein hohes, rechteckiges Gerüst sinkt.

Nach Angaben der Zeitung „China Daily“ wartete das Rückholschiff „Linghangzhe“ („Pfadfinder“) auf die Raketenstufe. Das Schiff verfolgte sie und passte seine Position laufend an. Spezielle Metallhaken klappten schließlich aus und griffen in die gespannten Seile der Fangvorrichtung. Die Rakete war vom Weltraumbahnhof Hainan gestartet und brachte einen Satelliten in die vorgesehene Umlaufbahn.

China sei laut der staatlichen Zeitung damit nach den USA das zweite Land, das über eine zuverlässige Technik für wiederverwendbare Raketen verfüge. Zugleich sei weltweit erstmals die erste Stufe einer mit einer solchen Seil-Fangvorrichtung geborgen worden.

Empfohlener redaktioneller Inhalt

Mit Ihrer Zustimmung wird hier ein externes YouTube-Video (Google Ireland Limited) geladen.

Vor allem das US-Raumfahrtunternehmen SpaceX ist bei wiederverwendbaren Raketen deutlich weiter. China treibt die Entwicklung seit Jahren voran. Neben dem staatlichen Raumfahrtprogramm arbeiten auch mehrere private chinesische Unternehmen an der Technik, die es ermöglichen soll, Satelliten und andere Lasten günstiger ins All zu bringen.

Weiterlesen nach der Anzeige

Lesen Sie auch


(afl)



Source link

Weiterlesen

Entwicklung & Code

TypeScript 7.0: Performance-Sprung durch Go-Unterbau


Microsoft hat die finale Version von TypeScript 7.0 veröffentlicht. Im Gegensatz zu früheren TypeScript-Versionen basiert der Compiler nicht mehr auf JavaScript/Node.js, sondern ist nahezu eins zu eins in Go nachimplementiert und parallelisiert viele Arbeitsabläufe, statt sie wie bisher sequenziell abzuarbeiten. Beides führt laut Microsoft dazu, dass die Toolchain je nach Anwendungsfall zehnmal schneller kompiliert als bei TypeScript 6.0.

Weiterlesen nach der Anzeige

Gegenüber der im April veröffentlichten Beta-Version hat sich nichts Grundlegendes mehr geändert. Das finale Release konzentriert sich auf den produktionsreifen Abschluss, wie Microsoft im Blogpost zu TypeScript 7.0 schreibt: Umstellung auf das reguläre typescript-Paket, verbesserter --watch-Modus, vollständigerer Editor-Support, mehr Stabilität und klarere Migrationspfade für das TypeScript-Ökosystem.

In seinem Blog nennt Microsoft Performance-Beispiele, die sich jeweils auf einen hardwareseitig nicht näher spezifizierten Computer beziehen.

Den Quellcode von VS-Code baut TypeScript 7.0 auf dem Testsystem um den Faktor 11,9 schneller als unter TypeScript 6.0, was die Kompilierungszeit von mehr als zwei Minuten auf knapp 11 Sekunden drückt. Bei Sentry, Bluesky und Playwright ergeben sich Beschleunigungsfaktoren von jeweils knapp unter 9 Sekunden, tldraw-Beispielprojekte kommen auf 7,7-faches Tempo.



VSCode-Beispielprojekte baut TypeScript 7.0 11,9-mal schneller als TypeScript 6.0.

(Bild: Microsoft)

Das Öffnen einer fehlerbehafteten Datei in VS Code auf dem gleichen Testsystem läuft ebenfalls schneller ab. Vergehen bei TypeScript 6.0 noch 17,5 Sekunden vom Öffnen einer fehlerhaften Datei bis zur Anzeige der Fehlermeldung, dauert das Gleiche bei TypeScript 7.0 unter 1,3 Sekunden. Neben dem Geschwindigkeitszuwachs ergibt sich laut Microsoft projektübergreifend auch ein geringerer Speicherbedarf. Während er bei Sentry um sechs Prozent sinkt, reduziert er sich bei VS Code um 18 Prozent und bei Bluesky um etwas mehr als ein Viertel.

Weiterlesen nach der Anzeige

TypeScript 7.0 lässt sich via npm mit npm install -D typescript parallel zu TypeScript 6.0 installieren und ist mit dessen Type-Checking- und Kommandozeilenverhalten kompatibel. Der bekannte Befehl tsc startet dann den neuen TypeScript-7.0-Compiler. Zusätzlich gibt es das Kompatibilitätspaket @typescript/typescript6, das zusätzlich tsc6 sowie die bisherige TypeScript-6.0-API bereitstellt, damit bestehende Tools vorerst unverändert weiterlaufen können. Eine neue API soll erst mit TypeScript 7.1 kommen.

Lesen Sie auch


(mro)



Source link

Weiterlesen

Entwicklung & Code

Google-Play-Dienste: Neue Funktionen für Android-Geräte im Juli


Google liefert mit seinen Play-Systemupdates regelmäßig – oft gar mehrmals im Monat – neue Funktionen auf sämtliche Android-Geräte mit Play-Diensten aus. Im Unterschied zu regelrechten Android-Updates und Sicherheitspatches kann Google sie direkt ohne den Umweg über die Gerätehersteller auf zig Millionen Geräte ausliefern. Die Aktualisierungen enthalten neue Funktionen und Fehlerbehebungen für Smartphones und weitere Produkte des Google-Ökosystems wie Tablets, Uhren, Smart-TVs, Android Auto und Chromebooks. Das erste Juli-Update wirkt recht überschaubar, jedoch deutet sich an, dass der Konzern auch bereits vor Monaten angekündigte Features verteilt.

Weiterlesen nach der Anzeige

Die Neuerungen des Updates der Google-Play-Dienste auf Version 26.26 vom 6. Juli 2026 umfassen unter anderem ein Update für Google One für Smartphones: In-App-Käufe sollen mittels einer überarbeiteten „nativen Storefront“ schneller und reibungsloser ablaufen. Zudem erweitert Google das System um eine neue Schnittstelle (API), „um die Zuverlässigkeit bei der Einrichtung von Arbeitsprofilen zu verbessern“, so Google. Außerdem lässt sich das Arbeitsprofil auch auf Wear-OS-Smartwatches übertragen. Weiter zieht in Chromebooks in den Einstellungen eine neue Verwaltungsmöglichkeit der „Google-Standortfreigabe und die Kompatibilität für unterstützte Gerätetypen“ ein, schreibt Google.

Für Entwicklerinnen und Entwickler gibt es im Bereich der Dienstprogramme für Smartphones, Uhren, Google TV und Fahrzeuge mit Android-Automotive neue Funktionen für Google- und Drittanbieter-Apps „zur Unterstützung von Prozessen im Zusammenhang mit Dienstprogrammen“ in Apps. Separat führt Google auch entsprechende Optimierungen im Zusammenhang mit Google Maps auf.

Neben genannten Neuerungen verteilt Google nach Ankündigung der Änderung der Android-Backuprichtlinien laut 9to5Google nun schubweise die neuen Einstellungen, mit denen sich steuern lässt, ob SMS-, MMS- und auch RCS-Nachrichten gesichert werden. Außerdem liefert Google nun offenbar auch die schon im Februar angekündigte Backup-Option für lokal gespeicherte Dokumente an erste Nutzer aus.

Weiterlesen nach der Anzeige

In den Versionshinweisen v26.06 für das Play-Dienste-Update vom 16. Februar beschreibt Google die Dokumenten-Sicherungsfunktion wie folgt: „Mit der neuen Funktion zur lokalen Dateisicherung können Sie Ihre heruntergeladenen Dokumente automatisch in Google Drive speichern, sodass sie sicher sind und von jedem Ihrer Geräte aus zugänglich sind.“ Auf Geräten in der Redaktion haben wir die Einstellungen noch nicht entdeckt.

Neben dem Dokumenten-Backup steht außerdem noch die im Juni angekündigte Verwaltung von WhatsApp-Backups über die Geräteeinstellungen aus. Wann diese in die Backupfunktion eingebacken wird, ist noch unklar.


(afl)



Source link

Weiterlesen

Beliebt