Beiträge von Dan

    Ich habe mal meine Hüllen dran gepappt.

    2x TechWoven und 1x Silikon:

    Der Inhalt kann nicht angezeigt werden, da du keine Berechtigung hast, diesen Inhalt zu sehen. Der Inhalt kann nicht angezeigt werden, da du keine Berechtigung hast, diesen Inhalt zu sehen. Der Inhalt kann nicht angezeigt werden, da du keine Berechtigung hast, diesen Inhalt zu sehen. Der Inhalt kann nicht angezeigt werden, da du keine Berechtigung hast, diesen Inhalt zu sehen. Der Inhalt kann nicht angezeigt werden, da du keine Berechtigung hast, diesen Inhalt zu sehen.

    Lustig, mir wurde gestern auf Instagram dann weltfakten.de Vorgeschalgen (das hatte ich schon öfters gesehen) und was war das Thema.. 😂

    Ich habe es dann durch die KI laufen lassen, und nach der Echtheit gefragt. Es wurde bestätigt. Habe mir dann noch die Quellen liefern lassen. Hier mal der Auszug:

    Kleiner Zwischenstand zur neuen Super-Resolution-Funktion:

    Momentan passiert bei einem 12-MP-Bild vereinfacht Folgendes: Die App zerlegt ein Foto mit 4032 × 3024 Pixeln in rund 48 einzelne Tiles. Jedes dieser 512er-Tiles wird vom aktuellen Real-ESRGAN-x4plus-Modell zunächst auf 2048 × 2048 Pixel hochgerechnet. Anschließend reduziert die App das Ergebnis wieder auf 1024 × 1024 Pixel und setzt daraus das vollständige 2×-Bild zusammen.

    Die KI berechnet momentan also erheblich mehr Pixel, als für das fertige Bild überhaupt benötigt werden. Das funktioniert qualitativ bereits hervorragend, erklärt aber auch, warum die Verarbeitung eines 12-MP-Fotos selbst auf meinem M4-iPad rund fünf Minuten dauert und das SoC dabei ordentlich arbeiten und entsprechend warm werden kann.

    Genau deshalb überarbeite ich gerade noch einmal das verwendete AI-Modell und die Verarbeitungspipeline. Ziel ist eine echte native 2×-Berechnung: Die KI soll direkt aus einem 512er-Tile ein 1024er-Tile erzeugen, ohne den Umweg über 2048 × 2048 Pixel.

    Die Bildqualität stimmt also schon – jetzt geht es an die Performance und Effizienz. Deswegen dauert der Release noch einen Moment. Ich hoffe, ich sitze hier nicht noch, wenn es schon hell wird 😂

    Ausblick: Echte KI-Super-Resolution für My Media Tools

    In den 6 Stunden habe ich relativ intensiv (aber nebenher das iPhone übertragen lassen) an einer neuen Super-Resolution-Funktion gearbeitet. Das Ziel war dabei nicht einfach nur, ein Bild mathematisch größer zu skalieren, sondern tatsächlich zusätzliche Bilddetails mithilfe eines Machine-Learning-Modells zu rekonstruieren.

    Der erste Ansatz war Apples eigene VideoToolbox Super Resolution. Apple stellt dafür mit VTFrameProcessor und VTSuperResolutionScalerConfiguration inzwischen eine sehr interessante native Pipeline zur Verfügung, die direkt auf der Hardware des Geräts arbeitet.

    Technisch funktionierte die Implementierung letztlich auch. Dabei gab es allerdings einige Besonderheiten: Auf meinem Testgerät stellte VideoToolbox beispielsweise ausschließlich einen nativen Skalierungsfaktor von 4× zur Verfügung. Bei hochauflösenden iPhone-Fotos entstehen dadurch sehr schnell enorme Bildgrößen und entsprechend hohe Anforderungen an Arbeitsspeicher und Pixelbuffer. Bei meinem iPad Air M3 lief es in ein Speicher-/Pixelbuffer-Limit (das hat nur 8GB RAM). Beim iPad Air M4 13" mit 12GB lief es durch.

    Deshalb habe ich die Verarbeitung zunächst auf kontrollierte Bildausschnitte umgestellt und einen direkten A/B-Vergleich eingebaut. Original, Apples Super Resolution und eine klassische Lanczos-Skalierung konnten dabei auf exakt derselben Bildstelle miteinander verglichen und bis zu 30-fach vergrößert werden.

    Das überraschende Ergebnis: Obwohl Apples Pipeline technisch korrekt durchlief, war bei meinen Testbildern praktisch kein überzeugender zusätzlicher Detailgewinn gegenüber einer konventionellen Skalierung zu erkennen. Für eine Funktion, die ausdrücklich „Super Resolution“ heißen soll, war mir das schlicht nicht genug.

    Also habe ich den Ansatz noch einmal komplett geändert.

    Real-ESRGAN x4plus + Core ML

    Die neue Implementierung verwendet Real-ESRGAN x4plus, das ich als Core-ML-Modell direkt in My Media Tools integriert habe. Real-ESRGAN ist ein neuronales Super-Resolution-Verfahren: Es vergrößert die vorhandenen Pixel nicht lediglich durch Interpolation, sondern versucht, anhand der im Training erlernten Strukturen plausible hochauflösende Details zu rekonstruieren.

    Das Modell wird für die App als Core-ML-Modell kompiliert und anschließend vollständig lokal ausgeführt. Es gibt keinen Upload und keine Cloud-Verarbeitung. Das ausgewählte Foto bleibt während der gesamten Verarbeitung auf dem iPhone bzw. iPad.

    Auch die eigentliche Integration war interessanter als erwartet. Die Bilddaten müssen zunächst exakt in das vom neuronalen Netz erwartete Eingabeformat gebracht werden. Dazu gehören unter anderem die korrekte RGB-Normalisierung und das notwendige Padding. Nach der Inferenz liefert Core ML die berechneten Daten als MLMultiArrayzurück. Die Ausgabe des Netzes liegt dabei als mehrdimensionaler Tensor im NCHW-Format – also Batch, Farbkanal, Höhe und Breite – vor und muss anschließend wieder korrekt in RGB-Bilddaten zurückverwandelt werden. Danach wird das zuvor hinzugefügte Padding wieder entfernt und die Ausgabe für die weitere Bildverarbeitung aufbereitet.

    Der aktuelle interne Qualitätstest arbeitet zunächst mit einer kontrollierten Eingangsgröße und berechnet daraus über Real-ESRGAN eine 4× höhere Auflösung. Für den Vorher-/Nachher-Vergleich wird das komplette Ausgangsbild proportional eingepasst. Der Vergleich ist interaktiv: Die Trennlinie lässt sich frei verschieben, Bildposition und Zoom bleiben synchron und für die Detailkontrolle kann sehr weit in das Ergebnis hineingezoomt werden.

    Damit kann ich unmittelbar vergleichen, was tatsächlich vom ML-Modell kommt und was eine normale Lanczos-Skalierung aus demselben Ausgangsmaterial macht.

    Warum dieser Aufwand?

    Ich möchte die Funktion erst veröffentlichen, wenn der Qualitätsgewinn nicht nur auf dem Papier vorhanden ist. „4ד allein sagt schließlich überhaupt nichts darüber aus, ob am Ende tatsächlich ein besseres Bild entsteht. Aus 3.000 × 4.000 Pixeln rechnerisch 12.000 × 16.000 Pixel zu erzeugen, ist trivial. Entscheidend ist, was mit den zusätzlichen Pixeln passiert.

    Genau deshalb laufen momentan noch interne Tests mit unterschiedlichen Motiven, Detailstrukturen und Ausgangsqualitäten.

    Wenn diese Tests abgeschlossen sind und die Ergebnisse meinen Erwartungen entsprechen, wird die neue Real-ESRGAN-Super-Resolution mit einem der nächsten Builds von My Media Tools online gehen.

    Besonders spannend finde ich dabei, wo die Entwicklung inzwischen angekommen ist: Eine solche KI-basierte Bildrekonstruktion kann vollständig lokal auf einem iPhone oder iPad laufen – ohne Server, ohne Cloud und ohne dass das eigene Foto das Gerät verlassen muss.


    Darauf bin ich gerade wirklich ein bisschen stolz. Nach einigen Stunden Testen, Verwerfen und Optimieren läuft jetzt tatsächlich Real-ESRGAN x4plus als kompiliertes Core-ML-Modell direkt in meiner App und v.a. vollständig lokal auf iPhone und iPad, ohne Cloud oder Server.

    Und das Entscheidende: Das Ergebnis ist sensationell. Nicht einfach nur viermal mehr Pixel, sondern sichtbar rekonstruierte Details und eine Bildqualität, bei der man im direkten Vorher-/Nachher-Vergleich wirklich einen Unterschied sieht.

    Schon ziemlich verrückt, was man inzwischen direkt auf einem iPad umsetzen kann. 😊

    Das sehe ich im Prinzip ähnlich. Aber der normal User wundert sich einfach, dass sein Speicher in der iCloud zum Beispiel voll ist, weil es komplett mit E-Mails überfüllt ist. Mit meiner App kann er die E-Mails archivieren, und sie bleiben immer noch für alle anderen Clients lesbar. Auch für Windows und so weiter. Gerade Nutzer von iCloud Mail und den 5GB Free iCloud kommen da schnell an ihre Grenzen. Dazu kommt, dass in der Regel natürlich auch super viel Schrott mit gesichert wird. Kleine Bilder, die Firmen Logos sind, AGB, Widerruf als PDF und so weiter. Das kann meine App rausfiltern. Ebenso erkennt sie Newsletter, und filtert diese auch raus, dass die nicht mit gesichert werden. Das kann man alles einstellen.

    Mit Build 43 bekommt My Media Tools eine Funktion, die ich unbedingt noch in der App haben wollte.

    Super Resolution.

    Der Inhalt kann nicht angezeigt werden, da du keine Berechtigung hast, diesen Inhalt zu sehen.

    Links das Original, rechts das Super Resolution Bild.

    Damit lassen sich Bilder nicht einfach nur größer rechnen. My Media Tools verarbeitet das Bild über eine eigene lokale Image Pipeline. Dabei werden mehrere Verarbeitungsschritte miteinander kombiniert. Hochwertiges Resampling vergrößert zunächst die Bildinformationen. Anschließend werden Rauschen und typische Skalierungsartefakte reduziert. Eine adaptive Detailrekonstruktion analysiert Kanten und feine Strukturen und arbeitet gezielt Details heraus, ohne einfach das gesamte Bild künstlich zu überschärfen.

    Das Bild kann wahlweise auf die doppelte oder vierfache Auflösung hochgerechnet werden. Besonders bei älteren, kleineren oder bereits komprimierten Bildern kann das einen erstaunlichen Unterschied machen.

    Und natürlich wollte ich das Ergebnis auch vernünftig beurteilen können. Deshalb gibt es einen interaktiven Vorher Nachher Vergleich. Ein verschiebbarer Teiler liegt direkt über dem Bild. Links sieht man das Original, rechts das mit Super Resolution verarbeitete Ergebnis. So kann man selbst bei starker Vergrößerung unmittelbar vergleichen, was die Image Pipeline tatsächlich aus dem Ausgangsmaterial herausholt.

    Die komplette Verarbeitung findet lokal auf dem Gerät statt. Das Bild muss für Super Resolution nicht auf irgendeinen Server hochgeladen werden.

    Das Ergebnis wird anschließend als neue Datei gespeichert. Das Original bleibt selbstverständlich unangetastet.

    Super Resolution ist damit ein weiteres Werkzeug in My Media Tools, das aus einer ursprünglich recht kleinen Idee inzwischen eine ziemlich umfangreiche Werkzeugkiste für Bilder und Videos macht.

    […] Da möchte ich schon gefragt werden, vor allem wenn ich nicht Siri sage, die Uhr vibriert und mir den Tierarzt vorschlägt, über den ich mit meiner Familie spreche. Das ist frech.

    Ich finde das nicht frech, denn du hast dafür nicht unbedingt irgendwann einen separaten Dialog mit genau dieser Beschreibung bestätigt. Siri Vorschläge sind aber Bestandteil von Siri und Apple beschreibt in den Datenschutzinformationen ausdrücklich, dass dafür Informationen auf dem Gerät wie Nachrichten, Mitteilungen, Kontakte und App Nutzung verarbeitet werden können. Durch die Nutzung von Siri beziehungsweise Siri Vorschlägen stimmt man dieser beschriebenen Verarbeitung zu. Das bedeutet allerdings nicht, dass Apple permanent Gespräche mithört oder an Apple überträgt. Gerade die Vorschlagsfunktionen werden laut Apple lokal auf dem Gerät verarbeitet.