Heim
DeepSeek führt im Rahmen interner Tests einen umfassenden Bilderkennungsmodus mit multimodalem Verständnis ein
DeepSeek hat mit internen Tests seines Modus zur groß angelegten Bilderkennung begonnen und markiert damit den vollständigen Übergang dieses inländischen Großmodells in das multimodale Text-und-Bild-Zeitalter. Nach einer Beta-Phase in kleinem Umfang Ende April hat das Unternehmen am 9. Mai den Zugang zum „Bilderkennungsmodus“ deutlich erweitert, sodass die meisten Testkonten diese Funktion nun über einen eigenen Einstiegspunkt in der Chat-Oberfläche nutzen können. Obwohl die Funktion weiterhin als „interne Testphase“ bezeichnet wird, zeigt die Tatsache, dass sie neben dem „Schnellmodus“ und dem „Expertenmodus“ oberhalb der Eingabeleiste angezeigt wird, dass multimodales Verständnis nun ein zentraler Bestandteil der Produktpalette ist.

Im Gegensatz zur einfachen OCR-Textextraktion konzentriert sich das neueste Upgrade von DeepSeek auf tiefgehende Bilderkennung und semantisches Verständnis. In Praxistests kann dieser Modus visuelle Informationen logisch analysieren, sodass Nutzer komplexe medienübergreifende Interaktionen durchführen können, indem sie einfach Bilder hochladen. Dieser Schritt schließt eine Lücke in den multimodalen Fähigkeiten von DeepSeek und bringt das Modell deutlich näher an internationale Top-Modelle wie GPT-4o heran.
Verwandter Artikel
Schwedisches KI-Startup Lovable Eyes: Bewertung von 13,2 Milliarden US-Dollar nach großer Finanzierungsrunde
Während KI-gestützte Coding-Tools an Popularität gewinnen, hat das schwedische Startup Lovable eine bedeutende Finanzierungsrunde abgeschlossen. Das Unternehmen strebt danach, 3 Milliarden US-Dollar einzusammeln, was seine Bewertung potenziell auf 13
Google testet den Remy AI Agent für Gemini, da der Fokus auf die Benutzerkontrolle verlagert wird
Laut Business Insider testet Google Remy, einen neuen KI-Personalagenten für Gemini. Dieses Tool soll Aufgaben im Auftrag von Nutzern ausführen und sowohl professionelle Arbeitsabläufe als auch tägliche Routinen optimieren.Derzeit wird Remy in einer
So beheben Sie Core Web Vitals für bessere SEO-Rankings
Berichtskartenkommentare mit KI-Tools optimierenEinführungKI-Tools zur Generierung von BerichtskartenkommentarenMagic SchoolAlmanac AIChat GPTNutzung von Magic School zur Generierung von BerichtskartenkommentarenAnmeldung bei Magic SchoolAuswahl des
Empfehlungen zu verwandten Spezialthemen
Kommentare (0)
DeepSeek hat mit internen Tests seines Modus zur groß angelegten Bilderkennung begonnen und markiert damit den vollständigen Übergang dieses inländischen Großmodells in das multimodale Text-und-Bild-Zeitalter. Nach einer Beta-Phase in kleinem Umfang Ende April hat das Unternehmen am 9. Mai den Zugang zum „Bilderkennungsmodus“ deutlich erweitert, sodass die meisten Testkonten diese Funktion nun über einen eigenen Einstiegspunkt in der Chat-Oberfläche nutzen können. Obwohl die Funktion weiterhin als „interne Testphase“ bezeichnet wird, zeigt die Tatsache, dass sie neben dem „Schnellmodus“ und dem „Expertenmodus“ oberhalb der Eingabeleiste angezeigt wird, dass multimodales Verständnis nun ein zentraler Bestandteil der Produktpalette ist.

Im Gegensatz zur einfachen OCR-Textextraktion konzentriert sich das neueste Upgrade von DeepSeek auf tiefgehende Bilderkennung und semantisches Verständnis. In Praxistests kann dieser Modus visuelle Informationen logisch analysieren, sodass Nutzer komplexe medienübergreifende Interaktionen durchführen können, indem sie einfach Bilder hochladen. Dieser Schritt schließt eine Lücke in den multimodalen Fähigkeiten von DeepSeek und bringt das Modell deutlich näher an internationale Top-Modelle wie GPT-4o heran.
Schwedisches KI-Startup Lovable Eyes: Bewertung von 13,2 Milliarden US-Dollar nach großer Finanzierungsrunde
Während KI-gestützte Coding-Tools an Popularität gewinnen, hat das schwedische Startup Lovable eine bedeutende Finanzierungsrunde abgeschlossen. Das Unternehmen strebt danach, 3 Milliarden US-Dollar einzusammeln, was seine Bewertung potenziell auf 13
So beheben Sie Core Web Vitals für bessere SEO-Rankings
Berichtskartenkommentare mit KI-Tools optimierenEinführungKI-Tools zur Generierung von BerichtskartenkommentarenMagic SchoolAlmanac AIChat GPTNutzung von Magic School zur Generierung von BerichtskartenkommentarenAnmeldung bei Magic SchoolAuswahl des











