Search

Tag: #vision18 results

Claude Opus 4.7: Hands-Off Coding & 3x Image Res

Claude Opus 4.7: Hands-Off Coding & 3x Image Res

Anthropic has launched Claude Opus 4.7, significantly enhancing software development capabilities to a 'hands-off reliable' level for challenging coding tasks compared to Opus 4.6. Image recognition resolution exceeds 3x the previous generation. Improvements also include better instruction fidelity and stability for long-duration tasks.

ITmedia AI+ (日本)MediaApr 16#coding#vision#model-release
DeepSeek Chatbot Gains Vision

DeepSeek Chatbot Gains Vision

Chinese AI startup DeepSeek has added multimodal capabilities to its flagship chatbot, allowing it to process images and videos alongside text. This first-time feature is in limited release to select users, shortly after launching V4 model with price cuts. It positions DeepSeek competitively with rivals offering vision functions.

SCMP TechnologyMediaApr 29#multimodal#vision#chinese-ai
Fast LLM Fine-Tuning with S3 Data

Fast LLM Fine-Tuning with S3 Data

AWS integrates Amazon S3 general purpose buckets with SageMaker Unified Studio for easy use of unstructured data in ML workflows. This post demonstrates fine-tuning Llama 3.2 11B Vision Instruct for visual question answering using SageMaker Catalog. It simplifies LLM training with S3-stored data.

AWS Machine Learning BlogOfficialMar 26#fine-tuning#unstructured-data#vision
🔬

Frontier AI Art Appraisal Test Reveals Gap

Experiment tested 4 frontier multimodal models on valuing 15 paintings worth $1.46B using image-only or image + metadata. Found 'recognition vs commitment gap': models recognize art visually but hesitate on valuation without text. Gemini 3.1 Pro led both settings; GPT-5.4 surged with metadata.

Reddit r/MachineLearningCommunityApr 16#multimodal#vision#evaluation
Page 1 of 2