top of page

Generatived (Beta) | Cung cấp tin tức và xu hướng mới nhất về AI sáng tạo

logo.png

Gemini ra mắt AI cho các nhiệm vụ hiểu hình ảnh nâng cao

Generatived

9:00 23/7/25

Gemini mang đến một chiều hướng mới cho khả năng hiểu hình ảnh của AI, cho phép nó phân tích các mô tả và mối quan hệ phức tạp trong một hình ảnh. Sự tiến bộ này cho phép AI nhận dạng các đối tượng không chỉ bằng các nhãn đơn giản mà còn bằng các cụm từ phức tạp, chẳng hạn như xác định ""chiếc xe xa nhất"". Sự đổi mới này cải thiện khả năng tương tác của AI với dữ liệu hình ảnh theo cách tinh tế hơn, giống con người hơn.

Khả năng của AI bao gồm hiểu các mối quan hệ đối tượng, logic điều kiện, khái niệm trừu tượng, văn bản trong hình ảnh và nhãn đa ngôn ngữ. Ví dụ, Gemini có thể nhận dạng ""người cầm ô"" và lọc ra ""đồ ăn chay"", thể hiện khả năng xử lý nhiều truy vấn chi tiết. Khả năng này đặc biệt hữu ích cho các tác vụ đòi hỏi khả năng hiểu biết thị giác nâng cao, chẳng hạn như nhận dạng ""bông hoa héo nhất trong bó hoa"" và nhận dạng văn bản trong hình ảnh.

Ứng dụng thực tế của phân đoạn hình ảnh đàm thoại của Gemini rất đa dạng, từ việc tinh giản biên tập nội dung sáng tạo đến tăng cường giám sát compliance an toàn. Các nhà thiết kế giờ đây có thể tương tác với hình ảnh bằng ngôn ngữ tự nhiên, và các nhà quản lý an toàn có thể xác định hành vi không tuân thủ bằng các hướng dẫn như ""làm nổi bật nhân viên không đội mũ bảo hiểm"". Các giám định viên bảo hiểm có thể đánh giá thiệt hại chính xác hơn bằng cách yêu cầu AI ""Segment nhà bị hư hại do thời tiết"". Điều này chứng minh khả năng hiểu các khái niệm trừu tượng của Gemini.

Đối với các nhà phát triển, công nghệ của Gemini là một bước tiến vượt bậc. Nó cung cấp các mô hình ngôn ngữ linh hoạt, không phụ thuộc vào các lớp được xác định trước, cho phép tạo ra các giải pháp tùy chỉnh cho nhiều ngành công nghiệp khác nhau. Ngoài ra, trải nghiệm dành cho nhà phát triển được đơn giản hóa với một API duy nhất cho tất cả các nhu cầu phân khúc, giúp dân chủ hóa quyền truy cập vào các ứng dụng thị giác tiên tiến, cho phép các nhà phát triển dễ dàng tích hợp các khả năng hiểu thị giác tiên tiến vào sản phẩm của họ.

Chia sẻ bài viết này:

Tin tức mới nhất
マイクロソフト、Claude Opus 5.5の提供を開始

マイクロソフト、Claude Opus 5.5の提供を開始

7:00 24/9/26

Microsoft(ワシントン州)は、Anthropicが開発した最新AIモデル「Claude Opus 5.5」を開発者向けプラットフォーム「Microsoft Foundry」上で一般提供開始した。

マイクロソフト、AIエージェント実行基盤�を提供

マイクロソフト、AIエージェント実行基盤を提供

7:00 24/9/26

Microsoft(ワシントン州)は、自律型AIエージェントの安全な実行と統制を両立する新機能「Azure Container Apps Sandboxes」の一般提供を開始した。

マイクロソフト、AI犯罪基盤を妨害

マイクロソフト、AI犯罪基盤を妨害

7:00 24/9/26

Microsoft(ワシントン州)は、サイバー犯罪プラットフォーム「EvilTokens」のインフラを妨害・無効化したと発表した。

NVIDIAがMoE高速化手法発表

NVIDIAがMoE高速化手法発表

7:00 24/9/26

NVIDIA(米国カリフォルニア州)は、大規模言語モデルやバイオ基盤モデルに向けたMoE(Mixture-of-Experts)アーキテクチャの学習効率化手法を公開した。

Copyright © 2024 Generatived - All right Reserved.

Chia sẻ bài viết này:

Chia sẻ bài viết này:

Generatived AI Logo

Generatived là dịch vụ cung cấp thông tin và xu hướng chuyên về Generative AI. Chúng tôi sẽ cố gắng hết sức để cung cấp thông tin về thế giới đang thay đổi nhanh chóng.

  • Facebook
  • X

Hãy theo dõi chúng tôi

Ngôn ngữ

Tin tức mới nhất
マイクロソフト、Claude Opus 5.5の提供を開始

マイクロソフト、Claude Opus 5.5の提供を開始

7:00 24/9/26

Microsoft(ワシントン州)は、Anthropicが開発した最新AIモデル「Claude Opus 5.5」を開発者向けプラットフォーム「Microsoft Foundry」上で一般提供開始した。

マイクロソフト、AIエージェント実行基盤を提供

マイクロソフト、AIエージェント実行基盤を提供

7:00 24/9/26

Microsoft(ワシントン州)は、自律型AIエージェントの安全な実行と統制を両立する新機能「Azure Container Apps Sandboxes」の一般提供を開始した。

マイクロソフト、AI犯罪基盤を妨害

マイクロソフト、AI犯罪基盤を妨害

7:00 24/9/26

Microsoft(ワシントン州)は、サイバー犯罪プラットフォーム「EvilTokens」のインフラを妨害・無効化したと発表した。

NVIDIAがMoE高速化手法発表

NVIDIAがMoE高速化手法発表

7:00 24/9/26

NVIDIA(米国カリフォルニア州)は、大規模言語モデルやバイオ基盤モデルに向けたMoE(Mixture-of-Experts)アーキテクチャの学習効率化手法を公開した。

bottom of page