ホームページ テクノロジー周辺機器 AI 視覚強化微調整! DeepSeek R1テクノロジーはマルチモーダルフィールドに正常に移行されており、ソースに完全に開放されています

視覚強化微調整! DeepSeek R1テクノロジーはマルチモーダルフィールドに正常に移行されており、ソースに完全に開放されています

Mar 12, 2025 pm 01:12 PM
git ai 郵便 業界 ポケットモンスター DeepSeek 视觉强化 qwen

大きな推奨事項:Visual-RFT-Visual Language Modelsを強化するための視覚的強化と微調整オープンソースプロジェクト!

視覚強化微調整! DeepSeek R1テクノロジーはマルチモーダルフィールドに正常に移行されており、ソースに完全に開放されています

AIXIVコラムは、世界のトップAI研究に焦点を当て続けており、2,000を超える学術および技術記事を発表しています。あなたの傑出した成果を共有するための貢献へようこそ!提出メール:liyazhou@jiqizhixin.com;

Visual-RFT(Visual Renforcement微調整)プロジェクトは、視覚言語の大きなモデル(LVLM)に対するルールの報酬に基づいて、補強学習と強化微調整(RFT)パラダイムを正常に適用し、テキスト、数学、その他の分野に限定されている以前の方法の制限を突破します。 Visual-RFTは、視覚的なサブカテゴリ化やオブジェクト検出などのタスクの特定のルール報酬を設計することにより、LVLMトレーニングの新しいアイデアを提供します!

図1は、Visual-RFTの強力な一般化能力を示しています。モデルでは、視覚強化微調整! DeepSeek R1テクノロジーはマルチモーダルフィールドに正常に移行されており、ソースに完全に開放されています内の特定のポケモンを正確に識別し、その座標を見つけるために、少量のデータのみが必要です。

視覚強化微調整! DeepSeek R1テクノロジーはマルチモーダルフィールドに正常に移行されており、ソースに完全に開放されています

図1。Visual-RFTは、モデルのパフォーマンスを大幅に改善するために、10〜1000個のデータのみで、微調整された微調整をマルチモーダルに拡張します。

RFTからVisual-RFTへ:マルチモーダル分野での補強学習のブレークスルー

OpenAIの強化された微調整技術により、モデルの機能移行は、少数のサンプルだけで達成できます。 DeepSeek-R1は、その強力な推論能力が検証可能な報酬に基づいた強化学習戦略に起因することを明らかにしています。ただし、この戦略は、以前は主にテキストや数学などの分野で使用されていました。 Visual-RFTは、この戦略を視野に拡張しました。検証可能なルールの報酬を構築することにより、視野での従来の方法の制限を解決し、効率的で高度に一般化された視覚的理解と推論を達成しました。

従来の視覚命令微調整(SFT)には大量のデータが必要であり、Visual-RFTの小さなサンプル学習能力により、データ不足シナリオではより有利になります。

Visual-RFTの一般化能力を検証するために、研究チームは、オブジェクトの検出、分類、接地などの複数の視覚タスクのテストを実施しました。結果は、Visual-RFTがオープンな語彙、小規模なサンプル学習、その他の設定の下で大幅なパフォーマンスの改善を達成できることを示しており、SFTメソッドよりも優れています。特に推論の位置決めタスクでは、Visual-RFTは優れた視覚的推論能力を示しています。 (詳細については、論文を参照してください)

視覚強化微調整! DeepSeek R1テクノロジーはマルチモーダルフィールドに正常に移行されており、ソースに完全に開放されています

図2。視覚RFTは、複数の視覚タスクでSFTを大幅に上回ります。

視覚強化微調整! DeepSeek R1テクノロジーはマルチモーダルフィールドに正常に移行されており、ソースに完全に開放されています

図3。Visual-RFTフレームワーク図、IOUおよびCLSの報酬と強化学習戦略を使用したモデルパラメーターの更新。

研究チームは、検出および接地タスクのためにIOUベースの検証可能な報酬を使用し、分類タスクの分類正しさに基づいてCLSの報酬を使用しました。 (図3に示すように)

視覚強化微調整! DeepSeek R1テクノロジーはマルチモーダルフィールドに正常に移行されており、ソースに完全に開放されています

図4。推論的な位置決めの結果は、視覚RFTがSFTを上回ってオブジェクトをより正確に見つけることを示しています。

視覚強化微調整! DeepSeek R1テクノロジーはマルチモーダルフィールドに正常に移行されており、ソースに完全に開放されています

図5。推論的な細粒分類の結果は、視覚RFTがSFTを上回ってオブジェクトをより正確に見つけることを示しています。

図4と図5は、モデルの出力結果を示しています。

Visual-RFT実験結果

QWEN2-VL 2B/7Bモデルに基づいて、Visual-RFTは、オープンオブジェクト検出、小さなサンプル検出、細粒分類、および推論配置タスクでSFTを包括的に上回ります。実験データは、ココやLVIなどの一般的なシーンや、インターネット漫画のキャラクターなどのオープンシーンをカバーしています。わずかなデータを使用すると、Visual-RFTは機能の移行を実現し、優れたパフォーマンスと堅牢性を示します。

視覚強化微調整! DeepSeek R1テクノロジーはマルチモーダルフィールドに正常に移行されており、ソースに完全に開放されています

視覚強化微調整! DeepSeek R1テクノロジーはマルチモーダルフィールドに正常に移行されており、ソースに完全に開放されています

図5。いくつかの実験結果は、視覚RFTがSFTを大幅に上回ることを示しています。

Visual-RFTはオープンソースです!

Visual-RFTプロジェクトはオープンソースであり、トレーニング、評価コード、データが含まれています。参加してください!

プロジェクトアドレス: https://www.php.cn/link/ec56522bc9c2e15be17d11962eeec453

以上が視覚強化微調整! DeepSeek R1テクノロジーはマルチモーダルフィールドに正常に移行されており、ソースに完全に開放されていますの詳細内容です。詳細については、PHP 中国語 Web サイトの他の関連記事を参照してください。

このウェブサイトの声明
この記事の内容はネチズンが自主的に寄稿したものであり、著作権は原著者に帰属します。このサイトは、それに相当する法的責任を負いません。盗作または侵害の疑いのあるコンテンツを見つけた場合は、admin@php.cn までご連絡ください。

ホットAIツール

Undresser.AI Undress

Undresser.AI Undress

リアルなヌード写真を作成する AI 搭載アプリ

AI Clothes Remover

AI Clothes Remover

写真から衣服を削除するオンライン AI ツール。

Undress AI Tool

Undress AI Tool

脱衣画像を無料で

Clothoff.io

Clothoff.io

AI衣類リムーバー

Video Face Swap

Video Face Swap

完全無料の AI 顔交換ツールを使用して、あらゆるビデオの顔を簡単に交換できます。

ホットツール

メモ帳++7.3.1

メモ帳++7.3.1

使いやすく無料のコードエディター

SublimeText3 中国語版

SublimeText3 中国語版

中国語版、とても使いやすい

ゼンドスタジオ 13.0.1

ゼンドスタジオ 13.0.1

強力な PHP 統合開発環境

ドリームウィーバー CS6

ドリームウィーバー CS6

ビジュアル Web 開発ツール

SublimeText3 Mac版

SublimeText3 Mac版

神レベルのコード編集ソフト(SublimeText3)

世界のトップ10の通貨取引プラットフォームのどれがトップ10の通貨取引プラットフォームの最新バージョンです 世界のトップ10の通貨取引プラットフォームのどれがトップ10の通貨取引プラットフォームの最新バージョンです Apr 28, 2025 pm 08:09 PM

世界の上位10の暗号通貨取引プラットフォームには、Binance、Okx、Gate.io、Coinbase、Kraken、Huobi Global、Bitfinex、Bittrex、Kucoin、Poloniexが含まれます。これらはすべて、さまざまな取引方法と強力なセキュリティ対策を提供します。

トップ10の仮想通貨取引アプリは何ですか?最新のデジタル通貨交換ランキング トップ10の仮想通貨取引アプリは何ですか?最新のデジタル通貨交換ランキング Apr 28, 2025 pm 08:03 PM

Binance、OKX、Gate.ioなどの上位10のデジタル通貨交換は、システムを改善し、効率的な多様化したトランザクション、厳格なセキュリティ対策を改善しました。

2025年のトップ10の通貨取引プラットフォームのどれがトップ10の通貨取引プラットフォームの1つです 2025年のトップ10の通貨取引プラットフォームのどれがトップ10の通貨取引プラットフォームの1つです Apr 28, 2025 pm 08:12 PM

2025年の世界の上位10の暗号通貨取引所には、Binance、Okx、Gate.io、Coinbase、Kraken、Huobi、Bitfinex、Kucoin、Bittrex、Poloniexが含まれます。これらはすべて、高い取引量とセキュリティで知られています。

トップ通貨取引プラットフォームは何ですか?トップ10の最新の仮想通貨交換 トップ通貨取引プラットフォームは何ですか?トップ10の最新の仮想通貨交換 Apr 28, 2025 pm 08:06 PM

現在、上位10の仮想通貨交換にランクされています。1。Binance、2。Okx、3。Gate.io、4。CoinLibrary、5。Siren、6。HuobiGlobal Station、7。Bybit、8。Kucoin、9。Bitcoin、10。BitStamp。

Cのスレッドパフォーマンスを測定する方法は? Cのスレッドパフォーマンスを測定する方法は? Apr 28, 2025 pm 10:21 PM

Cのスレッドパフォーマンスの測定は、標準ライブラリのタイミングツール、パフォーマンス分析ツール、およびカスタムタイマーを使用できます。 1.ライブラリを使用して、実行時間を測定します。 2。パフォーマンス分析にはGPROFを使用します。手順には、コンピレーション中に-pgオプションを追加し、プログラムを実行してGmon.outファイルを生成し、パフォーマンスレポートの生成が含まれます。 3. ValgrindのCallGrindモジュールを使用して、より詳細な分析を実行します。手順には、プログラムを実行してCallGrind.outファイルを生成し、Kcachegrindを使用して結果を表示することが含まれます。 4.カスタムタイマーは、特定のコードセグメントの実行時間を柔軟に測定できます。これらの方法は、スレッドのパフォーマンスを完全に理解し、コードを最適化するのに役立ちます。

CでChronoライブラリを使用する方法は? CでChronoライブラリを使用する方法は? Apr 28, 2025 pm 10:18 PM

CでChronoライブラリを使用すると、時間と時間の間隔をより正確に制御できます。このライブラリの魅力を探りましょう。 CのChronoライブラリは、時間と時間の間隔に対処するための最新の方法を提供する標準ライブラリの一部です。 Time.HとCtimeに苦しんでいるプログラマーにとって、Chronoは間違いなく恩恵です。コードの読みやすさと保守性を向上させるだけでなく、より高い精度と柔軟性も提供します。基本から始めましょう。 Chronoライブラリには、主に次の重要なコンポーネントが含まれています。STD:: Chrono :: System_Clock:現在の時間を取得するために使用されるシステムクロックを表します。 STD :: Chron

CでDMA操作を理解する方法は? CでDMA操作を理解する方法は? Apr 28, 2025 pm 10:09 PM

CのDMAとは、直接メモリアクセステクノロジーであるDirectMemoryAccessを指し、ハードウェアデバイスがCPU介入なしでメモリに直接データを送信できるようにします。 1)DMA操作は、ハードウェアデバイスとドライバーに大きく依存しており、実装方法はシステムごとに異なります。 2)メモリへの直接アクセスは、セキュリティリスクをもたらす可能性があり、コードの正確性とセキュリティを確保する必要があります。 3)DMAはパフォーマンスを改善できますが、不適切な使用はシステムのパフォーマンスの低下につながる可能性があります。実践と学習を通じて、DMAを使用するスキルを習得し、高速データ送信やリアルタイム信号処理などのシナリオでその効果を最大化できます。

MySQLにデータを挿入する効率的な方法 MySQLにデータを挿入する効率的な方法 Apr 29, 2025 pm 04:18 PM

MySQLでデータを挿入するための効率的な方法には、次のものが含まれます。1。insertInto ...値構文、2。LoadDatainFileコマンドの使用、3。トランザクション処理の使用、4。バッチサイズの調整、5。Insurtignoreまたは挿入の使用...

See all articles