AI モデル
DistilGPT2は、GPT-2から派生した、英語のテキスト生成モデルです。前身モデルよりも高速かつ軽量な代替手段を提供し、様々な創造的および補助的なライティングタスクに適しています。このモデルは事前学習済みで、Hugging Faceを通じて統合可能です。
AI モデルの最高の場を見つける — DistilGPT2やClaude Opusのような言語トランスフォーマーから、GPT-5.6: Frontier intelligenceやGoogle DeepMindのGemini 3.1 Proといった高度なシステムまで、開発者や研究者がプロジェクトを向上させるツールを探求する場です: 人間のようなテキストを生成したり、会話エージェントを構築したり、複雑なアルゴリズムを開発したり、AIの能力の限界を押し広げたりします。 機械学習プラットフォーム, 科学的発見・ラボツール, コンピュータービジョンツール, 3Dモデル生成ツール と 自然言語処理ツール などのカテゴリーにわたる 148 件のAI モデルをご覧ください。
148 tools
AI モデル
DistilGPT2は、GPT-2から派生した、英語のテキスト生成モデルです。前身モデルよりも高速かつ軽量な代替手段を提供し、様々な創造的および補助的なライティングタスクに適しています。このモデルは事前学習済みで、Hugging Faceを通じて統合可能です。
GPT-5.6は、さまざまなタスクにおける生産性と効率を向上させるために設計されたOpenAIの最新のAIモデルです。コストあたりのパフォーマンスが向上しており、ユーザーはより少ないリソースでより多くの成果を上げることができ、コーディング、知識作業、サイバーセキュリティなどの要求の厳しいワークフローに最適です。
Gemini 3.1 Proは、複雑なタスクと深い推論のために設計された高度なAIモデルです。マルチモーダル理解に優れ、スマートで簡潔な応答を提供し、学習、計画、革新的なアプリケーションの構築に最適です。
AI モデル
Stability AIは、画像、ビデオ、オーディオ、3Dコンテンツを作成するためのオープンソース生成AIモデルのスイートを提供しています。これらの革新的なソリューションは、多様なアプリケーション向けの高度なAI機能を求めるクリエイターや企業に対応します。最先端のテクノロジーを今すぐ探索してください。
AI モデル
Cohere Command は、エンタープライズ用途に設計されたスケーラブルなAI言語モデルファミリーです。実世界のAIエージェントアプリケーションにおいて高いパフォーマンスと精度を提供し、ビジネスワークフローの自動化、コンテンツ作成、セキュアなデプロイメントを可能にします。Command は、データに基づいたAIでチームを強化します。
AI モデル
AI21は、精度、信頼性、スケーラビリティに重点を置いたエンタープライズグレードの基盤モデルとAIシステムを構築しています。同社のソリューションは、重要なビジネスワークフローを強化し、効率的なAIエージェントの開発と展開のためのインテリジェントなモデルルーティングや自動化されたハーネス最適化などの高度な機能を提供します。
AI モデル
Mistral Large 3は、企業向けに設計された最先端のAIモデルで、AIアシスタントやエージェントのカスタマイズ、ファインチューニング、展開を可能にします。41Bのアクティブパラメータを持つスパースミクスチャーオブエキスパートアーキテクチャを特徴としており、マルチモーダルおよび多言語アプリケーションにおいて高度な機能を提供します。
NVIDIA Nemotron 3 Ultraは、複雑な推論と多言語タスクのために設計された強力なAIモデルです。5500億のパラメータを持ち、長文コンテキスト分析とツール使用に優れており、さまざまな業界での高リスクアプリケーションに最適です。
AI モデル
gpt-ossには、強力なパフォーマンスと効率的な展開のために設計された2つのオープンウェイト言語モデル、gpt-oss-120bとgpt-oss-20bが含まれています。これらはApache 2.0ライセンスの下で利用可能で、さまざまなアプリケーションにアクセスできるようにし、安全性とカスタマイズを確保しています。
AI モデル
MiniMax-M2.5は、コーディング、オフィス作業、エージェントツールの使用のために設計された高度なAIモデルです。効率性とコスト効果に優れ、さまざまな業界での革新的なアプリケーションを可能にします。
AI モデル
Mistral Small 4は、推論、コーディング、マルチモーダル機能を1つのプラットフォームに統合した多用途のAIモデルです。ユーザーはAIアシスタントやエージェントを効率的にカスタマイズ、ファインチューニング、展開できるため、さまざまな企業アプリケーションに最適です。
AI モデル
Command A+ は、複雑な推論、視覚、48 言語にわたる多言語タスクのために設計された、25B のアクティブパラメータと 218B の総パラメータを持つ専門家の混合モデルです。企業向けに効率的で正確なソリューションを提供します。
AI モデル
ERNIE 5.1は、パフォーマンスに優れ、事前トレーニングコストを最小限に抑えた最先端のAIモデルです。エージェントの能力、推論、創造性において重要な進展を提供し、AI分野での有力な候補となっています。
AI モデル
Ideogram 4.0は、さまざまなアプリケーション向けに設計された高度なAIモデルです。プロジェクトにAI技術を活用し、さまざまな分野での効率と生産性を向上させるための強力な機能を提供します。
Cosmos 3は、NVIDIAが開発した高度なAIモデルで、人工知能、高性能コンピューティング、ロボティクスにおけるさまざまなアプリケーションを強化するために設計されています。NVIDIAのGPU技術を活用して、強力な計算能力を提供します。
AI モデル
IBMグラニットは、ビジネス向けに設計されたオープンで信頼できるAIモデルのファミリーであり、効率的な言語、ビジョン、音声、ガードレールモデルを提供し、企業のニーズに合わせてカスタマイズおよび展開できます。
インクリングは、開発者向けに設計された975BパラメータのマルチモーダルAIモデルです。テキスト、画像、音声入力を受け付け、チャットボットやコーディングアシスタントなどのさまざまなアプリケーション向けにテキスト出力を生成します。オープンウェイトでリリースされており、研究やサードパーティ製品への統合をサポートします。
AI モデル
Olmo from Ai2は、高度なAI研究とアプリケーションのために設計された完全にオープンな言語モデルです。プログラミング、推論、対話に最適化されたさまざまなモデルバリアントを提供し、開発者や研究者に対して透明性とアクセス可能性を確保します。
Phi-4-reasoning-vision-15Bは、Microsoftによって開発されたマルチモーダルAIモデルで、視覚と言語の理解および推論能力を必要とするタスクに設計されています。科学的推論やコンピュータ使用エージェントタスクに優れており、さまざまなアプリケーションに適しています。
AI モデル
Falcon-H1R-7Bは、数学、プログラミング、論理タスクにおけるパフォーマンスを向上させるために設計された推論専門のAIモデルです。テクノロジーイノベーション研究所によって開発され、効率的な推論とテスト時のスケーリングのためにハイブリッドアーキテクチャを利用しています。
AI モデル
OpenAIは、最先端の人工知能(AI)研究開発および展開を行うリーディングカンパニーです。多様なアプリケーションで利用可能な高度なAIモデルの開発に注力しており、汎用人工知能(AGI)が全人類に利益をもたらすことを目指しています。
AI モデル
OPT-175Bは、Meta AIが研究コミュニティ向けに公開した1750億パラメータの大規模言語モデルです。これにより、大規模言語モデルへのアクセスが可能になり、NLP研究の深い理解と進歩を促進します。責任ある開発とバイアスの軽減に重点を置いています。
AI モデル
Gatoは、Google DeepMindが開発した単一の汎用AIエージェントです。Atariゲームのプレイ、画像へのキャプション付け、チャット、実際のロボットアームの制御など、幅広いタスクを実行できます。このマルチモーダルエージェントは、Transformerニューラルネットワークを使用して多様なデータ入力を処理し、適切な出力を生成します。
AI モデル
SqueezeNetは、PyTorchで利用可能なディープ畳み込みニューラルネットワークモデルです。AlexNetと同等の精度を、はるかに少ないパラメータ数と小さいモデルサイズで実現しており、様々なコンピュータビジョンタスクに効率的です。このモデルはImageNetで事前学習済みであり、PyTorchプロジェクトに簡単に統合できます。
AI モデル
Xceptionは、Keras 3 APIを通じて利用可能な深層学習モデルです。Keras Applicationsの一部として、様々なコンピュータビジョンタスク向けの事前学習済みモデルを提供します。Xceptionは画像分類および関連アプリケーション向けに設計されており、高度なAIシステムの構築のための堅牢な基盤を提供します。
AI モデル
Transfo-XL-WT103は、相対位置埋め込みを備えた因果的トランスフォーマーモデルであり、より長いコンテキストのために隠れ状態を再利用できます。Zihang Daiらによって開発され、入出力にアダプティブソフトマックスを使用しています。このモデルはテキスト生成タスクに適しており、Wikitext-103データセットでトレーニングされました。
AI モデル
Google DeepMind は、Gopher のような大規模言語モデルの研究を進め、その能力、倫理的考慮事項、効率的なトレーニングに焦点を当てています。研究には、2800億パラメータのモデル、リスク評価、予測と追跡可能性の向上を目的とした検索拡張アーキテクチャが含まれます。目標は、AI を安全かつ有益に進歩させることです。
This research empirically analyzes the optimal trade-off between model size and training data for large language models given a fixed compute budget. It reveals that current large…
AI モデル
LaMDAは、Googleが開発した画期的な対話型AIモデルで、幅広いトピックについて自由な対話を行うように設計されています。Transformerアーキテクチャを基盤とし、対話データに特化してトレーニングされているため、妥当性や具体性といったニュアンスを理解し、より自然な人間とコンピューターの対話や新しいアプリケーションカテゴリを可能にします。
AI モデル
InstructGPTモデルは、GPT-3よりもユーザーの意図をより良く理解するように訓練されたAI言語モデルです。人間からのフィードバックによる強化学習により、より真実味があり、毒性が低く、ユーザーの目標に沿ったものとなっており、現在OpenAIのAPIで利用可能です。
AI モデル
Longformer Base 4096 は、長文ドキュメントの処理に特化したTransformerモデルです。RoBERTaをベースとし、最大4,096トークンの拡張シーケンスで事前学習されています。このモデルは、スライディングウィンドウとグローバルアテンションを組み合わせたハイブリッドアテンションメカニズムを採用し、効率的な長文理解とタスク固有の表現学習…
BigBirdベースモデルは、ブロック疎行列アテンションを使用して、はるかに長いシーケンスを処理できるように拡張されたBERTのTransformerです。マスク言語モデリングのために英語テキストで事前学習されており、最大4096トークンのシーケンスを効率的に処理でき、長文タスクで最先端の結果を達成しています。
AI モデル
RAG(Retrieval-Augmented Generation)は、事前学習済み言語モデルと外部データソースを組み合わせたものです。関連するパッセージを取得して生成を条件付け、事実の正確性を向上させ、モデル全体の再学習なしでの知識更新を可能にします。このアプローチは、パラメトリックメモリと非パラメトリックメモリを統合することで、応答の質を向上させます。
AI モデル
SimCLRは、視覚的表現の自己教師あり学習および半教師あり学習のためのフレームワークです。同じ画像の異なる変換ビュー間の合意を最大化するためにコントラスティブ学習を利用することで、以前のアプローチを簡素化し、ラベル付きデータが限られている画像分類タスクで最先端のパフォーマンスを実現します。
AI モデル
Phi-2は、Microsoft Researchが開発した27億パラメータの言語モデルです。130億パラメータ未満のモデルの中で最先端のパフォーマンスを示し、優れた推論能力と自然言語理解能力を備えています。Phi-2は、最大25倍大きいモデルと同等またはそれ以上の性能を複雑なベンチマークで達成しており、研究や実験に最適です。
AI モデル
ControlNetは、条件付き制御を追加することで拡散モデルを強化し、ユーザーが特定の入力で画像生成をガイドできるようにします。事前学習済みモデルを破壊することなくファインチューニングが可能で、個人用デバイスに適しており、モデルのマージや置換における柔軟性を提供します。
このAIモデルは、ImageNet分類用に訓練された大規模で深い畳み込みニューラルネットワークの詳細を示しています。テストデータにおいて、トップ1エラー率39.7%、トップ5エラー率18.9%という最先端の結果を達成し、5つの畳み込み層と2つの全結合層にわたる6000万個のパラメータと50万個のニューロンを利用しました。
AI モデル
StyleGAN3は、生成器内の信号処理を全面的に見直すことで、エイリアシングのない(alias-free)敵対的生成ネットワークを導入します。この革新により、「テクスチャスティッキング」が解消され、ビデオやアニメーションのより一貫性のある合成が可能になります。このモデルはStyleGAN2のFIDを達成しつつ、サブピクセルスケールでも平行移動と回転に対して…
AI モデル
UL2 20Bは、様々な言語モデリングパラダイムを統合するオープンソースの統一言語学習モデルです。デノイザーの混合によるデノイジングタスクとして目的をフレーム化することで、ファインチューニングおよび少数ショット学習タスク全体のパフォーマンスを向上させ、言語モデルトレーニングへのバランスの取れたアプローチを提供します。
AI モデル
FLAN-T5は、多様なタスクの混合で特にファインチューニングされたT5言語モデルの強化版です。追加のファインチューニングなしでパフォーマンスが向上しており、様々な自然言語処理アプリケーションですぐに使用できます。複数のサイズで提供されており、さまざまな計算ニーズに対応できます。
AI モデル
PaLM-Eは、実世界の連続的なセンサーデータをテキストと統合する、具現化されたマルチモーダル言語モデルです。これにより、ロボットは言語を知覚に結びつけることで複雑なタスクを実行できるようになり、高度な推論と計画のために多様なトレーニングドメインと具現化にわたるポジティブな転移を示します。
AI モデル
DGCNNは、Dynamic Graph CNNを実装した点群学習用AIモデルです。分類やセグメンテーションなどの3D点群データ処理タスクで最先端の性能を達成しています。PyTorch実装が利用可能で、実世界のシナリオにも応用されています。
AI モデル
Wav2vec 2.0は、自動音声認識のための自己教師あり学習アルゴリズムです。生の音声から学習し、高い精度を達成するために最小限の書き起こしデータしか必要としません。これにより、広範なラベル付きデータセットへの依存を減らし、より多くの言語、方言、ドメインでの音声認識が可能になります。
AI モデル
AudioLMは、長期的な一貫性を持つ高品質なオーディオを生成するAIモデルです。オーディオ生成を言語モデリングタスクとして扱い、オーディオを離散トークンにマッピングします。このフレームワークは、未知のスピーカーやスタイルに対しても、音声や音楽の自然で一貫性のある継続を生成することに優れています。
ALIGNは、10億以上の画像とaltテキストのペアから得られるノイズの多いテキスト監視を使用して、視覚および視覚言語表現学習をスケーリングするAIモデルです。クロスモーダル検索および視覚のみのタスクで最先端の結果を達成し、ゼロショット分類およびマルチモーダル検索を可能にします。
Flamingoは、Google DeepMindが開発した単一のビジュアル言語モデル(VLM)であり、多様なマルチモーダルタスクにおける少数の例からの学習(few-shot learning)に優れています。画像、動画、テキストが混在した入力を処理し、関連する言語出力を生成します。追加のトレーニングなしで、タスク固有の例を最小限で済ませることができます。
AI モデル
BEiTは、マスク画像モデリングを用いてビジョントランスフォーマーを事前学習する自己教師あり学習の視覚表現モデルです。画像を視覚トークンにトークン化し、マスクされたパッチを復元することで、画像分類やセマンティックセグメンテーションなどの下流タスクで競争力のある結果を達成します。
AI モデル
Variational Autoencoders (VAEs) は、潜在空間表現に対する確率論的なアプローチを提供します。標準的なオートエンコーダーとは異なり、VAE は観測値を確率分布にエンコードし、より滑らかな潜在空間と生成能力を可能にします。これにより、よりニュアンスのあるデータ表現と再構築が可能になります。
Reformerは、広範なシーケンシャルデータを処理するためにTransformerアーキテクチャを強化するAIモデルです。アテンションメカニズムとメモリ割り当ての制限に対処し、16GBのメモリを搭載した単一のアクセラレータで最大100万語のコンテキストウィンドウを可能にします。
AI モデル
ImageBindは、Meta AIが開発したマルチモーダルAIモデルであり、画像、動画、音声、テキスト、深度、熱の6つのモダリティからのデータを結合します。明示的な教師なしで単一の埋め込み空間を学習し、AIシステムにおける高度なクロスモーダル理解と生成を可能にします。
AI モデル
Intern Large Models(InternLM)は、Shanghai AI Laboratoryが開発したオープンソースのLLMおよびMLLMを提供します。そのスイートには、InternVLやInternLM-XComposerなどのモデルに加え、ファインチューニング用のXTunerやデプロイ用のLMDeployを含む開発およびアプリケーション用の…
AI モデル
通义实验室 (Meet Tongyi) は、Alibaba Cloud の Tongyi Qianwen 大規模言語モデルの公式ウェブサイトです。モデルの全ラインナップ、最新の業界ニュース、最先端のアプリケーションを紹介し、自然言語処理、テキスト生成、視覚理解における能力を包括的に概観します。
Zephyr-7B-βは、Direct Preference Optimization(DPO)を用いてMistral-7B-v0.1からファインチューニングされたオープンソース言語モデルです。MT-BenchおよびAlpacaEvalベンチマークで高い性能を示し、チャットアプリケーションに適した有益なアシスタントとして優れています。
Fuyu-8Bは、デジタルエージェント向けに設計されたオープンソースのマルチモーダルAIモデルです。そのシンプルなアーキテクチャは、任意の画像解像度をサポートし、グラフ、図、UI要素に関する質問に高速に応答することを可能にします。標準的なベンチマークで高い性能を発揮し、HuggingFaceで利用可能です。
IDEFICSは、最先端の機能を再現するオープンアクセス可能なビジュアル言語モデルです。画像とテキストのインターリーブ入力を受け付け、テキスト出力を生成し、Flamingoのようなプロプライエタリモデルに匹敵します。9Bおよび80Bのパラメータサイズで利用可能で、マルチモーダルAIの研究開発をサポートします。
AI モデル
MiniGPT-4は、凍結されたビジュアルエンコーダーと大規模言語モデルを連携させることで、視覚と言語の理解を強化するAIモデルです。詳細な画像説明の生成、ドラフトからのウェブサイト作成、画像に触発された物語の執筆、視覚的な問題の解決など、高度なマルチモーダル能力を発揮します。
AI モデル
LLaVAは、汎用的な視覚と言語の理解のために、ビジョンエンコーダーと言語モデルを組み合わせた大規模マルチモーダルモデルです。マルチモーダルチャット機能に優れ、GPT-4を模倣し、視覚的指示チューニングを通じてScience QAのようなベンチマークで最先端の精度を達成しています。
AI モデル
Mambaは、特に言語のような情報密度の高いデータに対して効果的な、効率的なシーケンスモデリングのために設計された新しい状態空間モデルアーキテクチャです。ハードウェアを意識した実装を提供し、以前のサブ二次モデルを上回り、Transformerに匹敵することを目指しています。
AI モデル
RWKVは、効率的な推論と柔軟なファインチューニング機能を提供する強力な言語モデルです。デスクトップGUI、Webベースの推論、モバイルアプリなど、さまざまなアプリケーションをサポートし、多様なタスクのために複数のプラットフォームやデバイスで高度なAIへのアクセスを可能にします。
AI モデル
OpenELMは、Apple Machine Learning Researchが開発した最先端のオープン言語モデルファミリーです。精度向上のためのレイヤーごとのスケーリング戦略を特徴とし、ログやチェックポイントを含む公開データセットでのトレーニングと評価のための完全なフレームワークを提供します。また、AppleデバイスでのMLX統合用のコードも含まれていま…
AI モデル
N-BEATSは、単変量時系列予測のためのニューラルネットワークベースのモデルです。ServiceNow Researchによって開発され、再現性のある実験結果を実現するためにN-BEATSアルゴリズムを実装しています。このリポジトリは、高度な時系列分析のためのPyTorch実装、データセットローダー、および実験設定を提供します。
AI モデル
零一万物 (01.AI) は、基盤モデルのブレークスルーを原動力とするAI 2.0に注力するグローバルAI企業です。テクノロジー、プラットフォーム、アプリケーションに革命をもたらし、AIが人間の生産性と社会価値を高める新しいエコシステムを創造することを目指しています。そのビジョンは、AGI(汎用人工知能)をすべての人にアクセス可能で有益なものにすることです。
AI モデル
DBRXは、Databricksが提供する最先端のオープン大規模言語モデル(LLM)であり、言語、プログラミング、数学のベンチマークで優れた性能を発揮します。GPT-3.5を凌駕し、Gemini 1.0 Proに匹敵する効率性と品質の向上を実現し、高度なLLM機能をエンタープライズおよびオープンコミュニティに提供します。
AI モデル
ImagenはGoogle Researchが開発したテキストから画像を生成する拡散モデルです。言語を深く理解し、フォトリアルな画像を生成します。Imagenは画像とテキストの整合性およびサンプルの忠実性に優れており、人間の評価で他のモデルを凌駕し、COCOなどのベンチマークで最先端のFIDスコアを達成しています。
AI モデル
このAIモデルは、統計的機械翻訳のために、RNN Encoder-Decoderという新しいニューラルネットワークアーキテクチャを導入しています。2つのリカレントニューラルネットワークを使用して、ソースシーケンスをベクトルにエンコードし、ターゲットシーケンスにデコードすることで、翻訳性能を向上させ、意味のあるフレーズ表現を学習します。
AI モデル
OpenLLaMAは、Meta AIのLLaMA 7Bモデルを許可なく利用可能なライセンスで再現したオープンソースモデルです。RedPajamaデータセットで学習され、3B、7B、13Bのパラメータバージョンを提供し、既存のLLaMA実装にシームレスに統合するためのPyTorchおよびJAXウェイトを提供します。
AI モデル
UNITERは、ECCV 2020の論文「UNITER: UNiversal Image-TExt Representation Learning」の研究コードリポジトリです。VQA、VCR、画像-テキスト検索など、様々なビジョンと言語のタスクにおけるファインチューニングと推論のためのコードを提供します。UNITER-baseおよびUNITER-largeの…
AI モデル
OscarとVinVLは、ビジョン・言語タスクのための高度なAIモデルです。Oscarはオブジェクト・セマンティクス・アラインメントを用いた事前学習により、最先端の結果を達成しています。VinVLは視覚表現を強化し、様々なビジョン・言語ベンチマークでの性能をさらに向上させています。このプロジェクトでは、再現およびさらなる研究のためのコード、事前学習済みモデル…
AI モデル
汎用的な拡散モデルであるDiffWaveを搭載した音声合成デモをご覧ください。このリソースは、ニューラルボコーダー、クラス条件付き生成、無条件波形生成、音声ノイズ除去の機能を紹介します。様々なデータセットや条件におけるモデルのパフォーマンスに関する音声サンプルと洞察を提供し、その柔軟性を強調しています。
AI モデル
FastSpeech 2は、音声品質とトレーニング速度を向上させるエンドツーエンドのテキスト読み上げモデルです。ピッチやエネルギーなどの音声のバリエーション情報を直接組み込むことで、教師蒸留を排除し、より高速で高品質な音声合成を可能にし、以前の非自己回帰モデルを改善しています。
AI モデル
HiFi-GANは、効率的かつ高忠実度の音声合成を実現する敵対的生成ネットワークです。オーディオ内の周期的なパターンをモデル化してサンプル品質を向上させ、高速で人間のような品質を達成します。このモデルは、単一話者、未知の話者、エンドツーエンド合成をサポートし、CPU向けの小型フットプリント版も提供しています。
AI モデル
Vision Transformer (ViT) リポジトリは、画像認識タスク用のモデルとコードを提供します。ImageNet および ImageNet-21k データセットで事前学習済みの Vision Transformer および MLP-Mixer アーキテクチャの実装が含まれており、JAX/Flax でのファインチューニング用コードも提供します。
AI モデル
FNetは、自己注意機構をフーリエ変換に置き換えた効率的なTransformerライクなエンコーダーアーキテクチャです。Google Researchによって開発され、自然言語処理タスクにおいて高性能な代替手段を提供します。このモデルはJax/Flaxで実装されており、事前学習およびファインチューニングのためにGitHubで利用可能です。
AI モデル
SpanBERTは、テキストの範囲(スパン)の表現と予測に焦点を当てることで、事前学習の改善を目指すAIモデルです。HuggingFace BERTフォーマットと互換性のある、事前学習済みのベースモデルとラージモデルを提供します。このリポジトリには、質問応答や関係抽出を含む様々なNLPタスクでSpanBERTを使用および評価するためのコードが含まれています。
AI モデル
LayoutLMは、視覚的にリッチなドキュメントの理解と情報抽出のためのマルチモーダル事前学習モデルです。テキスト、レイアウト、画像情報を組み合わせて、フォームやレシートの理解などのタスクで最先端の結果を達成します。このモデルは、多言語サポートを含む、さまざまなサイズとバージョンで利用可能です。
AI モデル
UniLMは、Microsoftが開発した大規模な自己教師あり事前学習フレームワークです。テキスト、画像、音声を含む多様なタスク、言語、モダリティを横断してモデルが学習できるようにします。このプロジェクトは、高度なAI研究開発のための基盤モデルとツールキットを提供します。
AI モデル
MASSは、シーケンス・トゥ・シーケンスの言語生成タスクのための事前学習手法です。エンコーダーがデコーダーで予測するために文の断片をマスクし、ニューラル機械翻訳やテキスト要約などのタスクを強化します。このコードベースは、Fairseqに基づいた様々なアプリケーションをサポートしています。
AI モデル
PEGASUSは、Google Researchが開発した最先端の抽象的テキスト要約モデルです。革新的な事前学習目的であるギャップ文生成(gap-sentence generation)を活用し、多様な要約タスクで優れた性能を発揮します。このモデルは、高いサンプル効率を示し、高品質な結果を得るために最小限のファインチューニングデータで済みます。
AI モデル
ProphetNetは、自然言語生成に焦点を当てたMSRA NLCチームの研究プロジェクトです。将来情報、共同生成・ランク学習、拡散ベースのテキスト生成などの事前学習済みモデルの公式実装を提供しています。プロジェクトはGitHubでホストされています。
DeBERTaは、Microsoft Researchによって開発された大規模事前学習済み言語モデルです。T5 11Bモデルを性能で凌駕し、SuperGLUEベンチマークで人間レベルの結果を達成しています。この先進的なモデルは、自然言語理解タスクに顕著な能力を提供します。
AI モデル
Funnel-Transformerは、計算コストを削減するために隠れ状態を圧縮するAIモデルです。同じFLOPsでより深く、またはより広いモデルを構築でき、標準的な事前学習のためにトークンレベルの表現を復元できます。このモデルはTensorFlowとPyTorchの両方の実装で利用可能です。
AI モデル
ConvBERTは、スパンベースの動的畳み込みを特徴とする新しいアーキテクチャを持つ、言語モデルの事前学習のためのオープンソースAIモデルです。このGitHubリポジトリには、V100 GPUでテストされたConvBERTモデルの事前学習およびファインチューニング用のコードが含まれており、TensorFlowでの使用方法も記載されています。
AI モデル
MPNetは、BERTやXLNetを改良した言語理解タスク向けの新しい事前学習手法です。様々な事前学習モデルの統一的な実装を提供し、GLUEやSQuADなどの多様な言語理解タスクにおける事前学習およびファインチューニング用のコードをサポートします。
StyleSwinは、高解像度画像生成のために設計されたTransformerベースの敵対的生成ネットワーク(GAN)です。Swin Transformerと新しいダブルアテンションメカニズムを活用し、計算効率とモデリング能力のバランスを取り、最大1024x1024の解像度で優れた結果を達成します。
AI モデル
Decision Transformer は、強化学習をシーケンスモデリング問題として再定式化し、GPT-x や BERT のような Transformer アーキテクチャを活用します。望ましいリターン、過去の状態、および行動を条件付けることで最適な行動を生成し、Atari、OpenAI Gym、Key-to-Door…
AI モデル
このGitHubリポジトリは、NeurIPS 2021の論文「Revisiting Deep Learning Models for Tabular Data」の公式実装を提供します。表形式データのためのディープラーニングアーキテクチャを探求し、MLPライクなモデルを強力なベースラインとして強調し、Transformerアーキテクチャの強力な適応であるFT-…
AI モデル
SPP_netは、視覚認識におけるディープ畳み込みネットワークのためのSpatial Pyramid Poolingアルゴリズムの再実装です。2014年のECCV論文の物体検出結果を再現することを目指し、コード公開の容易さからCaffeを利用しています。本プロジェクトは、モデルのトレーニングとファインチューニングのためのコードを提供します。
AI モデル
ShuffleNet シリーズリポジトリは、モバイルデバイスやリソースが制約された環境向けに設計された、非常に効率的な畳み込みニューラルネットワークモデルのコレクションを提供します。これには、ニューラルアーキテクチャ検索や物体検出バックボーン用のツールと共に、ShuffleNetV1、ShuffleNetV2、および特殊なバリアントなどの様々なバージョンが含…
AI モデル
MnasNetは、速度制約を検索報酬関数に直接組み込むことで、モバイル機械学習モデルの設計を自動化します。このプラットフォームを意識したアプローチは、モバイルデバイス上で手作業で設計されたモデルを凌駕する、精度と速度のバランスの取れたモデルを特定します。
AI モデル
このリポジトリは、画像認識タスク用の畳み込みニューラルネットワークアーキテクチャであるConvMixerの実装を提供します。論文「Patches Are All You Need? 🤷」に基づいており、評価用の事前学習済みモデルの重みと、ImageNet-1kやCIFAR-10などのデータセットでのトレーニング用コードが含まれています。
AI モデル
RepVGGは、ImageNetで高い精度を達成する、強力かつシンプルなConvNetアーキテクチャです。VGGスタイルの設計に再パラメータ化技術を採用し、効率的な推論を可能にします。このプロジェクトでは、事前学習済みモデル、トレーニングコード、および様々なコンピュータビジョンタスクのためのサンプルを提供しています。
AI モデル
MobileOneは、モバイルデバイス向けに設計された効率的なニューラルネットワークバックボーンです。推論速度を最適化し、高い精度を維持しながらiPhone12で1ms未満を実現します。このモデルは、画像分類、物体検出、セマンティックセグメンテーションのタスク全体で汎用性を示し、レイテンシと精度の両方で大幅な改善を提供します。
AI モデル
Vision GNN (ViG) は、Huawei Noah's Ark Lab によって開発された Vision Graph Neural Networks の PyTorch 実装です。ViG および Pyramid ViG アーキテクチャの両方について、事前学習済みモデルとトレーニングスクリプトを含み、画像処理タスク向けの効率的な AI…
AI モデル
Deformable Convolutional Networks (DCN) は、畳み込みカーネルのサンプリングオフセットを適応的に学習することで、ディープラーニングモデルを強化します。これにより、ネットワークは幾何学的変換やオブジェクトの変形をより良く捉えることができ、オブジェクト検出やセマンティックセグメンテーションなどのタスクでパフォーマンスが向上し…
AI モデル
PointPillars for KITTI object detection は、KITTI データセットで PointPillars の論文結果を再現するためのコードを提供する GitHub リポジトリです。これは SECOND…
AI モデル
SECOND PyTorchは、KITTIおよびNuScenesデータセット向けのSECONDオブジェクト検出ネットワークのオープンソース実装です。LiDARデータからの効率的な3Dオブジェクト検出のためにスパース畳み込みを利用しています。このプロジェクトは、Python 3.6+およびPyTorch…
CTRLは、制御可能なテキスト生成のための16億パラメータを持つ条件付きTransformer言語モデルです。ドメイン、エンティティ、タスク固有の動作を指定するために制御コードで条件付けを行い、生成されるコンテンツに対するより明示的な制御を可能にします。ニュアンスのあるテキスト生成を求める研究者や開発者に役立ちます。
AI モデル
DialoGPTは、対話応答生成のための大規模事前学習済み言語モデルです。Microsoftによって開発され、GPT-2アーキテクチャを活用し、膨大なRedditの対話データで学習されており、人間品質の会話応答の生成を目指しています。様々な計算ニーズに対応するため、複数のモデルサイズが提供されています。
Meenaは、オープン ドメイン対話のために設計された26億パラメータのニューラル会話モデルです。既存のチャットボットよりも、より妥当で具体的な応答を提供することを目指し、人間のような対話を改善し、言語練習やインタラクティブ エンターテイメントなどの分野での応用可能性を提供します。
GODELは、目標指向型対話生成のための大規模事前学習済みTransformerベースモデルです。外部テキストに基づいた応答生成に優れており、様々な対話タスクに対して効率的なファインチューニングを可能にします。リポジトリには、研究開発用のコード、データセット、事前学習済みモデルが提供されています。
AI モデル
RETRO(Retrieval Enhanced Transformers)は、検索機能をトランスフォーマーアーキテクチャに組み込んだAIモデルです。ウェブページ、書籍、ニュース、コードなど、膨大なテキストデータベースにアクセスし、言語生成の精度と事実の一貫性を向上させます。この手法は、標準的なトランスフォーマーと比較して大幅なパフォーマンス向上をもたらしま…
AI モデル
BERTは、100以上の言語をサポートするCasedとUncasedの2つの多言語モデルを提供しています。Casedモデルは、ラテン文字以外のアルファベットや一般的な用途に推奨され、Uncasedモデルは旧バージョンです。これらのモデルは自然言語理解タスク向けに設計されており、特定のアプリケーションに合わせてファインチューニングできます。
AI モデル
LS-GAN、またはLoss-Sensitive Generative Adversarial Networksは、GANの進化に焦点を当てたプロジェクトです。損失関数の革新的なアプローチを導入し、生成品質と安定性の向上を目指しています。このプロジェクトは、LS-GANとそのバリアントを実装および実験するためのソースコードを提供します。
AI モデル
This GitHub repository provides an official Chainer implementation for conditional image generation. It utilizes spectral normalization and a projection discriminator for…
AI モデル
このリポジトリは、MADE (Masked Autoencoder Density Estimation) の PyTorch 実装を提供します。MLP の接続をマスキングすることで、オートエンコーダーを自己回帰型密度モデルに変換できます。このコードは、二値化 MNIST の例とともに、効率的な尤度評価とサンプリングを可能にします。
AI モデル
Lyraは、Googleが開発した革新的な超低ビットレート音声コーデックです。機械学習を活用して音声信号を圧縮し、最も遅いネットワークでも高品質な音声通信を可能にします。Lyraは、抽出された特徴から音声信号を再構築するために生成モデルを使用することで、従来のコーデックと比較して大幅な帯域幅削減を実現します。
AI モデル
SoundStormは、効率的で非自己回帰的なオーディオ生成のためのAIモデルです。高品質なオーディオを従来の数百分の一の速度で生成し、音声と音響条件の一貫性を維持します。話される内容、話者の声、話者のターンを制御して、自然な対話セグメントを合成できます。
AI モデル
GluonTSは、PyTorchおよびMXNet上に構築されたディープラーニングモデルを活用する、確率的時系列モデリングのためのPythonパッケージです。予測を確率分布の形式で生成し、予測区間を含めることで、複雑な時系列分析に適した正確な予測を可能にします。
AI モデル
LSTNetは、時系列予測のために設計されたディープラーニングモデルです。リカレントニューラルネットワークと畳み込みニューラルネットワークを組み合わせることで、長期および短期の時間的パターンを効果的にモデル化します。このモデルは、特に複雑な時系列データに有用です。
AI モデル
Autoformerは、分解トランスフォーマーと自己相関メカニズムを活用した長期時系列予測のためのAIモデルです。様々なベンチマークで最先端の結果を達成し、実用的なアプリケーションにおける予測精度の向上に向けたシリーズ間の接続に関する新しいアプローチを提供します。
AI モデル
Informer2020 GitHubリポジトリは、効率的な長系列時系列予測のために設計されたInformerモデルのPyTorch実装を提供します。ProbSparse Attentionを特徴とし、自己注意スコアのロングテール分布を処理することで、複雑な予測タスクに対する高度なソリューションを提供します。
AI モデル
FEDformerは、効率的な長期時系列予測のために設計されたFrequency Enhanced Decomposed Transformerです。系列長に対して線形計算量で動作し、多変量および単変量データセットの両方で予測誤差を大幅に削減することで、最先端の手法を上回ります。このモデルはオープンソースコードとして利用可能です。
AI モデル
PatchTSTは、Transformerベースのモデルの公式実装であり、長期時系列予測に特化しています。時系列データをパッチに分割し、それらを独立して処理することで、効率的かつ効果的な予測を実現します。本プロジェクトは、教師あり学習と自己教師あり学習の両方のアプローチに対応したコードを提供し、堅牢な予測能力を可能にします。
AI モデル
LTSF-Linearは、「Are Transformers Effective for Time Series Forecasting?」の公式PyTorch実装です。長期時系列予測タスクにおいてトランスフォーマーを上回る性能を発揮する線形モデルファミリー(Linear, DLinear, NLinear)を導入し、高い効率性と解釈可能性を提供します。
AI モデル
TimesNetは、1D時系列データを2D空間に変換してモデリングを強化する、汎用時系列分析のための基盤モデルです。予測、補間、異常検知、分類において最先端の結果を達成し、多様な時間パターンにわたる堅牢な表現学習のためにビジョンバックボーンを活用しています。
AI モデル
このリポジトリは、「Model-Agnostic Meta-Learning for Fast Adaptation of Deep Networks」論文で詳述されている強化学習実験のためのコードを提供します。これにより、研究者や開発者は、RLコンテキストにおける深層ニューラルネットワークの高速適応のためのメタ学習技術を探求できます。
AI モデル
このリポジトリには、NeurIPS 2017 の論文「Few-shot Learningのためのプロトタイプネットワーク」のコードが含まれています。少数の例からモデルを学習可能にする、新しい少数学習アプローチの実装を提供します。
AI モデル
このリポジトリは、CVPR 2018の論文「Learning to Compare: Relation Network for Few-Shot Learning」のPyTorchコードを提供します。Few-Shot Learningの側面に焦点を当て、Omniglotやmini-Imagenetなどのデータセットでのモデルのトレーニングとテストの実装を提供…
This GitHub repository contains the code for the paper "Generative Adversarial Imitation Learning." It implements Trust Region Policy Optimization and provides scripts for…
AI モデル
このGitHubリポジトリには、「When to Trust Your Model: Model-Based Policy Optimization」論文のコードが含まれています。モデルベースのポリシー最適化アルゴリズムの実装を提供し、研究者や開発者が実験を再現し、強化学習の研究をさらに発展させることを可能にします。
このリポジトリには、「Probabilistic Dynamics Models を用いた少数の試行での深層強化学習」に関する実験コードが含まれています。PETS アルゴリズムを実装しており、不確実性を考慮した深層ネットワークのダイナミクスモデルと、サンプリングベースの不確実性伝播を組み合わせることで、RL タスクにおける効率的なサンプル学習を実現します。
AI モデル
PlaNetは、潜在的なダイナミクスを学習することでピクセルからのプランニングを行うモデルベース強化学習アルゴリズムです。学習済みの潜在空間で将来の報酬を効率的に予測し、環境との相互作用を少なく抑えながらモデルフリー手法と競合します。このプロジェクトでは、オープンソース実装を提供します。
AI モデル
OpenAI Fiveは、OpenAIによって開発された5つのニューラルネットワークからなるチームです。このAIシステムは、複雑なゲームであるDota 2において、アマチュアの人間チームと対戦し、勝利する能力を示しており、高度な戦略性と協調性を備えたAIを実証しています。
AI モデル
AlphaStarは、複雑なリアルタイム戦略ゲームであるStarCraft IIでグランドマスターレベルを達成したAIモデルです。マルチエージェント強化学習と模倣学習を活用し、ゲームの制限なしに人間のような制約下でプレイすることで、動的な環境における高度なAI能力を示しています。
AI モデル
Policy gradient methods are a class of reinforcement learning algorithms that directly learn a policy function. Unlike value-based methods, they optimize a policy's parameters to…
SARSAは、マルコフ決定過程のポリシー学習のための強化学習アルゴリズムです。エージェントの現在の状態、行動、報酬、次の状態、次の行動に基づいてQ値を更新し、動的な環境での適応的な意思決定を可能にします。このオンポリシー手法は、インテリジェントエージェントの開発に不可欠です。
AI モデル
Q学習は、現在の状態に基づいてエージェントにアクションの価値を割り当てるように訓練するモデルフリー強化学習アルゴリズムです。環境の明示的なモデルなしで確率的環境を処理し、期待される将来の報酬を最大化することによって意思決定を最適化します。複雑な逐次意思決定問題に役立ちます。
This project provides a Keras-based implementation of Relational Graph Convolutional Networks (R-GCNs). It is designed for semi-supervised node classification on directed…
AI モデル
CompGCNは、Composition-Based Multi-Relational Graph Convolutional NetworksのPyTorch実装です。知識グラフのリンク予測などのタスク向けに高度なグラフ表現学習を可能にし、柔軟な合成演算と様々なスコアリング関数との互換性を提供します。
AI モデル
このリポジトリは、「Simple and Deep Graph Convolutional Networks」(GCNII)モデルのPyTorch実装を提供します。ベンチマークグラフデータセットでの半教師あり学習および全教師あり学習の結果を再現するためのコードと、PyTorch Geometricの参照実装が含まれています。
AI モデル
このGitHubリポジトリは、"Predict then Propagate: Graph Neural Networks meet Personalized PageRank"論文で紹介されたPPNPおよびAPPNPモデルのTensorFlowおよびPyTorch実装を提供します。結果の再現コードや、グラフベースの機械学習プロジェクトへの簡単な統合例が含ま…
This repository provides the official implementation for the "Simplifying Graph Convolutional Networks" paper. It offers a streamlined Graph Convolutional Network (GCN) model that…
AI モデル
Graph Neural PDEs は、グラフ学習を連続的な拡散プロセスとして扱うグラフニューラルネットワーク(GNN)のための Python コードを提供するオープンソースプロジェクトです。GRAND および BLEND モデルを実装し、過平滑化や深さの制限といった一般的なグラフ学習の課題に対処するための新しいアプローチを提供します。
AI モデル
本ブログ記事では、最新のホップフィールドネットワークに基づいた新しいPyTorchホップフィールド層を紹介します。これは、古典的なホップフィールドネットワークを連続的な状態とパターンに一般化し、指数関数的な記憶容量と高速な収束を提供します。更新ルールはTransformerの自己注意機構と同等であることが示されており、新しい深層学習アーキテクチャを可能にしま…
AI モデル
自己組織化マップ(SOM)は、データのトポロジ構造を維持しながらデータ次元を削減する教師なし機械学習手法です。高次元データを通常2次元の低次元表現に変換し、類似したデータポイントをグループ化することで、複雑なデータセットの可視化と分析を容易にします。
Radial Basis Function (RBF) Networkは、活性化関数として放射基底関数を利用する人工ニューラルネットワークです。関数近似、時系列予測、分類、システム制御に優れており、その明確な3層アーキテクチャにより複雑なモデリングタスクに構造化されたアプローチを提供します。
AI モデル
ベイジアンネットワークは、有向非巡回グラフ(DAG)を用いて変数とその条件付き依存関係を表現する確率的グラフィカルモデルです。観測された事象から原因の尤度を予測するのに理想的で、例えば症状から疾患を診断するような用途に適しています。効率的なアルゴリズムにより、これらのネットワーク内での推論と学習が可能になります。
マルコフ確率場(MRF)は、確率的関係を表現する無向グラフモデルです。AIにおいては、特に画像処理やコンピュータビジョンにおけるセグメンテーションやテクスチャ合成などの複雑なシステムにおける依存関係のモデリングに不可欠です。
AI モデル
SAGPoolは、ICML 2019で発表されたSelf-Attention Graph Poolingの公式PyTorch実装です。この読み取り専用のアーカイブ済みリポジトリは、グラフ表現学習を改善するために自己注意メカニズムを活用する新しいグラフプーリング手法のコードを提供します。グラフニューラルネットワークを扱う研究者や開発者に適しています。
AI モデル
Temporal Graph Networks (TGNs) は、動的グラフに対する深層学習のための汎用的かつ効率的なフレームワークを提供します。このPythonベースのライブラリは、新しいメモリモジュールとグラフベースの演算子を利用して、進化するグラフ構造における計算効率と予測精度で既存の手法を上回ります。
AI モデル
EvolveGCNは、動的グラフ向けに設計されたEvolving Graph Convolutional Networksのコードを提供します。このAIモデルはAAAI 2020で発表され、進化するグラフ構造の分析とモデリングのためのフレームワークを提供します。様々なデータセットと実験設定の実装が含まれており、動的グラフ分析の研究を促進します。
AI モデル
xDeepFMは、因子分解モデルのためのオープンソース深層学習ツールキットであり、特にeXtreme Deep Factorization Machine (xDeepFM) モデルのソースコードを公開しています。深層推薦システムや因子分解ベースの機械学習タスクの基盤を提供することを目的としています。
このGitHubリポジトリは、Attentional Factorization Machine (AFM) モデルのTensorFlow実装を提供します。これにより、ユーザーは注意ネットワークを通じて特徴量の相互作用の重みを学習する推薦システムなどのタスクに対してAFMをトレーニングおよび評価できます。プロジェクトには、コード、データ例、および迅速なセット…
AI モデル
LightGCNは、推薦システム向けに設計されたシンプルなグラフ畳み込みネットワークです。協調フィルタリングにおける本質的な近傍集約コンポーネントに焦点を当て、インタラクションデータからユーザーとアイテムの表現を効率的かつ効果的に学習するアプローチを提供します。
Neural Graph Collaborative Filtering (NGCF) は、グラフニューラルネットワークを活用した推薦フレームワークです。ユーザー・アイテムの二部グラフにおける高次の接続性を明示的にエンコードし、埋め込み伝播を実行することで協調フィルタリング信号を表現します。この実装は、SIGIR 2019 の論文に基づいています。
AI モデル
このAIモデルは、記号データの階層的表現学習のためにPoincaré埋め込みを導入します。データを双曲空間に埋め込むことで、ユークリッド埋め込みよりも効果的に階層性と類似性の両方を捉えます。このアプローチは、潜在的な階層構造を持つデータセットに対して、表現能力と汎化能力を向上させます。
AI モデル
Falcon LLMは、アプリケーションやユースケースを進展させるために設計された生成的な大規模言語モデルであり、さまざまな業界や分野で高度なAIを利用可能で影響力のあるものにします。
AI モデル
Claude Fable 5は、コーディングや知識作業における複雑で長期的なタスクのために設計された最先端のAIモデルです。サイバーセキュリティや生物学に対する堅牢な安全対策を備えた高度な機能を提供します。
ToolPotionは、最高のAI モデルを見つけるために人々が閲覧するAIツールディレクトリです。掲載は無料で、すべての投稿は編集者がレビューします。検索の出発点にあなたのツールを置きましょう。