分类 / Categories / カテゴリ
流行词汇 / Buzzwords / 流行語
投稿规则 / Contribution / 投稿
登录 / Login / ログイン
←
修改词条 / Edit entry / 词条を編集
词条标题 / Entry title / 词条タイトル
语言 / Language / 言語
中文
English
日本語
分类 / Category / カテゴリ
流行語
学問分野
行動
ビジネス
コミュニケーション
概念
文化
経済
教育
エネルギー
工学
実体
飲食
地理
政府
健康
歴史
人文学
情報
知識
言語
法律
生命
一覧
マスメディア
数学
自然
人物
哲学
宗教
科学
社会
スポーツ
技術
時間
宇宙
二级分类 / Subcategory / サブカテゴリ
ネット流行語
ACG用語
ゲーム用語
ファンダム用語
顔文字と絵文字
人文学
社会科学
自然科学
形式科学
応用科学
学際分野
学術組織
科目別教育
研究方法
理論的分野
専門研究
地域研究
文化研究
情報学
環境学
人間行動
動物行動
社会行動
心理学
動機
人格
学習
意思決定
管理学
起業
経営管理
経営戦略
経営経済学
企業組織
ビジネスモデル
商法
マーケティング
金融
会計学
電子商取引
経営史
競争
産業
言語コミュニケーション
非言語コミュニケーション
対人コミュニケーション
組織コミュニケーション
マスコミュニケーション
コミュニケーション理論
修辞学
メディア研究
広報
説得
情報交換
異文化コミュニケーション
抽象概念
理論的概念
普遍的概念
形式的概念
基本的概念
概念体系
定義
思想
観念
文化研究
文化人類学
文化史
文化機関
大衆文化
サブカルチャー
民俗
慣習
伝統
物質文化
無形文化遺産
祭り
文化交流
文化遺産
言語と文化
マクロ経済学
ミクロ経済学
経済体系
経済政策
経済発展
国際経済学
労働経済学
金融経済学
政治経済学
経済史
教育段階
教育機関
教育理論
カリキュラム
教育方法
教育心理学
高等教育
初等教育
中等教育
教育政策
職業教育
特別支援教育
遠隔教育
教員養成
評価
再生可能エネルギー
非再生可能エネルギー
電気
燃料
エネルギー政策
エネルギー技術
省エネルギー
発電所
原子力
太陽エネルギー
土木工学
機械工学
電気工学
化学工学
ソフトウェア工学
産業工学
材料工学
環境工学
生体医工学
構造工学
物理的実体
抽象的実体
法的実体
生物学的実体
地理的実体
政治的実体
架空の実体
集合的実体
食品
飲み物
料理
調理
栄養
レストラン
食文化
食材
飲料
食習慣
自然地理学
人文地理学
地図学
地域
地形
水域
気候
生物地理学
地理情報
場所
政府部門
行政
政府機関
地方自治体
中央政府
国際政府組織
公共政策
公務員制度
ガバナンス
医学
公衆衛生
メンタルヘルス
栄養
疾病
医療職
医療制度
フィットネス
医療治療
予防医療
歴史時代
世界史
史学史
社会史
文化史
経済史
古代史
中世史
近世史
近代史
現代史
地域史
地方史
思想史
科学史
技術史
教育史
美術史
哲学
歴史学
文学
言語
芸術
宗教学
古典学
文化研究
考古学
地域研究
文献学
解釈学
倫理学
美学
思想史
情報科学
情報技術
データ
ナレッジマネジメント
情報システム
文書管理
情報理論
記録
デジタル情報
情報検索
情報処理
情報資源
図書館
文書館
メタデータ
認識論
科学的知識
実践的知識
知識表現
ナレッジマネジメント
先住民の知識
学習
信念
理解
専門知識
知識移転
知識組織化
記憶
推論
探究
言語学
文字体系
語族別
文法
意味論
音声学
翻訳
言語学習
言語政策
手話
形態論
統語論
語用論
語彙論
談話分析
刑法
民法
憲法
国際法
行政法
法体系
法律専門職
裁判所
人権法
法理論
生物学
生物
進化
生命過程
生殖
生態学
生命形態
微生物学
遺伝学
テーマ別一覧
国別一覧
人物一覧
年代別一覧
地理別一覧
文化別一覧
科学別一覧
技術別一覧
歴史別一覧
索引一覧
ジャーナリズム
放送
印刷メディア
デジタルメディア
ニュースメディア
広告
娯楽メディア
メディア研究
メディア組織
ソーシャルメディア
出版
映像メディア
音声メディア
視覚メディア
メディア技術
代数学
幾何学
微積分学
数論
確率論
統計学
論理学
応用数学
解析学
離散数学
自然科学
地球科学
生物学
物理学
化学
生態学
環境
天気
天然資源
自然現象
生態系
地質学
気候
海洋
植物
動物
職業別の人物
時代別の人物
人物伝
人生の段階
家族
人体
個人生活
人間発達
人間関係
日常生活
児童期
成人期
高齢化
形而上学
認識論
倫理学
論理学
美学
科学哲学
心の哲学
思想学派
言語哲学
宗教哲学
歴史哲学
古代哲学
近世哲学
応用哲学
宗教学
宗教実践
神学
神話
世界の宗教
宗教文書
宗教組織
精神性
崇拝の場
宗教史
自然科学
形式科学
社会科学
応用科学
科学的方法
科学分野
科学研究組織
科学理論
科学機器
科学的研究
実験
観測
測定
研究所
科学史
社会科学
社会集団
社会制度
社会的過程
コミュニティ
社会学
社会変動
社会的関係
社会組織
社会階層
社会的規範
社会的役割
社会的参加
社会的相互作用
市民社会
チームスポーツ
個人競技
水球
格闘技
ウィンタースポーツ
球技
陸上競技
競技会
スポーツ団体
用具
情報技術
製造業
移送技術
医療技術
エネルギー技術
産業技術
通信技術
消費者技術
発明
道具
機械
自動化
材料技術
デザイン技術
建設技術
カレンダー
年表
時間の単位
歴史時代
時間測定
時間計測
日付
時間用語
季節
時代
天文学
宇宙論
天体
空間
銀河
星
惑星
太陽系
天体物理学
宇宙探査
Markdown 正文 / Markdown body / Markdown 本文
# ImageNet ## 1 歴史と背景 ### 1.1 作成の動機 ImageNetの作成は、コンピュータビジョン研究において大規模かつ構造化された画像データセットの欠如が主な動機である。2000年代後半、既存のデータセット(Caltech 101、PASCAL VOCなど)はカテゴリ数や画像数が限られており、実世界の多様な物体を認識するためのモデル学習に不十分であった。李飛飛は、人間の視覚認識が膨大な数の概念を学習する能力に着目し、WordNetの語彙体系を画像にマッピングすることで、スケーラブルで意味的に豊かなデータベースを構想した。 ### 1.2 開発の経緯 2007年から李飛飛とそのチームは構想を練り、2009年に最初のバージョンを公開した。当初は画像収集にクラウドソーシングを活用し、Amazon Mechanical Turkを通じて多数のワーカーがラベリングを担当した。同年、コンピュータビジョン学会CVPRで発表され、その後データセットは継続的に拡張された。2010年にはImageNet Large Scale Visual Recognition Challenge(ILSVRC)が開催され、コミュニティの注目を集めるきっかけとなった。 ## 2 データセットの構成 ### 2.1 画像の収集元 画像は主にインターネット上の画像検索エンジン(Flickr、Google画像検索など)から収集された。収集後、ノイズ除去と重複排除が行われた。各カテゴリにつき数百から数千枚の画像が確保され、物体の多様な撮影条件(角度、照明、背景)を網羅するよう設計された。 ### 2.2 カテゴリ体系(WordNet) #### 2.2.1 階層構造の概要 ImageNetのカテゴリは、英語の語彙データベースWordNetの「synset」(同義語集合)に基づいている。各synsetは意味的に上位下位関係で結ばれており、例えば「動物」の下位に「哺乳類」、「犬」が位置する。この階層により、画像は粗いカテゴリから細かいカテゴリまで整理される。 #### 2.2.2 ノード数とリーフ数 公開当初、約2万2千のsynsetが存在し、そのうち約1万8千がリーフノード(最も詳細なカテゴリ)であった。バージョンアップを経て、最終的には2万1千を超えるsynsetが登録された。リーフノードは単一の物体や特定の概念に対応する。 ### 2.3 統計的規模 画像総数は約1,400万枚以上に達する。各synsetあたり平均約500枚の画像が含まれるが、人気カテゴリでは数千枚に及ぶ。データサイズは約150GB以上(圧縮状態)で、大規模な保存・計算リソースが必要である。 ## 3 アノテーションと品質管理 ### 3.1 クラウドソーシングによるラベリング アノテーションはAmazon Mechanical Turkを用いたクラウドソーシングで実施された。ワーカーは与えられた画像に対して、適切なsynsetを選択するか、画像が該当するかを判定するタスクを実行した。各画像は複数ワーカーに割り当てられ、多数決でラベルが決定された。この方式により、低コストで大量のラベルを獲得できた。 ### 3.2 品質検証プロセス 精度向上のため、複数段階の検証が行われた。まず、ワーカー間の一致率が低い画像は再評価された。また、専門家によるスポットチェックや自動フィルタリング(異常値を検出)が導入された。さらに、ILSVRCのトレーニングセットでは、正解ラベルが厳密に検証されたサブセットのみが使用された。 ## 4 ImageNet Large Scale Visual Recognition Challenge(ILSVRC) ### 4.1 競技のルールと評価指標 ILSVRCは2010年から2017年まで毎年開催された。タスクは、約1,000カテゴリ(ImageNetのサブセット)から画像を正しく分類することである。評価指標は主にトップ1誤り率とトップ5誤り率(上位5候補に正解が含まれる割合)が用いられた。認識性能の向上に加え、物体検出、画像分割のタスクも設けられた。 ### 4.2 歴代の優勝モデル #### 4.2.1 AlexNet(2012年) 2012年、Alex Krizhevskyらが提案したAlexNetは、畳み込みニューラルネットワーク(CNN)をGPUで大規模に訓練し、トップ5誤り率15.3%を達成(前年優勝の25.8%から大幅改善)。DropoutやReLU活性化関数を導入し、ディープラーニングの有効性を実証した。この成果がコンピュータビジョンにおける深層学習革命の起点となった。 #### 4.2.2 VGGNet、GoogLeNet(2014年) 2014年、VGGNet(オックスフォード大学)は層数を16〜19に深め、均一な3x3畳み込みカーネルを採用してトップ5誤り率7.3%を達成。一方、GoogLeNet(Google)はInceptionモジュールを導入し、パラメータ数を抑えつつ精度を向上させ、トップ5誤り率6.7%で優勝した。 #### 4.2.3 ResNet(2015年)以降の進化 2015年、Microsoft ResearchのResNetは残差学習(skip connection)を用いて152層の深層ネットワークを安定して訓練し、トップ5誤り率3.57%を達成(人間の性能を超えたと言われる)。2016年にはEnsemble手法が、2017年にはSENet(チャネルアテンション)が優勝し、誤り率は2.25%まで低下。2017年を最後にILSVRCは終了した。 ### 4.3 コンペティションが与えた影響 ILSVRCはモデルアーキテクチャの革新を促進し、GPU、大規模データ、深層学習の組み合わせが実用的なレベルに達したことを示した。この競技は、後のImageNet自体の知名度を高め、コンピュータビジョン全体の研究を加速させた。また、産業界における画像認識技術の応用(顔認識、自動運転など)にも大きな波及効果をもたらした。 ## 5 影響と応用 ### 5.1 コンピュータビジョン研究の進展 ImageNetとILSVRCは、画像分類、物体検出、セマンティックセグメンテーションなど基本タスクのベンチマークとして定着した。多くの最先端モデルがこのデータセットで評価され、その結果を基に比較が行われている。また、データセットは物体の多様性と規模の面で、従来の限界を打破する役割を果たした。 ### 5.2 転移学習と事前学習モデル ImageNetで事前学習されたCNNモデル(VGG、ResNet、EfficientNetなど)は、多くの下流タスクで特徴抽出器として利用されている。転移学習により、データの少ない医療画像認識や細粒度分類でも高い性能が達成可能となった。近年のVision TransformerもImageNetで事前学習されるのが一般的である。 ### 5.3 他分野への波及(医療画像、自動運転など) 医療画像解析では、ImageNetで学習したモデルをX線や病理画像の分類に転用する研究が進んだ。自動運転分野では、画像認識のベースラインとして活用されている。また、商品認識、リモートセンシング、農業モニタリングなど多岐にわたる応用が見られる。 ## 6 批判と限界 ### 6.1 データセットのバイアス問題 ImageNetは主に北米や西欧のインターネット画像から収集されており、文化的・地域的バイアスが存在する。一部のカテゴリでは人種、性別、年齢に関するステレオタイプが強化されるリスクが指摘された。また、画像の撮影環境や物体の配置にも偏りが見られる。 ### 6.2 ラベリングの誤りとノイズ クラウドソーシングによるラベルは完全に正確ではなく、誤ラベルや曖昧な画像が含まれることがある。ILSVRCの評価用セットは厳格に検証されているが、全データセットではノイズの割合が約5〜10%と推定されている。これがモデルの性能評価に影響を与える可能性がある。 ### 6.3 プライバシーと倫理に関する議論 ImageNetには個人が写った画像が多く含まれ、特に有名人や一般人の顔写真が許可なく収集されているケースがある。これにより、肖像権やデータプライバシーの問題が提起された。2021年には、一部の顔画像カテゴリが削除されるなどの対応が取られた。また、データセットの商用利用や軍事応用に関する倫理的な議論も続いている。
提交审核 / Submit for review / 審査に提出