跳至主要内容

Computer Vision

What?​

Computer Vision 是一種技術,讓電腦能夠透過影像或視訊資料進行「看」和「理解」。簡單來說,它的目標是模擬人類眼睛與大腦的功能,從影像中提取有用資訊,例如辨識物體、追蹤移動中的物件,甚至解讀文字。
舉例來說,我們日常生活中的臉部辨識功能,以及自動駕駛車輛偵測路邊標誌,都屬於 Computer Vision 的應用。


Who?​

Computer Vision 的使用族群非常廣泛,包括但不限於以下幾類技術工作者:

  • 資料科學家:負責訓練模型並進行影像分析。
  • 軟體工程師:整合 Computer Vision 技術到應用程式或系統中。
  • AI 研發人員:探索更高效的算法,如 Deep Learning 模型。

此外,受影響的範疇也不僅限於技術領域。例如,醫療產業利用它進行 X 光片分析;零售業則透過監控攝影機提升店內安全。


When?​

我們會在以下情境中使用 Computer Vision:

  1. 即時偵測與反應:例如 AI 安全監控系統,當有人闖入特定區域時自動發送警告。
  2. 批量影像處理:如電商網站上,自動分類商品圖片以改善搜尋效率。
  3. 高精度分析需求:如在醫療領域中精確判讀病理切片。

Where?​

在技術架構上,Computer Vision 通常出現在以下部分:

  1. 前端應用層:臉部辨識、物件追蹤等功能直接呈現在使用者界面上。
  2. 後端處理層:執行深度學習模型(例如 CNN)來進行影像分析與數據處理。
  3. 資料儲存層:需要存放大量訓練所需的影像數據集,例如 ImageNet。

Why?​

電腦並不像人類一樣能自然地「看懂」一張照片,因此我們需要使用 **Computer Vision 技術來解決這些問題:

  1. 將非結構化資料(例如圖片或影片)轉化為可分析的結構化數據。
  2. 提升作業效率,例如自動化商品分類或大規模偵測異常事件。
  3. 增強準確性,例如比人工更快、更準地進行 X 光片診斷。

舉例來說,在自動駕駛技術中,如果車輛無法快速辨認紅綠燈,就可能導致危險。因此, Computer Vision 是不可或缺的一環。


How?​

🛠️ 建立階段​

建立一個完整的 Computer Vision 系統通常包含以下步驟:

  1. 資料收集與Annotation

    • 收集大量相關圖片,如道路場景、臉部照片等。
    • 對圖像進行標記,例如給每個物件貼上 Label(如「車輛」、「行人」)。
  2. 模型選擇

  3. 訓練

    • 使用 GPU 訓練深度學習模型,使其能準確預測輸入影像中的內容。
    • 可運用 Transfer Learning 加速訓練過程。
  4. 部署

    • 把訓練完成的模型部署到伺服器或前端裝置(如手機)。

🔍 查詢階段​

查詢階段主要是指系統運作時如何實際執行任務:

  1. 系統接收輸入

    • 例如相機拍攝到新照片,或者收到即時視訊流。
  2. 前處理

    • 對輸入影像進行縮放、去噪,以便後續分析。
  3. 模型推論

    • 使用訓練好的 CNN 模型對影像進行推論,比如判斷畫面內是否有特定物件存在。
  4. 回傳結果

    • 輸出預測結果,如「畫面內有三輛車、一位行人」。

補充說明​