全國中小學科展

依國際科展年度查詢

電腦科學與資訊工程

Art Recovery through PConv (Partial Convolutions) and GLCIC (Globally and Locally Consistent Image Completion)

在生成性模型(Generative Models)中的一個主要應用就是“影像修復” (Image Inpainting) 也稱為“影像完成”(Image completion)。 影像修復經常被應用於許多影像處理,包含在生活照片中移除背景不必要的物件再回填移除後缺損的影像。 但是,或許之前的研究較多著墨於技術而非美學,至目前為止,很少有影像修復的研究著重於藝術作品的重建應用。 所以,本研究計畫提出三個新的模型來針對藝術作品做更優化的影像修復,以達到較一般處理日常照片所使用的如Places2 和ImageNet等影像修復技術在視覺上更為自然逼真的處理: 第一種模型是PConv (Partial Convolutions),它利用部分旋積(partial convolution) 來避免一般由於遮蔽區域中畫素起始值設定而常見的影像模糊問題。 第二種模型是GLCIC (Globally and Locally Consistent Image Completion),是一種以GAN (Generative Adversarial Network) 為基礎,進一步在全域鑑別器 (global discriminator) 之上,再建構一個區域性鑑別器(local discriminator),以確保在整體畫面與細部畫面的合理與一致性的方法。 最後一個模型是一個在本研究中所提出的全新、整合性的模型–PConv-GAN。 在這個創新的模型中,我們將GLCIC模型中常用於旋積過程中”補零”(zero padding) 的手法,以PConv模型中部分旋積的方式來取代。最後我們會利用一系列的印象派畫作為例,以L1 loss 和PSNR (peak signal-to-noise ratio) 兩種方法來評估這三個模型。

以分散式邊緣運算網路架構實現智慧機器人代理系統之研究

本研究企圖建構一個運用邊緣運算技術(Edge Computing)之人工智能機器人代理人(AI Agent),並將之運用於實體人型格鬥用機器人的研究開發中。 在此以人型格鬥機器人做為場景需求使用設定目標,運用彈性化模組,加上分散式、嵌入式即時網路技術來降低系統設計的複雜度,整合通訊協議與深度學習YOLO影像演算法,進一步運用ZMP運動控制理論,以及多維感測器融合技術(sensor fusion),融合陀螺儀(GYRO)、加速儀(accelerometer)、CMOS Sensors、FSR(Force sensing resistor)作為人形機器人智慧平衡基礎,再藉由圖形識別做為預測辨識以及智慧姿態ZMP控制技術作為攻防策略判斷。 整體系統藉由AI 晶片與嵌入式系統網路作為整合。透過網路即時傳輸環境資訊與指令,使機器人可以知道高層的指令目的資訊。值得一提的是本系統網路設計建構依照仿生哺乳類動物的分層式架構。神經系統將反射以及即時控制交由智慧代理人軟體作為即時演算與控制來達到高性能與彈性發展的需要,未來可用在高等擴充性的人形機器人使用,包括格鬥機器人,人形機器人工地建材搬運、具自平衡醫療外骨骼機器人......等,使人與機器人能並肩工作,提升人與機器人整合互動。

提升戶外物件辨識模型表現之研究

近年來由於電腦視覺的蓬勃發展,物件辨識模型被廣泛運用在生活中,例如自動駕駛、醫療影像、農作物檢測等等。對於要在戶外運作的模型,由於檢測物體的背景會隨著時間、地點、季節、光照強弱等因素不斷改變,通常需要大量且多元的資料才能避免模型過擬和,然而取得多元的資料需要花費大量的人力與時間在收集以及為這些新資料標籤。 本研究利用影像風格轉換模型作為資料增強的方法,將於晴天拍攝的街景圖轉成夜晚及雨天,使原本只有晴天的資料集有更多元的資料。結果證實使用風格轉換模型生成的影像訓練的物件辨識模型的準確率在某些情況下有顯著的提升。此方法的優點在於能夠快速產生多樣風格的資料,由於是對影像的風格做轉換,影像的內容沒有改變,因此能夠沿用原有的標籤,同時節省了蒐集及為新影像標籤的人力及時間。

以隨機噪音生成技術為基礎的驗證碼對抗式攻擊防禦機制

網路上常常會使用驗證碼(CAPTCHA)防止自動化程序取得網站資源,而一般而言,若驗證碼是可以輕易取得,十分容易被深度學習網路破解。然而,對抗式攻擊(adversarial attack)可以騙過許多深度學習網路。因此,本研究目的為建立能夠破解對抗式攻擊的深度學習網路。主要包含三個部分:建立Captcha breaker、使用對抗式攻擊影響breaker、防禦對抗式攻擊。Captcha breaker的部份使用模擬的目標驗證碼作為訓練資料,以解決訓練資料不足以及人工標籤的問題;而破解adversarial attack會使用adversarial training以及random noising的技術進行。

程式語言學習系統

『程式解題系統』是提供不同難易的題目給學習程式設計者使用的系統,主要透過測試資料來驗證程式碼的正確性和效能姓。然而,這類系統大多為私人用。台灣著名的程式解題系統有台中女中程式解題系統及高中生解題系統(Zero Judge)等,題目雖然繁多卻分類雜亂,不能讓教師客製化題目給學生,只能從眾多題目中,零散的挑出適合學生的題目,給學生練習。基於以上理由,此研究目的是做出不同於一般程式解題系統的功能,希望能讓教師彈性增刪題目。使用Python為基礎語言,後端採用Django框架,已經架構出系統的原型,並上架至Heroku(zeaf.herokuapp.com)。希望循序漸進地讓學習者有成就感,也讓教師能監督每一個學生學習狀況。

A.N.T.s: Algorithm for Navigating Traffic System in Automated Warehouses

According to CNN Indonesia 2020, the demand for e-Commerce in Indonesia has nearly doubled during this pandemic. This surge in demand calls for a time-efficient method for warehouse order-picking. One approach to achieve that goal is by incorporating automation in their warehouse systems. Globally, the market of warehouse robotics is expected to reach 12.6 billion USD by 2027 (Data Bridge Market Research, 2020). In this research, the warehouse system studied would utilize AMR (Autonomous Mobile Robots) to lift and deliver movable shelf units to the packing station where workers are at. This research designed a heuristic algorithm called A.N.T.s (Algorithm for Navigating Traffic System) to conduct task assigning and pathfinding for AMR in the automated warehouse. The warehouse layout was drawn as a two-dimensional map in grids. When an order is placed, A.N.T.s would assign the task to a robot that would require the least amount of time to reach the target shelf. A.N.T.s then conducted pathfinding heuristically using Manhattan Distance. A.N.T.s would help the robot to navigate its way to the target shelf unit, lift the shelf and bring it to the designated packing station. A.N.T.s algorithm was tested in various warehouse layouts and with a varying number of AMRs. Comparison against the commonly used Djikstra’s algorithm was also conducted (Shaikh and Dhale, 2013). Results show that the proposed A.N.T.s algorithm could execute 100 orders in a 27x23 layout with five robots 9.96 times faster than Dijkstra with no collisions. The algorithm is also shown to be able to help assign tasks to robots and help them find short paths to navigate their ways to the shelf units and packing stations. A.N.T.s could navigate traffic to avoid deadlocks and collisions in the warehouse with the aid of lanes and directions.

以深度學習進行心音及高血壓關聯性之研究

2019年衛生福利部死因統計資料顯示和高血壓有高度相關的心臟疾病、腦血管疾病和高血壓性疾病皆在十大死因之列[15]。本研究提出以深度學習對心跳聲的時序頻譜圖進行訓練與分析的研究方法,應用此方法我們能以Convolution Neural Network(CNN)模型從受測者心跳聲預測出其血壓層級。CNN一般用於圖像分類,但在此研究中我們以此來分析心跳聲。本研究發現利用僅萃取第二心音的資料庫訓練效果較佳,並透過熱圖分析注意到模型對特定頻率域較為重視,在後續實驗中更進一步發現0~200 Hz和400~600 Hz在判斷高血壓時扮演重要角色。同時,我們也成功應用此方法,區分出長期高血壓和運動高血壓,證明心血管的結構改變在時序頻譜圖上有對應特徵。若應用於穿戴型裝置持續監控心跳聲,就能隨時追蹤使用者的血壓層級的變化,有異常便能盡早就醫,避免憾事發生。

腦波辨識特徵提取於即時身分認證的研究

本研究的腦波辨識基於特徵提取,可應用於身分認證,具有不能被仿冒的優點。我們用低成本高便利性的腦波儀,自行撰寫程式讀取原始腦波,建立一致性的實驗程序。首先用腦波專心度的高低來控制智能車,再用腦波來測謊,有隱藏說謊行為時會觸發高電位腦波,在兩項前期研究後發現可用腦波特徵進行身分認證。三位受測者於不同日期提取10份腦波,每份腦波紀錄5120筆數據。接著我們反覆嘗試組合數十種統計函數進行特徵提取,找到兩項最佳特徵,達成將大量凌亂腦波資料降低維度又具有辨識力。我們腦波辨識分類方法使用近鄰演算法,測試程序用盲測交叉驗證法,辨識正確率百分百。最後我們用Arduino板來展示腦波辨識應用於腦波身分認證,資料庫中只要儲存每位受測者的腦波特徵值,就能在數秒內正確辨識說出受測者身分,顯示每個人腦波是不同的,而且能用特徵將其分辨出來。

利用半監督式學習進行自動星系分類

本研究使用半監督式機器學習搭配卷積神經網路來訓練核心模型,並將星系的圖片加入模型裡,讓電腦自動判斷出該星系的種類為何。我使用自行設計的CNN架構以及VGG-16當作我的卷積神經網路架構。資料集來源為EFIGI和Galaxy Zoo 2。我分為兩種任務,第一種任務是讓模型能分辨橢圓 (E)、螺旋 (S)、不規則 (I) 這三種類別的星系,訓練資料共有2,468張照片,最後的正確率能達到94%。第二個任務是將8種的星系照片(E、S0、Sa、Sb、Sc、SBa、SBb、SBc)進行分類,並使用自動編碼器作為預訓練,使用1,923張EFIGI的圖片以及1,258張Galaxy Zoo 2的照片當作訓練資料。由於各星系照片有許多外觀太過相似,測試準確度最高達到54.12%,基於我的研究,星系自動化辨識於天文學上應該有相當大的運用空間。

利用深度學習將黑白影片色彩化

1920年代和1930年代,攝影設備剛剛起步,攝影設備只能拍攝黑白圖像的照片或影片,但仍有許多經典電影被記錄下來。如今,隨著科技的進步,攝影設備也在不斷迭代,彩色成像技術和高品質成像技術不斷被更好的技術所取代。因此,如何將黑白圖像轉換為彩色圖像成為一個重要的研究課題。本研究的目的是將黑白影片轉換成彩色影片。我們的方法可以分為兩部分:彩色化模型設計和影片連續性優化。在顏色轉換模型設計部分,我們使用了生成對抗網絡(GANs)技術,基於U-Net設計了5個模型,並使用COCO數據集訓練顏色生成模型。在電影連續性優化部分,我們首先使用景觀數據集中微調的前五個模型中最好的模型。在這個過程中,我們發現模型生成的影片存在顏色不連續的問題。因此,我們設計了三套方案來解決,比如使用H.264重新編碼生成電影,使用平均像素的色調值提高電影的色調穩定性,使用ORB預測個別幀。結果表明,影片的色彩轉換效果表現優異。