全國中小學科展

電腦科學與資訊工程

建構標準舞蹈姿勢評分系統

在現今社會,個人越來越依賴自主學習以提升技能和知識,而舞蹈學習尤其受到關注。然而,在沒有專業指導的情況下,學員往往難以掌握舞蹈動作的細節,也難以清楚地評估自己的表現與標準示範之間的差距。 為了應對這一挑戰,本研究利用人體姿態識別演算法OpenPose,捕捉舞蹈者的關節點。通過這項技術,針對舞蹈的標準動作、力度、流暢度等方面,成功地開發出一款自動評分系統。 通過人體姿態識別技術,我們能夠深入分析舞蹈動作的細節,讓學員與標準舞蹈動作進行比較,以確認學習上的差異。我們希望通過這項研究,學員能在沒有專業指導的情況下,利用網路平台創建更有效且有趣的自主學習環境。

語音模型逆向攻擊架構分析與防禦策略探討

本研究中,我們對模型逆向攻擊在語音辨識系統中的影響及風險進行深入分析。隨著Siri、Google Home等智能助理設備在日常生活中的廣泛使用,其語者辨識系統的安全隱患引起了我們的注意。本研究目的在於深入理解模型逆向攻擊的運作機制,並探討其對語音辨識系統的攻擊效果。我們透過實施多樣化的攻擊策略,對不同的模型架構和數據處理方法進行了評估,並對人聲與非人聲的數據集進行了攻擊效果的比較。此外,我們亦實現了基於差分隱私的防禦算法,在多數模型架構下達到接近50%的防禦效果,顯著提高攻擊代價。研究整體揭示了語音辨識系統在面對模型逆向攻擊時的脆弱性,並藉由實驗分析推論出可能的防禦策略,期待能通過策略來增強模型的安全性。

基於特徵解耦的視覺轉換器之指靜脈辨識模型

發展安全且可靠的身份辨識技術是當今的重要議題,而指靜脈因其高安全性及難以偽造特性成為我們的主題。本研究提出一種基於Transformer模型架構的指靜脈辨識模型稱為GLA-FD,旨在解決現有技術對指靜脈影像特徵表示與提取的局限性。透過開發特徵解耦與重建模組(FDRM),模型能夠有效區分指靜脈的背景資訊與紋理特徵,並將其重新組合以提升辨識準確度。此外,本研究開發的全域-局部注意力模組(GLAM)能同時捕捉影像的全域與局部特徵,進一步強化模型對指靜脈特徵的理解。GLA-FD在FV-USM、PLUSVein-FV3、MMCBNU-6000、UTFVP、NUPT-FPV 資料集中的正確辨識率(CIR)達到100%、98.47%、99.75%、96.11%、99.82%,展現卓越的穩定性與泛化能力。此外,本模型在處理不同年齡層、國籍與影像模糊度的資料下,仍能保持高辨識準確度,顯示其在需要高安全性辨識的應用場景中具備廣泛的實用性。

分子結構語言與熔沸點性質的人工智慧預測

背景:預測分子性質如溶解度、毒性及熔沸點對於基礎科學至關重要。然而,實驗測量這些性質耗時且昂貴,因此本研究使用多種機器學習模型藉由調整變相來準確預測熔、沸點。 方法:本研究使用超過一萬筆數據及兩種類型的機器學習方法:淺度與深度學習。淺度學習由 PyCaret實現,並以Mordred作為分子描述器;深度學習使用圖神經網路,包括(CMPNN和GCN),並調整隱藏層參數。 結果:CMPNN在目前嘗試的模型中表現最佳。發現影響沸點預測的關鍵特徵是piPC1,與鍵級相關;熔點則是AATS0d,與σ電子的 Moreau-Broto自相關有關。 結論:CMPNN模型在沸點與熔點預測中均表現最佳。沸點中深度學習模型優於淺度學習模型(p<0.05)。此外,使用SHAP成功找出piPC1和AATS0d對最關鍵。本研究不僅得出了高準確性的模型,還發現了影響分子性質的關鍵特徵,且可擴展至其他預測。

AI時光機-利用照片轉換技術重溫在地歷史

目前網路上流傳許多使用人工智慧修復照片的網站或應用軟體。然而,由於這些訓練資料多數來自國外,導致修復中式建築照片的效果欠佳。此外,許多老舊照片因氧化、潮濕而泛黃,使得修復程序比起修復純黑白相片更加困難。因此,本研究旨在建🖂一個專門修復中式建築物的機器學習模型,主要分為以下三個部分:首先,使用機器學習模型對老舊照片進行修復,包括著色、去模糊化和降噪;其次,分析使用不同比例之有色調照片(模擬泛黃照片)訓練模型的效果;最後,研究不同的修復順序(著色、去模糊化、降噪)和模型執行次數對照片修復效果的影響,發現「著色、去噪、去模糊化」的順序修復效果最佳。此外,許多老舊照片因為受損等原因,只剩下極少的特徵,因此本研究採用機器學習模型,以延伸重建原始照片。透過這種方法,我們能夠重新建構當時建築物周圍可能的場景和情境。

使用大型語言模型生成音樂中的故事

本研究旨在探索大型語言模型如何應用於音樂生成故事。研究動機源自音樂作為文化中不可或缺的一部分,但若要以文字精準表達出音樂中的故事情緒尚屬困難,藉由本研究提出的方法可以使故事顧及到音樂的情緒起伏。隨著 AI 的發展,我 們開始看到它們在各領域的應用。這項研究的目的是製作出一個系統能以音樂作為輸入,輸出音樂內的故事,為達成目的,我們結合多個模型。研究使用 PyTorch等工具,並探討文句和音樂的共同表示方法,實現情感匹配。研究結果顯示,音樂和文句情感辨識模型表現不錯,也研發出一個完整的生成流程。目前已有直接生成音樂的模型,也有把音樂統整介紹的模型,卻沒有依據音樂中的情緒生成故事的模型。我們研究就是在解決這個問題,結合到 LLaMA2預訓練模型生成出具情緒浮動的故事,要注意的是 LLaMA2的輸出限制最多只能有 4096個token。我們將此產生過程稱為 MTSPL (Music To Story Procedure with LLaMA)。

以深度學習進行籃球慣用動作分析

本研究聚焦於籃球員的慣用動作分析,透過深度學習技術開發了一套籃球動作分析系統,旨在準確分析籃球員在籃球運動中的個人動作特徵來進行動作辨識。我們透過自行蒐集籃球動作的影片,並使用MMAction2這個資源庫來進行動作辨識模型的訓練,將訓練好的動作辨識模型用開發慣用動作分析系統。系統流程首先使用滑動視窗(Sliding Window)的機制將即時拍攝的影像變成有序列的連續影像片段,再即時傳送至進攻動作辨識的深度學習模型中,來辨識出連續影像片段中的動作序列屬於何種特定動作,藉此將多個連續影像片段中的動作序列各自轉換為單一動作單元並依次輸出。最終,系統基於前述單一動作資料進行綜合分析,以統計使用者的籃球慣用動作。此分析系統能為籃球愛好者提供清晰的動作偏好資料,具有提升訓練成效的潛力,同時為籃球技術分析與訓練提供了一個精確的數據分析工具。

FVeinLite: 輕量化CNN手指靜脈辨識模型與醫療領域之應用

台灣少子化、老齡化問題迫切,醫療資源入不敷出,使得遠距醫療成為潛在的解決方案與趨勢。然而,遠距醫療的身份驗證安全性尚未完善。指靜脈辨識有非接觸、體內生物特徵等特性,其在衛生性和高安全性的優勢在醫學相關領域與醫療院所備受關注。若能夠開發出遠距醫療可用的指靜脈辨識,將有機會為遠距醫療產業的安全性貢獻一份心力。本研究主要分為兩階段:其一旨在優化指靜脈辨識技術,利用輕量化 CNN 指靜脈辨識模型,結合 Mini-RoI 技術, 使用 FV-USM 以及 PLUSVein-FV3 兩個資料集訓練我們開發的 FVeinLite 指靜脈辨識模型,並使用不同的 epoch 值訓練出最好的模型。而我們訓練的模型相較於其他指靜脈技術具有高辨識正確率、參數量更少、運算速度快等優勢。其二,我們將模型結合自製的低成本嵌入式裝置, 並製作 API 與並使用模擬的病患資料完整打造一個可使用於遠距醫療及醫療院所的指靜脈身分辨識系統。

利用Chain-of-thought Prompt優化ChatGPT邏輯推理方面的能力

ChatGPT 問世後,許多問題皆已能由其回答。然而在邏輯方面的問題,ChatGPT 免費版有著明顯的不足,時常出現似是而非的答案。為了解決此問題,本研究利用連線 ChatGPT API,使用四種 Chain-of-thought prompt 的方式,將問題分解成若干個子問題,利用子問題們提供原問題較多的資訊以降低在解題過程出現的錯誤。最後分析四種方法的優劣,四種方法各有優缺,並無一方法於所有題目皆正確率最高。

以LoRa物聯網通訊技術及去中心化網狀網路構建緊急救難發報系統

網際網路高速發展時代,為解決身處於無蜂窩訊號涵蓋範圍下,可提供通訊服務及緊急呼叫的手持無線電及衛星服務昂貴不普及,因此本研究採用遠距離、低成本、ISM免執照頻段的LoRa物聯網無線電技術,透過其啁啾調頻技術(Chirp Spread Spectrum)、高鏈路預算等優勢,以「人人皆為基地台,亦為客戶端」理念,設計P2P去中心化網狀網路(Mesh Net work)節點傳輸協定和低廉可負擔的通訊裝置,應用於SOS緊急救難呼叫、短文通訊、定位回報等。在固有網路系統不可用時也得以獨立組網,無須高昂的修建維護成本。也可透過搜救無人機、高空氣球等,快速部署Gateway於高山極地、無訊號區、第三世界國家等情境場所,促進人類福祉達成聯合國SDGs永續理念,未來將技術結合低軌道衛星,較其他衛星技術更經濟、環保,並覆蓋全球範圍達成無死角通訊。