全國中小學科展

電腦科學與資訊工程

基於LLM的互動式口述影像系統

本研究旨在透過LLM 將影片內容轉為口述影像,探討及比較不同影片處理方式、LLM 對於圖片及影片的敘述,串接成一套自動化的口述影像系統。口述影像原本是為視障者製作的,現在本研究調整系統,讓有需求的一般大眾也能有效、容易及快速的了解影片內容。 本研究中的口述影像系統具有以下特點: (一)利用LLM 擅於處理視覺訊息及自然語言的優勢,將影片分為多張圖片,由LLM分別生成敘述後再整合為影片的整體敘述。 (二)運用LLM 會留存對話紀錄的特性,使用者可在系統中針對疑問與LLM進行問答。 (三)串接不同的 LLM,尋找製作口述影像的最佳組合。 藉由LLM 將影片轉換為口述影像,實現互動式的口述影像服務。除了可以滿足視障者的觀影需求,更重要的是當一般民眾沒有時間觀看影片時,也能透過口述影像系統了解影片內容。

Enhanced Hybrid Ensemble Model for 10-Year CO2 Emissions Forecasting in Taiwan: A Comparative Study of Univariate and Multivariate Models

隨著氣候變遷對人類生活帶來越來越大的的影響,CO2 為氣候變遷的主要驅動因素之一,準確預測二氧化碳(CO2)排放量變得至關重要。 本研究深入探討了各種先進的單變量和多變量時間序列模型,並提出一種新穎的混合集成模型,旨在提升台灣CO2 排放的預測準確性。 我們採用了自1965 年至2022 年的年均數據集,涵蓋CO2 排放量以及天然氣、煤炭和石油的消耗數據,利用標準評估指標來評估模型表現。在多次實驗中,我們選定了三個表現最佳的模型,並通過疊加泛化技術將其預測結果整合至一個元模型。所提出的混合集成模型達到了1.398% 的MAPE 分數,顯示出相較於傳統模型更優越且穩定的性能。 經過全面優化後,本模型可為政策制定者和產業領袖在制定減少CO2排放的決策時提供了可靠的依據。

沙盒類遊戲式學習平台系統伺服器架設節能效率研究:以Minecraft為例

本研究以 Minecraft 為例,探討沙盒類遊戲式學習平台系統伺服器架設的節能效率,旨在透過動態調整伺服器數量降低總CPU使用率,提升伺服器的管理效能和能源使用效率。隨著線上遊戲的普及,伺服器的營運管理變得越來越複雜,如何在滿足玩家需求並同時降低能源消耗成為一個重要議題。本研究將分析伺服器資源使用狀況,特別是在玩家活動量高低波動的情境下,透過管理策略的調整,探討其對節能效率的影響。 研究透過實證數據的收集與回歸分析,建立一套可應用於 Minecraft 伺服器的節能動態調整系統,並探討動態調整的具體效率。研究結果發現隨著玩家人數增加,越接近系統負載上限,節能效果會越來越不明顯,以本次研究的伺服器來講玩家人數到達35人以後就無法再減少伺服器數量。

沙盒類遊戲式學習平台系統伺服器架設節能效率研究:以Minecraft為例

本研究以 Minecraft 為例,探討沙盒類遊戲式學習平台系統伺服器架設的節能效率,旨在透過動態調整伺服器數量降低總CPU使用率,提升伺服器的管理效能和能源使用效率。隨著線上遊戲的普及,伺服器的營運管理變得越來越複雜,如何在滿足玩家需求並同時降低能源消耗成為一個重要議題。本研究將分析伺服器資源使用狀況,特別是在玩家活動量高低波動的情境下,透過管理策略的調整,探討其對節能效率的影響。 研究透過實證數據的收集與回歸分析,建立一套可應用於 Minecraft 伺服器的節能動態調整系統,並探討動態調整的具體效率。研究結果發現隨著玩家人數增加,越接近系統負載上限,節能效果會越來越不明顯,以本次研究的伺服器來講玩家人數到達35人以後就無法再減少伺服器數量。

噪音之眼:結合聲源定位與影像辨識的聲音照相系統

汽、機車呼嘯而過的排氣噪音經常造成周遭民眾的困擾,為杜絕這種狀況,環保署於2021 年開始推動「聲音照相科技執法」,透過包含魚眼攝影機、車牌辨識攝影機等設備的整合,來紀錄行經車輛產生的噪音是否超過管制標準,不過此系統目前仍存在一些限制,如:當多台車輛同時經過時無法辨別確切的噪音來源,而需要人工判定。本研究旨在利用聲源定位原理結合影像辨識技術,實作出一套能夠追蹤聲源(噪音)並辨識聲音來源(車輛)的聲音照相系統,期日後能實際應用並解決道路上多車輛時無法辨識噪音來源的困擾。研究中提出一套能透過遠端控制程式,將收音裝置、攝影設備和資料分析軟體等各項軟硬體設備,串聯成自動化追蹤聲源的系統設計方案。

以深度學習進行籃球慣用動作分析

本研究聚焦於籃球員的慣用動作分析,透過深度學習技術開發了一套籃球動作分析系統,旨在準確分析籃球員在籃球運動中的個人動作特徵來進行動作辨識。我們透過自行蒐集籃球動作的影片,並使用MMAction2這個資源庫來進行動作辨識模型的訓練,將訓練好的動作辨識模型用開發慣用動作分析系統。系統流程首先使用滑動視窗(Sliding Window)的機制將即時拍攝的影像變成有序列的連續影像片段,再即時傳送至進攻動作辨識的深度學習模型中,來辨識出連續影像片段中的動作序列屬於何種特定動作,藉此將多個連續影像片段中的動作序列各自轉換為單一動作單元並依次輸出。最終,系統基於前述單一動作資料進行綜合分析,以統計使用者的籃球慣用動作。此分析系統能為籃球愛好者提供清晰的動作偏好資料,具有提升訓練成效的潛力,同時為籃球技術分析與訓練提供了一個精確的數據分析工具。

建構標準舞蹈姿勢評分系統

在現今社會,個人越來越依賴自主學習以提升技能和知識,而舞蹈學習尤其受到關注。然而,在沒有專業指導的情況下,學員往往難以掌握舞蹈動作的細節,也難以清楚地評估自己的表現與標準示範之間的差距。 為了應對這一挑戰,本研究利用人體姿態識別演算法OpenPose,捕捉舞蹈者的關節點。通過這項技術,針對舞蹈的標準動作、力度、流暢度等方面,成功地開發出一款自動評分系統。 通過人體姿態識別技術,我們能夠深入分析舞蹈動作的細節,讓學員與標準舞蹈動作進行比較,以確認學習上的差異。我們希望通過這項研究,學員能在沒有專業指導的情況下,利用網路平台創建更有效且有趣的自主學習環境。

幾何圖形的創意設計與應用

對稱與密鋪圖形是數學美學的表現,廣泛應用於藝術與工程設計中,本研究利用 Python 語言及其套件,依據平面設計的法則,撰寫十七種平面對稱圖形的程式碼,程式碼可透過Replit 平台的雲端共享功能促進跨領域專業人士之間的合作與改良。此外,針對一般群眾本研究透過定義函數和變數開發出「幾何設計」專案讓使用者能夠透過座標設計,輕鬆原創出具有對稱性和密鋪性的幾何圖案。本研究在幾何教學、平面設計和 3D 建模等方面都展現了其應用和優勢。我們也收集了使用者測試的反饋和數據,並提供了將平面圖形轉換成 3D 模型的過程和示例。

Instruction-Tuning 在法律對話模型上的影響之探討

本研究探討 Instruction-Tuning 對法律領域語言模型的影響,我們使用 ChatGLM-2 6B 作為基礎模型,先以台灣法律文本進行 Continual Pre-training,再以和律師的 Q&A 數據集,分別採用 Supervised Fine-Tuning(SFT)、Reward Model 及 Proximal Policy Optimization(PPO)等 Instruction-Tuning 方法進行微調。結果顯示,僅經過 Pre-training 及 SFT 的模型,其產生的回覆較符合法律專業風格;但考量模型對法律知識的掌握,則以 Pre-training、SFT 及 PPO 整套 Instruction-Tuning 的結合效果最佳。本研究證明, 針對單一領域的語言模型, 不同的 Instruction-Tuning 方式會對其回覆風格及知識掌握造成不同影響。我們的研究為未來單一領域語言模型訓練提供了參考。

利用FBP (Filtered Back Projection)進行三維錫球重建並分析探討不同濾波器造成的影響

在今日,電路板被廣泛運用各大領域,而電路板上錫球在焊接的過程中有可能會產生瑕疵,因此我們需要找到一個方式來檢驗電路板上錫球是否有瑕疵。有很多方式可以進行,例如: ART (Algebraic Reconstruction Technique)、SART (Simultaneous Algebraic Reconstruction Technique)和 FBP(Filtered Back Projection),ART、SART 為疊代型的方法,疊代型比較準確但花費較多時間,與之相比,FBP 利用反投影法,能節省許多時間。本實驗嘗試利用 FBP 得到電路板上錫球的269張切片圖,利用 ImageJ 將所有圖片疊起來以得到3D 圖並探討錫球是否有缺陷,之後採用不同的種類濾波(filter)進行測試並利用 ImageJ 分析比較各 filter 的特色,高通濾波器如 Ramp filter 主要強化圖像邊緣,低通濾波器如 Hann filter 主要強化圖像中低頻的部分,使影像對比度變高,分析比較後嘗試自己建立 filter,此 filter 結合了 high pass filter 與low pass filter 的優點,影像的對比度變高的同時,錫球的輪廓也更明顯。