Deep Learning 101, Taiwan’s pioneering and highest deep learning meetup, launched on 2016/11/11 @ 83F, Taipei 101
💼 從頂層 AI 戰略到地端 GPU 部署企業方案: 卡在開源模型效能低落?不知道如何為企業私有雲架設高併發的推論伺服器?提供 FDE (Forward Deployed Engineering) 級別的 AI 落地顧問與架構建置以及企業級的 LLM 架構健檢與地端部署服務。
AI是一條孤獨且充滿惶恐及未知的旅程,花俏絢麗的收費課程或活動絕非通往成功的捷徑。
衷心感謝當時來自不同單位的AI同好參與者實名分享的寶貴經驗;如欲移除資訊還請告知。
由 TonTon Huang Ph.D. 發起,特別感謝時任職公司台灣雪豹科技無償贊助場地及茶水點心。
這裡不僅匯集了我們歷年的 Meetup 紀錄,更是 AI 演算法與開源資源匯整中心。
衷心感謝當時來自不同單位的AI同好參與者實名分享的寶貴經驗;如欲移除資訊還請告知。
由 TonTon Huang Ph.D. 發起,特別感謝時任職公司台灣雪豹科技無償贊助場地及茶水點心。
這裡不僅匯集了我們歷年的 Meetup 紀錄,更是 AI 演算法與開源資源匯整中心。
📅 2026-07-25 更新快訊
- CADDesigner
[2026]🔥 [CAD建模] [AI智慧體] [ECIP範式] [計算機輔助設計] - text-to-cad
[2026-07-22]🔥 [CAD建模] [Agent技能] [build123d] [硬體設計] - MV3DT
[2026-07]🔥 [多視角3D追蹤] [去中心化架構] [自動標定] [DeepStream] - VisualAD
[2026-03-09]🔥 [零樣本異常檢測] [CVPR 2026] [視覺純化] [多領域 SOTA] - Arbor
[2026-06-11]🔥 [自主科研] [Agent框架] [Hypothesis-Tree] [Autonomous Optimization] - HyGRAG
[2026-06-18]🔥 [GraphRAG] [多跳推理] [知識融合] [動態更新] - Nemotron-Labs-Audex (Audex-30B-A3B / Audex-2B)
[2026-06-08]🔥[統一音訊文本模型][單一解碼器][文字稅零退步][開源通用音效生成] - Heretic
[2025-01-01]🔥[安全去對齊][機械可解釋性][自動參數優化][開源平替] - EReCu
[2026-03-12]🔥 [無監督偽裝目標檢測] - OpenWorker
[2026-07-23]🔥[開源智能體桌面應用][本地優先][模型隨你挑][無人值守] - MAGIC
[2026-03]🔥 核心優勢:**少樣本缺陷生成全新 SOTA,打通「學術優雅」與「產線現實」的擴散模型神作! - MoECLIP
[2026-03-29]🔥 核心優勢:裝上一群分工明確的專家,解鎖零樣本異常檢測(ZSAD)全新工業級霸主! - Huobao Drama
[2026-05]🔥 核心優勢:打破傳統影視製作高牆,首款將「創意劇本➔分鏡➔音效➔成片」全流程打通的開源自動化短劇生產線! - Remotion Skills
[持續更新]🔥 核心優勢:顛覆「黑盒文生影片」,用 AI 寫 React 程式碼來「精確渲染」影片的工程化革命! - Vidu S1
[2026-07-03]🔥 核心優勢:國內首款消費級顯卡可流暢運行的無限實時交互視頻大模型! - Wan-Streamer
[2026-05]🔥 核心優勢:全球首款打破模塊拼接延遲、實現「看聽說做表情」五條件全滿的端到端全雙工音視訊交互大模型!
📅 2026-07-15 更新快訊
- MinerU-Popo (Universal Post-Processing Model for Structured Document Parsing)
[2026-05-24]🔥[RAG前處理][文件級OCR後處理][跨頁結構重建][動態分塊同步] - ViT³ (ViT with Test-Time Training)
[2025-12-16]🔥[視覺長序列建模][線性複雜度][極限省顯存][CVPR 2026 Best Paper Finalist] - ADSeeker (Knowledge-Grounded Reasoning Framework)
[2026-07-11]🔥[多模態異常推理][多模態 RAG][零樣本 SOTA][稀疏特徵定位] - UniSpector (Spectral-Contrastive Visual Prompting)
[2026-04-23]🔥[開集缺陷識別][視覺提示大模型][免重訓冷啟動][SOTA 霸主] - Omni-AD: A Large-scale and Versatile Benchmark for Industrial Anomaly Detection
[2026-06-25]🔥[工業異常通用基準][真實產線數據][雙協議評測][大模型質檢噩夢] - CCL (Contextual Consistency Learning)
[2026-03-29]🔥[開放詞彙檢測][訓練側增強][零推理延遲][跨場景泛化] - FastRef (Fast Prototype Refinement for Few-shot Industrial Anomaly Detection)
[2026-03-29]🔥 - AG-VAS (Anchor-Guided Zero-Shot Visual Anomaly Segmentation)
[2026-03-05]🔥[零樣本二值分割][語義錨點黑科技][開箱即用][強泛化] - [CVPR 2026] LAVIDA (No Need For Real Anomaly: MLLM Empowered Zero-Shot Video Anomaly Detection Framework)
[2026-07-11]🔥 - GS-CLIP (Geometry-Aware Prompt and Synergistic View Representation Learning)
[2026-03-29]🔥 - Rethinking Transfer Learning for Industrial Inspection: DINOv3 vs. ImageNet Pretraining Across RGB and X-ray Tasks
[2026-05]🔥[工業選型指南][遷移學習重新審視][反直覺硬核實測] - CoPS (Conditional Prompt Synthesis for Zero-Shot Anomaly Detection)
[2026-07]🔥[零樣本跨域][條件化動態提示][工業醫學雙全能][SAGA空間感知] - [ICCV 2025] TF-IDG (Training-Free Industrial Defect Generation with Diffusion Models)
[2025-10]🔥[免訓練黑科技][One-Shot資料增廣][產線冷啟動][台灣原生強權] - DiCLIP (Diffusion Enhanced CLIP for Weakly Supervised Segmentation)
[2026-06]🔥[弱監督分割 WSSS][知識遷移][訓練降本 90%][生成式賦能] - HR-SemNet (High-Resolution Network for Small Object Detection)
[2026-03]🔥[小目標神作][無人機巡檢][計算量腰斬][極致輕量] - VGGT-S (VGGT-Segmentor)
[2026-04]🔥[跨視角分割][幾何增強][Ego-Exo對齊][免配對預訓練] - Unlimited-OCR (無限 OCR)
[2026-06]🔥[長文件解析][R-SWA注意力][恆定顯存][端到端SOTA] - AnomalyVFM (Transforming Vision Foundation Models into Zero-Shot Anomaly Detectors)
[2026-01]🔥[零樣本冷啟動][純視覺VFM][虛擬產線數據][極速推論] - WinCLIP (Zero-/Few-Shot Anomaly Classification and Segmentation)
[2023-06]🔥[零樣本AOI][CLIP特徵升維][狀態提示詞][冷啟動救星] - Supertonic v3
[2026-09]🔥[99M極致輕量][純CPU推論][本地隱私][ONNX/WebGPU] - InvAD (Inversion-based Reconstruction-Free Anomaly Detection)
[2026-04]🔥[擴散模型][免重建][極速推論][工業AOI] - SEATrack (Simple, Efficient, and Adaptive Multimodal Tracker)
[2026-06]🔥[多模態追蹤][PEFT極致輕量][極端場景特化][邊緣算力首選] - Voicebox
[2026-05]🔥[ElevenLabs平替][全端語音工作站][零樣本克隆][MCP協議][本地部署] - parakeet.cpp (NVIDIA Parakeet C++ 實作)
[2026-06]🔥[C++17重寫][極速ASR][邊緣運算][流式識別][ggml架構] - PixelRAG
[2026]🔥[視覺RAG][多模態檢索][幻覺剋星][Qwen3-VL底座] - Fine-VAD (Fine-Grained Video Anomaly Detection)
[2026-06]🔥[細粒度異常檢測][影片安防][CLIP多級對齊][漸進式學習] - MonoSAOD (Monocular 3D Object Detection)
[2026-04]🔥[單目3D偵測][稀疏標註][偽標籤治理][工業級過濾]
📅 2026-06-20 更新快訊
- LLM-Offense:
- 新增 SecSkills 自動化滲透測試技能包,提升資安測試效率。
- LLM-Guard:
- Nemotron 3.5 Content Safety (多模態安全護欄)
- Computer-Vision:
- 新增 Uni-RCM 跨模態多類別統一異常檢測框架與 CaptionFormer 統一架構,強調其核心優勢與解決痛點,並更新 PP-OCRv6 及 PaddleOCR-VL-1.6 的詳細介紹,提升使用者體驗。
- Speech-Processing:
- 新增 Nemotron 3.5 ASR 模型資訊,強調其低延遲與多語種支援,並更新 Voxtral Realtime 模型的核心優勢與推薦場景。
- Large-Language-Model:
- 新增多模態安全護欄與自動化滲透測試技能包,強化 AI 安全防護與紅隊演練能力。
- 新增 Remotion Skills 代碼驅動影片框架,強化影片生成與自動化剪輯功能。
- 新增 Google Colab CLI 和 OpenMontage 於 LLM 資源中,強化雲端計算與影片製作自動化功能
📅 2026-06-03 更新快訊
- Computer-Vision:
- MeDS
- DINO-CLIP-SAM、Anti-Forgetting Sampling Strategy、CAFe-DINO、ConceptSeg-R1、ViCrop-Det、OneNIP、JUDO
- PaddleOCR-VL-1.6、Boxes2Pixels、SceneScribe-1M、FT-FSOD、Duix Avatar、FrequencyCM × C3k2、BCSI、AVA-DINO
- DetAny4D、FoundAD、LocateAnything-3B及SANA
- Speech-Processing:
- Mega-ASR、OmniVoice Studio
- Large-Language-Model:
- Infinity-Doc2-5M
📅 2026-05-18 更新快訊
- Speech-Processing:
- Speaker-Reasoner:(ASLP-lab) 打破多說話人重疊語音與身份漂移的魔咒,首創「智慧體多輪時序推理」的端到端語音大模型神作!
- OpenAI Realtime API 低延遲語音架構解析:揭開 ChatGPT Voice 不到 0.3 秒極速對話的底層秘密!
- WhisperPipe:打破 Whisper 串流「越跑越卡、記憶體爆炸」的魔咒,首創資源恆定的極低延遲(89ms)即時語音轉寫管線!
- OmniVoice Studio:打爆 ElevenLabs 的全能型本地語音工作室,3秒極速克隆 646 種語言!
- Moonshine Voice:樹莓派也能流暢運行的即時 ASR 神作,實時處理速度輾壓 Whisper 100 倍!
- Supertonic 3:終結雲端 API 依賴的邊緣運算霸主,僅約 99M 參數在純 CPU 上最高實現 0.006× 實時因子的極速 TTS!
- LLM-Offense:
- DeepAudit (自動化深度程式碼安全稽核大腦):首創「大膽假設,沙箱求證」的 Multi-Agent 自動化漏洞挖掘與 PoC 驗證平台
- Large-Language-Model:
- Vercel Agent Browser (AI 原生瀏覽器自動化引擎):專為 AI Agent 量身打造的革命性瀏覽器自動化工具,上下文 Token 消耗暴力銳減 93%!
- CLI-Anything (Agent 專屬軟體 CLI 生成器)
- Skyvern (視覺化網頁自動化 Agent)、DeepXiv (科研 Agent 的文獻基建)
- Academic-Search (科研智能體專屬文獻檢索技能)
- ai-website-cloner-template (AI 網頁逆向與生成神器)
- Gemma-4-31B-CRACK (資安紅隊越獄專武)
- Anthropic-Cybersecurity-Skills (資安 Agent 終極技能庫)
- Awesome-Design-MD (AI 視覺設計說明書)
- HyperFrames (HeyGen 代碼驅動影片渲染框架)
- Hyper-Extract:首創「八大強類型結構」與「知識增量演進」的 Graph-RAG 前處理終極神作。
- OpenCLI (網頁與私域數據 CLI 化神器):終結 Agent 視覺解析的高昂成本,將全網與本地應用直接化為 AI 專屬的「命令行 API」神作!
- DCI-Agent-Lite (Direct Corpus Interaction):拋棄 Embedding 與向量庫,讓 Agent 直接用 Bash 指令「裸搜」語料的 RAG 顛覆神作!
- Universal Data Tool:打破商業標註平台高昂成本,一站式搞定圖、文、音、影全模態標註的開源協作神作!
- Phi-Ground-Any-4B (微軟):專為 AI Agent 打造的「精準點擊」視覺定位神作,徹底打通電腦控制的最後一哩路!
- Hugging Face ml-intern:重新定義「AI 幫我做研究」!能自主讀論文、找資料、寫腳本並提交 GPU 訓練的開源 ML 實習生。
- EssenceBench:終結海量題海戰術的評測革命,用 1/200 的題量精準還原 95% 的大模型榜單排名!
- LLM Wiki:將 Andrej Karpathy 的 AI 知識庫理念完美落地的神作!從被動 RAG 檢索進化為具備「深度研究 (Deep Research)」與「視覺化知識圖譜」的自主學習大腦。
- Jina Embeddings V5 Omni:打破模態孤島的全模態向量化霸主,真正實現圖、文、音、影「大一統」且完全相容舊有文字索引!
- Claude for Legal (Anthropic):Anthropic 官方開源的法律業專屬 Agent 智慧體全家桶,無縫接入 20+ 專業系統的自動化法務大腦!
- Computer-Vision:
- Stirling-PDF (全能隱私安全 PDF 處理基礎設施)
- PDFMathTranslate
- Remotion Skills (AI 代碼驅動影片框架)
- Infinity-Parser2:打破大廠閉源壟斷的文檔解析天花板,單一模型通吃六大任務的開源霸主!
- SAM3-LoRA:打破通用大模型在專業領域「水土不服」的魔咒,6GB 顯存即可實現 SAM3 的極速領域特化!
- EUPE: DINOv3 + SAM + CLIP 三模合一輕量檢測框架:打破大模型落地門檻的開箱即用神器,將 DINOv3、SAM 與 CLIP 的跨域超能力濃縮進極致輕量的檢測管線!
- LuoHuaLabel (基於 SAM 3 的智慧標註神器):徹底解放雙手的資料標註黑科技,以 SAM 3 驅動的次世代視覺標註系統!
- DINO-AD:打破模型微調成本高牆的免訓練 (Training-Free) 異常檢測黑科技!
📅 2026-05-13 更新快訊
- Large-Language-Model:何愷明團隊重磅推出 ELF (Embedded Language Flows)。
- Speech-Processing:ControlAudio、SpeakerRPL V2、Voxtral-Mini-4B-Realtime。
- Computer-Vision:SVOR (Stable Video Object Removal、SubspaceAD、SAM3-I、X2SAM、RNS (Retrieve and Segment)、RefineAnything、CyberVerse、InfiniteTalk

