Deep Learning 101, Taiwan’s pioneering and highest deep learning meetup, launched on 2016/11/11 @ 83F, Taipei 101
AI是一條孤獨且充滿惶恐及未知的旅程,花俏絢麗的收費課程或活動絕非通往成功的捷徑。
衷心感謝當時來自不同單位的AI同好參與者實名分享的寶貴經驗;如欲移除資訊還請告知。
由 TonTon Huang Ph.D. 發起,特別感謝時任職公司台灣雪豹科技無償贊助場地及茶水點心。
這裡匯集了我們歷年的 Meetup 紀錄,還有 AI 演算法與開源資源匯整中心。
🎯企業AI的競爭點,不是做出多少 Agent,而是在可量化的風險、權限、成本與稽核下可靠地執行。🎯
🎯AI Governance (AI 治理) 不能只是一份 SOP 的 PDF;它應該是一組可以執行的 Technical Controls。🎯
「Deep Learning 101」所有內容均屬個人與社群研究心得分享,不代表任何現職或前任雇主之官方立場背書。
衷心感謝當時來自不同單位的AI同好參與者實名分享的寶貴經驗;如欲移除資訊還請告知。
由 TonTon Huang Ph.D. 發起,特別感謝時任職公司台灣雪豹科技無償贊助場地及茶水點心。
這裡匯集了我們歷年的 Meetup 紀錄,還有 AI 演算法與開源資源匯整中心。
🎯企業AI的競爭點,不是做出多少 Agent,而是在可量化的風險、權限、成本與稽核下可靠地執行。🎯
🎯AI Governance (AI 治理) 不能只是一份 SOP 的 PDF;它應該是一組可以執行的 Technical Controls。🎯
「Deep Learning 101」所有內容均屬個人與社群研究心得分享,不代表任何現職或前任雇主之官方立場背書。
📅 2026-08-17 更新快訊
- DeepTutor
[2026-04]🔥 [Agent原生工作區] [終身個性化學習] [三層可審計記憶] [多引擎RAG] - DeepCode
[2026-08]🔥 [Paper2Code] [Agentic Coding] [V2中央廚房] [Text2Web/Text2Backend] - deepagents
[2026-04]🔥 [ClaudeCode開源版] [AgentHarness] [LangGraph上層封裝] [免模型綁定] - Scholar Loop
[2026-06-15]🔥 [自主科研閉環] [8專職Agent小隊] [防獎勵黑客] [單GPU預算] - autoarxiv
[2026-06]🔥 [一鍵論文復現] [autoresearch] [最小化實驗] [環境自動修復] - Qwen-Audio-Agent
[2026-07]🔥 [全雙工語音Harness] [非阻塞多任務] [ACP協議生態] [擇時結果回流] - jina-reranker-v3.5
[2026-07]🔥 [0.6B極致輕量] [3L2G混合注意力] [結構化數據理解] [長列表顯存優化] - REF+CFA
[2026-06]🔥 [CVPR 2026] [跨域異常檢測] [擴散非平穩殘差場] [無監督遷移] - VL-DINO
[2026-06-10]🔥 [開放詞表檢測] [CLIP雙線並用] [肥訓練瘦推理] [長尾類別SOTA] - RMAE-ProGRess
[2026-06-03]🔥 [CVPR 2026] [非結構化語義分割] [LCA輕量通道注意力] [越野與遙感特化] - SOPSeg
[2026-06]🔥 [CVPR 2026] [遥感小目標實例分割] [區域自適應放大RAM] [定向提示OPM] - SFS-DETR
[2026-06]🔥 [CVPR 2026] [無人機小目標檢測] [空間-頻率自適應選擇] [96 FPS即時感知] - DEUS
[2026-03]🔥 [CVPR 2026] [開放世界目標檢測] [ETF雙子空間] [能量分離EUS] - Unsloth Desktop
[2026-08-11]🔥 [全端本地AI工作站] [自愈式工具調用] [DeepResearch本地化] [零代碼訓練] - VibeVoice-ASR-BitNet
[2026-07-23]🔥 [CPU極速即時轉寫] [BitNet三值量化] [1.58GB極致壓縮] [跑贏Whisper.cpp] - NVIDIA NeMo Switchyard
[2026-03]🔥 [LLM智慧路由層] [Rust高效代理] [多協議翻譯] [成本驟降74%] - Stream3D
[2026-05]🔥 [流式3D重建與生成] [自適應證據記憶] [免訓練機制] [CVPR 2026] - Polaris
[2026-06]🔥 [全流水線AI科研] [Voyage可恢復架構] [Human-Gated] [ResearchWiki] - Uber ADR
[2026-08]🔥 [企業級Agent安全] [雙層在線檢測] [ADR-Bench] [憑證外洩攔截] - Luna-TTS
[2026-08]🔥 [擴散語言模型] [全並行TTS] [首包延遲41.6ms] [Seed-TTS-Eval四冠王] - DeepSeek Harness
[2026-08-13]🔥 [Agent作業系統] [一切皆插件] [Cordis內核] [受控執行流水線] - Vigil
[2026-03-23]🔥 [開源AI SOC] [13專職Agent小隊] [MCP標準生態] [100%本地資料駐留] - Ultra-Fusion
[2026-06-19]🔥 [多傳感器SLAM大一統] [因子級可靠性調度FRS] [在線時空自校準OSC] - LiteRT-LM
[2026-04]🔥 [Google端側編排層] [跨平台LLM Runtime] [MTP解碼加速] [WebGPU/NPU支援] - DAMO-YOLO
[2025-06]🔥 [工業落地SOTA] [TinyNAS搜尋] [Efficient RepGFPN] [AlignedOTA標籤分配] - SenseNova-Vision
[2026-07]🔥 [視覺任務大一統] [統一多模態生成UMM] [免專屬預測頭] [7B-MoT] - O2MAG
[2026-03]🔥 [CVPR 2026] [免訓練缺陷擴樣] [三路注意力嫁接TriAG] [異常引導優化AGO] - Resource2Skill
[2026-06]🔥 [Skill工廠] [多模態經驗蒸餾] [分層Skill-Wiki] [微軟開源] - AirLLM
[2023]🔥 [分層推理Layer-wise] [4GB顯存跑70B] [零精度損失] [mmap按需載入]
📅 2026-08-14 更新快訊
- 深度解析 Google DeepMind 發表於《Nature》的 Agentic Profiles 論文。本文從自主性(A)、效能(E)、目標複雜度(GC)與泛化能力(G)四大維度,拆解 AI Agent 的風險矩陣、相變效應與企業零信任治理對策。
📅 2026-07-25 更新快訊
- CADDesigner
[2026]🔥 [CAD建模] [AI智慧體] [ECIP範式] [計算機輔助設計] - text-to-cad
[2026-07-22]🔥 [CAD建模] [Agent技能] [build123d] [硬體設計] - MV3DT
[2026-07]🔥 [多視角3D追蹤] [去中心化架構] [自動標定] [DeepStream] - VisualAD
[2026-03-09]🔥 [零樣本異常檢測] [CVPR 2026] [視覺純化] [多領域 SOTA] - Arbor
[2026-06-11]🔥 [自主科研] [Agent框架] [Hypothesis-Tree] [Autonomous Optimization] - HyGRAG
[2026-06-18]🔥 [GraphRAG] [多跳推理] [知識融合] [動態更新] - Nemotron-Labs-Audex (Audex-30B-A3B / Audex-2B)
[2026-06-08]🔥[統一音訊文本模型][單一解碼器][文字稅零退步][開源通用音效生成] - Heretic
[2025-01-01]🔥[安全去對齊][機械可解釋性][自動參數優化][開源平替] - EReCu
[2026-03-12]🔥 [無監督偽裝目標檢測] - OpenWorker
[2026-07-23]🔥[開源智能體桌面應用][本地優先][模型隨你挑][無人值守] - MAGIC
[2026-03]🔥 核心優勢:**少樣本缺陷生成全新 SOTA,打通「學術優雅」與「產線現實」的擴散模型神作! - MoECLIP
[2026-03-29]🔥 核心優勢:裝上一群分工明確的專家,解鎖零樣本異常檢測(ZSAD)全新工業級霸主! - Huobao Drama
[2026-05]🔥 核心優勢:打破傳統影視製作高牆,首款將「創意劇本➔分鏡➔音效➔成片」全流程打通的開源自動化短劇生產線! - Remotion Skills
[持續更新]🔥 核心優勢:顛覆「黑盒文生影片」,用 AI 寫 React 程式碼來「精確渲染」影片的工程化革命! - Vidu S1
[2026-07-03]🔥 核心優勢:國內首款消費級顯卡可流暢運行的無限實時交互視頻大模型! - Wan-Streamer
[2026-05]🔥 核心優勢:全球首款打破模塊拼接延遲、實現「看聽說做表情」五條件全滿的端到端全雙工音視訊交互大模型!
📅 2026-07-15 更新快訊
- MinerU-Popo (Universal Post-Processing Model for Structured Document Parsing)
[2026-05-24]🔥[RAG前處理][文件級OCR後處理][跨頁結構重建][動態分塊同步] - ViT³ (ViT with Test-Time Training)
[2025-12-16]🔥[視覺長序列建模][線性複雜度][極限省顯存][CVPR 2026 Best Paper Finalist] - ADSeeker (Knowledge-Grounded Reasoning Framework)
[2026-07-11]🔥[多模態異常推理][多模態 RAG][零樣本 SOTA][稀疏特徵定位] - UniSpector (Spectral-Contrastive Visual Prompting)
[2026-04-23]🔥[開集缺陷識別][視覺提示大模型][免重訓冷啟動][SOTA 霸主] - Omni-AD: A Large-scale and Versatile Benchmark for Industrial Anomaly Detection
[2026-06-25]🔥[工業異常通用基準][真實產線數據][雙協議評測][大模型質檢噩夢] - CCL (Contextual Consistency Learning)
[2026-03-29]🔥[開放詞彙檢測][訓練側增強][零推理延遲][跨場景泛化] - FastRef (Fast Prototype Refinement for Few-shot Industrial Anomaly Detection)
[2026-03-29]🔥 - AG-VAS (Anchor-Guided Zero-Shot Visual Anomaly Segmentation)
[2026-03-05]🔥[零樣本二值分割][語義錨點黑科技][開箱即用][強泛化] - [CVPR 2026] LAVIDA (No Need For Real Anomaly: MLLM Empowered Zero-Shot Video Anomaly Detection Framework)
[2026-07-11]🔥 - GS-CLIP (Geometry-Aware Prompt and Synergistic View Representation Learning)
[2026-03-29]🔥 - Rethinking Transfer Learning for Industrial Inspection: DINOv3 vs. ImageNet Pretraining Across RGB and X-ray Tasks
[2026-05]🔥[工業選型指南][遷移學習重新審視][反直覺硬核實測] - CoPS (Conditional Prompt Synthesis for Zero-Shot Anomaly Detection)
[2026-07]🔥[零樣本跨域][條件化動態提示][工業醫學雙全能][SAGA空間感知] - [ICCV 2025] TF-IDG (Training-Free Industrial Defect Generation with Diffusion Models)
[2025-10]🔥[免訓練黑科技][One-Shot資料增廣][產線冷啟動][台灣原生強權] - DiCLIP (Diffusion Enhanced CLIP for Weakly Supervised Segmentation)
[2026-06]🔥[弱監督分割 WSSS][知識遷移][訓練降本 90%][生成式賦能] - HR-SemNet (High-Resolution Network for Small Object Detection)
[2026-03]🔥[小目標神作][無人機巡檢][計算量腰斬][極致輕量] - VGGT-S (VGGT-Segmentor)
[2026-04]🔥[跨視角分割][幾何增強][Ego-Exo對齊][免配對預訓練] - Unlimited-OCR (無限 OCR)
[2026-06]🔥[長文件解析][R-SWA注意力][恆定顯存][端到端SOTA] - AnomalyVFM (Transforming Vision Foundation Models into Zero-Shot Anomaly Detectors)
[2026-01]🔥[零樣本冷啟動][純視覺VFM][虛擬產線數據][極速推論] - WinCLIP (Zero-/Few-Shot Anomaly Classification and Segmentation)
[2023-06]🔥[零樣本AOI][CLIP特徵升維][狀態提示詞][冷啟動救星] - Supertonic v3
[2026-09]🔥[99M極致輕量][純CPU推論][本地隱私][ONNX/WebGPU] - InvAD (Inversion-based Reconstruction-Free Anomaly Detection)
[2026-04]🔥[擴散模型][免重建][極速推論][工業AOI] - SEATrack (Simple, Efficient, and Adaptive Multimodal Tracker)
[2026-06]🔥[多模態追蹤][PEFT極致輕量][極端場景特化][邊緣算力首選] - Voicebox
[2026-05]🔥[ElevenLabs平替][全端語音工作站][零樣本克隆][MCP協議][本地部署] - parakeet.cpp (NVIDIA Parakeet C++ 實作)
[2026-06]🔥[C++17重寫][極速ASR][邊緣運算][流式識別][ggml架構] - PixelRAG
[2026]🔥[視覺RAG][多模態檢索][幻覺剋星][Qwen3-VL底座] - Fine-VAD (Fine-Grained Video Anomaly Detection)
[2026-06]🔥[細粒度異常檢測][影片安防][CLIP多級對齊][漸進式學習] - MonoSAOD (Monocular 3D Object Detection)
[2026-04]🔥[單目3D偵測][稀疏標註][偽標籤治理][工業級過濾]
📅 2026-06-20 更新快訊
- LLM-Offense:
- 新增 SecSkills 自動化滲透測試技能包,提升資安測試效率。
- LLM-Guard:
- Nemotron 3.5 Content Safety (多模態安全護欄)
- Computer-Vision:
- 新增 Uni-RCM 跨模態多類別統一異常檢測框架與 CaptionFormer 統一架構,強調其核心優勢與解決痛點,並更新 PP-OCRv6 及 PaddleOCR-VL-1.6 的詳細介紹,提升使用者體驗。
- Speech-Processing:
- 新增 Nemotron 3.5 ASR 模型資訊,強調其低延遲與多語種支援,並更新 Voxtral Realtime 模型的核心優勢與推薦場景。
- Large-Language-Model:
- 新增多模態安全護欄與自動化滲透測試技能包,強化 AI 安全防護與紅隊演練能力。
- 新增 Remotion Skills 代碼驅動影片框架,強化影片生成與自動化剪輯功能。
- 新增 Google Colab CLI 和 OpenMontage 於 LLM 資源中,強化雲端計算與影片製作自動化功能
📅 2026-06-03 更新快訊
- Computer-Vision:
- MeDS
- DINO-CLIP-SAM、Anti-Forgetting Sampling Strategy、CAFe-DINO、ConceptSeg-R1、ViCrop-Det、OneNIP、JUDO
- PaddleOCR-VL-1.6、Boxes2Pixels、SceneScribe-1M、FT-FSOD、Duix Avatar、FrequencyCM × C3k2、BCSI、AVA-DINO
- DetAny4D、FoundAD、LocateAnything-3B及SANA
- Speech-Processing:
- Mega-ASR、OmniVoice Studio
- Large-Language-Model:
- Infinity-Doc2-5M
📅 2026-05-18 更新快訊
- Speech-Processing:
- Speaker-Reasoner:(ASLP-lab) 打破多說話人重疊語音與身份漂移的魔咒,首創「智慧體多輪時序推理」的端到端語音大模型神作!
- OpenAI Realtime API 低延遲語音架構解析:揭開 ChatGPT Voice 不到 0.3 秒極速對話的底層秘密!
- WhisperPipe:打破 Whisper 串流「越跑越卡、記憶體爆炸」的魔咒,首創資源恆定的極低延遲(89ms)即時語音轉寫管線!
- OmniVoice Studio:打爆 ElevenLabs 的全能型本地語音工作室,3秒極速克隆 646 種語言!
- Moonshine Voice:樹莓派也能流暢運行的即時 ASR 神作,實時處理速度輾壓 Whisper 100 倍!
- Supertonic 3:終結雲端 API 依賴的邊緣運算霸主,僅約 99M 參數在純 CPU 上最高實現 0.006× 實時因子的極速 TTS!
- LLM-Offense:
- DeepAudit (自動化深度程式碼安全稽核大腦):首創「大膽假設,沙箱求證」的 Multi-Agent 自動化漏洞挖掘與 PoC 驗證平台
- Large-Language-Model:
- Vercel Agent Browser (AI 原生瀏覽器自動化引擎):專為 AI Agent 量身打造的革命性瀏覽器自動化工具,上下文 Token 消耗暴力銳減 93%!
- CLI-Anything (Agent 專屬軟體 CLI 生成器)
- Skyvern (視覺化網頁自動化 Agent)、DeepXiv (科研 Agent 的文獻基建)
- Academic-Search (科研智能體專屬文獻檢索技能)
- ai-website-cloner-template (AI 網頁逆向與生成神器)
- Gemma-4-31B-CRACK (資安紅隊越獄專武)
- Anthropic-Cybersecurity-Skills (資安 Agent 終極技能庫)
- Awesome-Design-MD (AI 視覺設計說明書)
- HyperFrames (HeyGen 代碼驅動影片渲染框架)
- Hyper-Extract:首創「八大強類型結構」與「知識增量演進」的 Graph-RAG 前處理終極神作。
- OpenCLI (網頁與私域數據 CLI 化神器):終結 Agent 視覺解析的高昂成本,將全網與本地應用直接化為 AI 專屬的「命令行 API」神作!
- DCI-Agent-Lite (Direct Corpus Interaction):拋棄 Embedding 與向量庫,讓 Agent 直接用 Bash 指令「裸搜」語料的 RAG 顛覆神作!
- Universal Data Tool:打破商業標註平台高昂成本,一站式搞定圖、文、音、影全模態標註的開源協作神作!
- Phi-Ground-Any-4B (微軟):專為 AI Agent 打造的「精準點擊」視覺定位神作,徹底打通電腦控制的最後一哩路!
- Hugging Face ml-intern:重新定義「AI 幫我做研究」!能自主讀論文、找資料、寫腳本並提交 GPU 訓練的開源 ML 實習生。
- EssenceBench:終結海量題海戰術的評測革命,用 1/200 的題量精準還原 95% 的大模型榜單排名!
- LLM Wiki:將 Andrej Karpathy 的 AI 知識庫理念完美落地的神作!從被動 RAG 檢索進化為具備「深度研究 (Deep Research)」與「視覺化知識圖譜」的自主學習大腦。
- Jina Embeddings V5 Omni:打破模態孤島的全模態向量化霸主,真正實現圖、文、音、影「大一統」且完全相容舊有文字索引!
- Claude for Legal (Anthropic):Anthropic 官方開源的法律業專屬 Agent 智慧體全家桶,無縫接入 20+ 專業系統的自動化法務大腦!
- Computer-Vision:
- Stirling-PDF (全能隱私安全 PDF 處理基礎設施)
- PDFMathTranslate
- Remotion Skills (AI 代碼驅動影片框架)
- Infinity-Parser2:打破大廠閉源壟斷的文檔解析天花板,單一模型通吃六大任務的開源霸主!
- SAM3-LoRA:打破通用大模型在專業領域「水土不服」的魔咒,6GB 顯存即可實現 SAM3 的極速領域特化!
- EUPE: DINOv3 + SAM + CLIP 三模合一輕量檢測框架:打破大模型落地門檻的開箱即用神器,將 DINOv3、SAM 與 CLIP 的跨域超能力濃縮進極致輕量的檢測管線!
- LuoHuaLabel (基於 SAM 3 的智慧標註神器):徹底解放雙手的資料標註黑科技,以 SAM 3 驅動的次世代視覺標註系統!
- DINO-AD:打破模型微調成本高牆的免訓練 (Training-Free) 異常檢測黑科技!
📅 2026-05-13 更新快訊
- Large-Language-Model:何愷明團隊重磅推出 ELF (Embedded Language Flows)。
- Speech-Processing:ControlAudio、SpeakerRPL V2、Voxtral-Mini-4B-Realtime。
- Computer-Vision:SVOR (Stable Video Object Removal、SubspaceAD、SAM3-I、X2SAM、RNS (Retrieve and Segment)、RefineAnything、CyberVerse、InfiniteTalk

