大規模中文自然語言處理 nlp_chinese_corpus
語料庫將會不斷擴充。。。
一期目標:10個百萬級中文語料 & 3個千萬級中文語料(2019年5月1號)
二期目標:30個百萬級中文語料 & 10個千萬級中文語料 & 1個億級中文語料(2019年12月31日)
Update: 增加高質量社區問答json版(webtext2019zh),可用於訓練超大規模NLP模型;添加520萬翻譯語料(translation2019zh)。
1.維基百科(wiki2019zh),100萬個結構良好的中文詞條
2.新聞語料(news2016zh),250萬篇新聞,含關鍵詞、描述
3.百科問答(baike2018qa),150萬個帶問題類型的問答
4.社區問答json版(webtext2019zh),410萬個高質量社區問答,適合訓練超大模型
5.翻譯語料(translation2019zh),520萬個中英文句子對
中文的信息無處不在,但如果想要獲得大量的中文語料,卻是不太容易,有時甚至非常困難。在2019年初這個時點上,
普通的從業者、研究人員或學生,並沒有一個比較好的渠道獲得極大量的中文語料。筆者想要訓練一個中文的詞向量,
在百度和github上上搜索了好久,收穫卻很少:要麼語料的量級太小,要麼數據過於成舊,或需要的處理太複雜。
不知道你是否也遇到了這樣的問題?
我們這個項目,就是為瞭解決這一問題貢獻微薄之力。
Word2vec 模型構建的實踐過程
【LLaMA-Factory】開源語言模型微調專案
LM Studio 0.3.13
Outfit Anyone – 超高品質虛擬換衫
Gemini API – 正式推出
Gemini 是由 Google 開發的最新大型語言模型,它具有 2800 億個參數,比之前的 GPT-3 模型大 10 倍。Gemini 的主要特點之一是它可以處理更複雜的任務,例如:
- 推理: Gemini 可以使用其知識庫來回答問題並做出預測。例如,它可以回答有關歷史事件、科學概念或時事的問題。它還可以根據過去的數據預測未來的趨勢。
- 創造力: Gemini 可以生成文本、圖像和音樂。它可以寫詩、故事和劇本。它還可以創建逼真的圖像和音樂。
- 翻譯: Gemini 可以將文本從一種語言翻譯成另一種語言。它可以翻譯多種語言,包括英語、中文、法語、德語和西班牙語。
- 摘要: Gemini 可以將長篇文章或視頻總結成更短、更易於理解的格式。它可以幫助人們快速了解複雜的信息。
Gemini 與其他 GPT 模型的不同之處在於:
- 規模: Gemini 是目前最大的 GPT 模型,它具有 2800 億個參數,比之前的 GPT-3 模型大 10 倍。這使它能夠處理更複雜的任務。
- 多模態: Gemini 可以處理多種模態的數據,包括文本、圖像、音頻和視頻。這使它能夠生成更豐富、更逼真的內容。
- 因果推理: Gemini 可以進行因果推理,這意味著它可以理解事件之間的因果關係。這使它能夠做出更準確的預測和決策。
Gemini 是一個非常強大的語言模型,它具有廣泛的應用前景。它可以被用於改進搜索引擎、機器翻譯、內容生成和決策支持等領域。
(more…)AudioBox –
Apple 開放 MLX 機器學習 API
Awni Hannun 宣怖 Apple 正式開放 ML Framework 並於 GitHub 設立模型庫及應用介面範例。各種使用MLX 框架的獨立範例。
MNIST範例是學習如何使用 MLX 的良好起點。
一些更有用的例子包括:
- Transformer 語言模型訓練。
- 使用LLaMA或Mistral產生大規模文字。
- 使用Mixtral 8x7B 的專家混合 (MoE) 語言模型
- 使用LoRA進行參數高效率微調。
- 使用穩定擴散產生影像。
- 使用OpenAI 的 Whisper進行語音辨識。
- 使用BERT進行雙向語言理解
- 使用GCN對圖結構資料進行半監督學習。
Genmo 創意研究實驗室
Genmo 致力於建立跨模式創作和分享生成藝術的工具。 我們正在推動生成模型能力的前沿。 如今的免費平台只需單擊即可社交創作無限量的影片。 Genmo 目前處於測試階段,將來會添加更多內容。
免費版可生成最長 6 秒 2304 x 1280 的高清影片。

亦可控制鏡頭的運鏡方式

除此,Genmo 亦提供生成圖片,文字對話等。
