六月天色婷婷_免费一级suv好看的国产网站_国产你懂的在线观看_国产一区二区三区视频播放_国产欧美一区二区在线观看_天天干夜夜嗨

首頁 > 以車會友 > 以車會友 > 復雜推理大模型OpenAI o1亮相,數學與代碼能力飛躍

復雜推理大模型OpenAI o1亮相,數學與代碼能力飛躍

發布時間:2024-09-16 16:25:38

平安證券近日發布AI動態跟蹤系列(三):復雜推理大模型OpenAI o1亮相,數學與代碼能力飛躍。

以下為研究報告摘要:

9月13日,OpenAI正式發布并上線o1系列模型o1-preview和o1-mini。

平安觀點:

OpenAI計數器重置回1,o1系列開啟復雜推理序幕。本次OpenAI發布的是o1-preview(預覽版)和o1-mini(擅長STEM、更快、更便宜)兩個版本,ChatGPT付費用戶和API用戶可以使用。根據OpenAI官網介紹,o1系列被定位為用于解決難題的推理模型。對于復雜的推理任務來說,OpenAI認為o1是一個重大進步,代表了AI能力的新水平,鑒于此,OpenAI將計數器重置回1并將此系列模型命名為OpenAI o1。OpenAI研究發現,隨著強化學習(訓練時計算)和思考時間(測試時計算)的增加,o1的性能會不斷提高。因此在體驗上,與此前模型不同點在于,OpenAIo1在作出反應之前,需要像人類一樣,花更多時間思考問題。

o1基準表現明顯優于GPT-4o,數學與編碼能力實現飛躍。OpenAI實驗結果表明,在絕大多數推理任務中,o1的表現明顯優于GPT-4o。尤其是在具有挑戰性的推理基準上,o1實現了能力飛躍,1)數學能力:在美國數學奧林匹克(AIME2024)預選賽題目中,GPT-4o平均只能解決12%的問題,o1正式版達到平均74%的準確率,在使用學習評分函數重新排名1000個樣本后準確率達到93%,相當于美國排名前500的學生水平。2)編碼能力:在競爭性編程問題(Codeforces)比賽中,o1-preview、o1分別超越了62%、89%的人類競爭者,而對比GPT-4o僅超過11%。3)特定專業領域能力:GPQA diamond測試(專門用于評估模型在化學、物理和生物學等領域的專業知識水平)中,o1不僅成功完成了測試,更是超越了人類專家的表現,成為首個在GPQA diamond基準上擊敗人類專家的AI模型。

o1引入思維鏈優化邏輯推理,助力模型性能與安全提升。o1優越能力的背后,核心突破在于運用思維鏈(chain of thought)方法來處理復雜任務,OpenAI介紹到,類似于人類在回答困難問題之前可能會思考很長時間,o1在嘗試解決問題時會使用思維鏈。通過強化學習,o1學會打磨其思維鏈并改進它所使用的策略。o1學會了識別和糾正錯誤,學會了將棘手的步驟分解為更簡單的步驟,學會了在當前方法不起作用時嘗試不同的方法,此過程顯著提高了模型的推理能力。在OpenAI的一個官方演示中展示了o1-preview解答復雜問題的邏輯推理過程,o1-preview在過程中逐步顯示思考、翻譯問題、定義變量、理解問題、構建方程、解方程等與人類推理相似的步驟,最終輸出結論。同時,OpenAI認為思維鏈推理也為大模型安全性的提升提供了新思路,o1-preview在關鍵越獄評估和用于評估模型安全拒絕邊界的最嚴格內部基準上取得了顯著的改進。

投資建議:OpenAI推出專攻難題的o1系列大模型,應對復雜推理任務,o1引入思維鏈(Chain of Thought)提升邏輯推理能力,絕大多數基準表現不僅明顯超越GPT-4o,而且在數學與編碼能力上實現了重要飛躍,在理化生等專業領域的知識水平也達到新高度。OpenAI的動向始終引領全球大模型的發展,我們認為o1的正式亮相有望開啟復雜推理大模型的序幕,一方面對算力提出了更大需求,同時也將賦能下游AI應用(如編程、教育)的快速迭代。我們堅定看好AI主題的投資機會:1)算力方面,推薦工業富聯、浪潮信息、中科曙光、紫光股份、神州數碼、海光信息、龍芯中科,建議關注寒武紀、景嘉微、軟通動力;2)算法方面,推薦科大訊飛;3)應用場景方面,強烈推薦中科創達、恒生電子、盛視科技,推薦金山辦公,建議關注萬興科技、福昕軟件、同花順、彩訊股份;4)網絡安全方面,強烈推薦啟明星辰。

以車會友更多>>

鳴潮×水月雨聯動U.C.T.S.耳夾式藍牙耳機上架,299元 官宣!追覓科技攜手央視春晚,春晚同款掃地機獻禮全球華人 內存價格狂飆不止!手機、PC等廠商面臨至暗時刻 消息稱OPPO Find N6手機內置6K級電池,大概率春節后登場 6.32英寸小鋼炮來襲:一加15T入網搭載驍龍8 Elite Gen5,3月見 iPhone 17e或2月發布,起售價預計4499元 抖音:將加大對不實信息、網絡暴力等問題的治理力度 京東外賣加熱餐箱擴大覆蓋11城,科技升溫20°C,全職騎手免費配! 2025 ACM Fellow公布!陳寶權、賈佳亞、梅濤、朱軍等多位華人入選 我學者提出新型量子磁傳感器方案 499元鼠標,雙芯旗艦有啥不一樣? 紅魔11 Air:AI游戲圈搜,哪里不會圈哪里? iPhone18 Pro再次被確認:實體壓感按鍵+單挖孔屏,這次真的變了 精準卡位大廠盲區,小眾App悶聲賺大錢 馬斯克最大算力中心建成了:全球首個GW級超算集群,再創世界紀錄 貴州銀行:以自身信用承接19億存款,信托化險突然受寵 零刻ME Pro:零基礎的小白也能輕松上手 胡馨心確認:REDMI Turbo 5系列能吃上國補 IDC:2025年全球智能手機出貨量達12.6億部,蘋果連續三年第一 IDC:2025全球智能手機出貨12.6億部,蘋果連續三年第一,華為國內登頂 “死了么”APP爆火與改名:照見獨居人群的鏡子 AP2O-Coder 讓大模型擁有「錯題本」,像人類一樣按題型高效刷題 2025開年手機大戰打響!榮耀、一加新機曝光,誰才是真香之選? 本月兩款國產超薄機型問世 榮耀VS聯想moto 你支持誰? 紅米Turbo5 Max!這名字了不得 摩托羅拉新機來了,手寫筆成主角,安卓生態要變天? 摩托羅拉MotoWatch智能手表、Moto Tag 2智能追蹤器渲染圖曝光 全面盤點!一文看懂蘋果2025年發布的超16款新品 華為手機別瞎用!8個設置一關,立馬絲滑到飛起! 10萬級純電SUV二選一,歐拉5與深藍S05誰更能吸引年輕人?
主站蜘蛛池模板: 成人在线免费观看视频 | 在线看亚洲 | 色婷婷中文 | 四虎av在线播放 | 欧美精品国产 | 夜夜爱爱 | 日韩一区二区三区中文字幕 | 久久久久久99 | 91免费在线看片 | 免费成年人视频在线观看 | 人成在线视频 | 99re在线观看 | 久久成年视频 | 99热国内精品 | caoporn91| 欧美三级小视频 | 91麻豆精品一二三区在线 | 魔性的诱惑 | 国产精品久久久久蜜臀 | 国产精品国产三级国产aⅴ无密码 | 国产视频精品在线 | 97视频免费在线观看 | 国产中文av在线 | 自拍色图| 伊人久久久久久久久久 | 欧美日韩系列 | 伊人蕉久影院 | 久久国产秒 | 国产一线在线观看 | 色中色综合网 | a级网站在线观看 | 欧美激情视频在线 | 蜜桃视频久久 | 亚洲一区二区三区中文字幕 | 中文精品一区 | 久久熟| 欧美日韩在线一区二区 | 欧美国产在线观看 | 杨钰莹一级淫片aaaaaa播放 | 美日韩三级 | 免费黄色一级 |